گوگل دو مدل صوتی Gemini 3.8 Flash TTS را معرفی کرد
گوگل مدلهای Flash TTS و Flash-Lite TTS را برای تولید گفتار خلاقانه و پردازش صوتی پرتعداد عرضه کرده است؛ همراه با بیش از ۲ هزار صدای آماده، کنترل متنی صدا و سازوکارهای ایمنی.
گوگل از دو مدل تخصصی تولید گفتار با نامهای Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS رونمایی کرده است. طبق گزارش AI News، مدل نخست برای کاربردهایی مانند سرگرمی تعاملی، بازیسازی و روایتهای طولانی طراحی شده و نسخه Lite بر دوبله خودکار، عاملهای مکالمهای و ترجمه پرتعداد تمرکز دارد.
این مدلها به فهرستی شامل بیش از ۲ هزار پروفایل صوتی در بیش از ۱۰۰ زبان دسترسی دارند؛ از جمله گونههایی مانند فرانسوی کبکی، انگلیسی اسکاتلندی و اسپانیایی مکزیکی. گوگل همچنین از قابلیت آیندهای برای تغییر رنگ صدا، زیر و بمی، سرعت و لهجه با دستور متنی خبر داده است.
بر پایه نتایج نقلشده از آزمونهای Hume AI، مدل Flash TTS امتیاز کلی ۷۱٫۴ و امتیاز ۶۰٫۸ در مدلسازی لهجه گرفته است. گزارش میگوید دو مدل جدید در شاخص کیفیت کلی Hume به رتبههای اول و دوم رسیدهاند؛ با این حال این اعداد متعلق به همان ارزیابیها هستند و نباید بهعنوان برتری قطعی در همه کاربردها تعبیر شوند.
قابلیتهای تولید شامل گفتوگوی دو گوینده، حفظ ثبات صدا در فایلهای چندساعته و افزودن نشانههایی مانند خنده، آه و مکث به متن است. برای شبیهسازی صدا، گوگل یک نمونه ۳۰ ثانیهای همراه با رضایت شفاهی صاحب صدا میخواهد. خروجیها نیز به واترمارک نامحسوس SynthID و فراداده منشأ C2PA مجهز میشوند.
توسعهدهندگان میتوانند از طریق Google AI Studio و Gemini API به این مدلها دسترسی داشته باشند. Flash TTS در Gemini Notebook و Flash-Lite TTS در Google Vids نیز عرضه میشود و دسترسی مدیریتی مشتریان Gemini Enterprise برای مرحلهای بعدی اعلام شده است.

منبع: AI News