h.sحمید سامیر
همهٔ خبرها

گوگل دو مدل صوتی Gemini 3.8 Flash TTS را معرفی کرد

گوگل مدل‌های Flash TTS و Flash-Lite TTS را برای تولید گفتار خلاقانه و پردازش صوتی پرتعداد عرضه کرده است؛ همراه با بیش از ۲ هزار صدای آماده، کنترل متنی صدا و سازوکارهای ایمنی.

گوگل از دو مدل تخصصی تولید گفتار با نام‌های Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS رونمایی کرده است. طبق گزارش AI News، مدل نخست برای کاربردهایی مانند سرگرمی تعاملی، بازی‌سازی و روایت‌های طولانی طراحی شده و نسخه Lite بر دوبله خودکار، عامل‌های مکالمه‌ای و ترجمه پرتعداد تمرکز دارد.

این مدل‌ها به فهرستی شامل بیش از ۲ هزار پروفایل صوتی در بیش از ۱۰۰ زبان دسترسی دارند؛ از جمله گونه‌هایی مانند فرانسوی کبکی، انگلیسی اسکاتلندی و اسپانیایی مکزیکی. گوگل همچنین از قابلیت آینده‌ای برای تغییر رنگ صدا، زیر و بمی، سرعت و لهجه با دستور متنی خبر داده است.

بر پایه نتایج نقل‌شده از آزمون‌های Hume AI، مدل Flash TTS امتیاز کلی ۷۱٫۴ و امتیاز ۶۰٫۸ در مدل‌سازی لهجه گرفته است. گزارش می‌گوید دو مدل جدید در شاخص کیفیت کلی Hume به رتبه‌های اول و دوم رسیده‌اند؛ با این حال این اعداد متعلق به همان ارزیابی‌ها هستند و نباید به‌عنوان برتری قطعی در همه کاربردها تعبیر شوند.

قابلیت‌های تولید شامل گفت‌وگوی دو گوینده، حفظ ثبات صدا در فایل‌های چندساعته و افزودن نشانه‌هایی مانند خنده، آه و مکث به متن است. برای شبیه‌سازی صدا، گوگل یک نمونه ۳۰ ثانیه‌ای همراه با رضایت شفاهی صاحب صدا می‌خواهد. خروجی‌ها نیز به واترمارک نامحسوس SynthID و فراداده منشأ C2PA مجهز می‌شوند.

توسعه‌دهندگان می‌توانند از طریق Google AI Studio و Gemini API به این مدل‌ها دسترسی داشته باشند. Flash TTS در Gemini Notebook و Flash-Lite TTS در Google Vids نیز عرضه می‌شود و دسترسی مدیریتی مشتریان Gemini Enterprise برای مرحله‌ای بعدی اعلام شده است.

Backlit keyboard accompanying the report on Google voice models
Backlit keyboard accompanying the report on Google voice models

منبع: AI News