گوگل از مدلهای صوتی جدید Gemini برای تبدیل متن به صدا رونمایی کرد!
گوگل از Gemini 3.8 Flash TTS و Flash-Lite TTS رونمایی کرد؛ مدلهایی برای ساخت صدای طبیعی با کنترل دقیق روی لحن، احساسات، لهجه، سرعت و گفتوگوی چندگوینده.

گوگل از دو مدل جدید تبدیل متن به گفتار با نامهای Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS رونمایی کرده است؛ مدلهایی که کنترل بسیار بیشتری روی نحوه بیان، لحن و اجرای صدا در اختیار کاربران قرار میدهند.
Gemini 3.8 Flash TTS برای تولید صداهای باکیفیت و اجرای حرفهای طراحی شده و امکان ساخت صداهای سفارشی از طریق دستورات متنی را فراهم میکند. کاربران میتوانند ویژگیهایی مانند نقش، لهجه و شخصیت صوتی را مشخص کنند و حتی صداهای جدیدی برای کاراکترهای مختلف بسازند.
یکی از قابلیتهای مهم این مدلها، کنترل دقیق نحوه اجرای دیالوگهاست. میتوان سرعت صحبت کردن، لحن، احساسات، لهجه و نحوه اجرای هر جمله را مشخص کرد. حتی رویدادهایی مانند خنده، آه، نفس کشیدن و مکث نیز قابل کنترل هستند.
مدلهای جدید Gemini امکان تولید گفتوگوهای چندگوینده را نیز دارند و میتوان اجرای دیالوگ را خطبهخط هدایت کرد؛ قابلیتی که میتواند برای ساخت پادکست، کتاب صوتی، دوبله، بازی و محتوای ویدیویی کاربرد داشته باشد.
از نظر زبان نیز این مدلها پوشش گستردهای دارند. Gemini 3.8 Flash TTS از ۱۳۰ زبان و Gemini 3.8 Flash-Lite TTS از ۱۰۱ زبان پشتیبانی میکند و زبان ورودی را بهصورت خودکار تشخیص میدهد.
نسخه Flash-Lite بیشتر برای تولید حجم بالای محتوای صوتی، تأخیر کمتر و استفادههای مقیاسپذیر طراحی شده، در حالی که نسخه Flash TTS روی کیفیت صدا، اجرای احساسی، لهجهها و پروژههای پیچیدهتر تمرکز دارد.
گوگل همچنین قابلیت Voice Replication را ارائه کرده است که امکان بازسازی پروفایل صوتی از یک نمونه صوتی را فراهم میکند. این قابلیت همراه با سازوکارهای تأیید رضایت و محافظت از صدای افراد ارائه شده است.
برای شفافیت و تشخیص محتوای تولیدشده توسط هوش مصنوعی نیز تمامی فایلهای صوتی تولیدشده توسط مدلهای صوتی Gemini به SynthID مجهز میشوند؛ یک واترمارک نامحسوس که مستقیماً در خروجی صوتی قرار میگیرد.






گفتگو و سوالات شما
۰در این قسمت میتوانید سوال یا نظر خود در مورد مقاله را مطرح کنید.
برای ثبت دیدگاه ابتدا وارد شوید
ورود به حسابهنوز دیدگاهی ثبت نشده. اولین نفر باشید!