گوگل با معرفی دو مدل صوتی نوین به نام‌های Gemini 3.8 Flash TTS و ۳٫۸ Flash-Lite TTS، گام بزرگی در زمینه تبدیل متن به گفتار برداشته است. این فناوری‌های پیشرفته به کاربران امکان می‌دهند تا با وارد کردن متن، صداهایی کاملاً طبیعی و با احساسات و لحن دلخواه تولید کنند و دیالوگ‌ها را با دقت یک کارگردان حرفه‌ای مدیریت نمایند. این ابزارها به صورت مستقیم در سرویس‌هایی مانند Gemini Notebook و Google Vids ادغام شده‌اند.

مدل Gemini 3.8 Flash TTS به طور خاص برای کاربردهای خلاقانه و صداپیشگی طراحی شده است. کاربران می‌توانند با دستورات متنی ساده، صداهای جدیدی خلق کرده و از آنها در ساخت بازی‌های ویدئویی، کتاب‌های صوتی و پادکست‌ها بهره‌برداری کنند. این مدل امکان تغییر ریتم بیان، احساسات و لحن صدا را در هر جمله فراهم می‌آورد.

در مقابل، مدل Gemini 3.8 Flash-Lite TTS برای پروژه‌های بزرگ با حجم بالا و نیاز به صرفه اقتصادی بهینه شده دانلود آهنگ جدید است. این مدل گزینه‌ای ایده‌آل برای دوبله‌های گسترده، تولید محتوای انبوه و ساخت دستیارهای صوتی به شمار می‌رود.

ویژگی‌های برجسته تبدیل متن به گفتار در جمینای ۳٫۸ Flash TTS

فناوری جدید گوگل محدودیت صداهای تکراری و از پیش تعیین‌شده را از بین برده است. در مدل Gemini 3.8 Flash TTS، کاربران می‌توانند با نوشتن متن، جنسیت، نقش و لهجه صدا را در بیش از ۱۰۰ زبان و گویش مختلف تولید کنند. طیف وسیعی از صداها در این مدل موجود است، از صدای پرانرژی یک مجری رادیویی گرفته تا کاراکترهای انیمیشنی.

علاوه بر این، بیش از ۲۰۰۰ صدای آماده در این پلتفرم در دسترس است. اگر مایل به شبیه‌سازی صدای خود هستید، تنها کافی است یک نمونه صوتی ۳۰ ثانیه‌ای را بارگذاری کنید تا پروفایل صدای شما با دقت بالا بازسازی شود. قابلیت ریمیکس صدا نیز به زودی اضافه خواهد شد تا بتوانید میزان زیر و بمی، سرعت و لحن صداها را با یک متن ساده تنظیم کنید.

کنترل صدا در این مدل‌ها شبیه به کارگردانی یک نمایش واقعی است. شما می‌توانید در متن مشخص کنید که گوینده در چه زمانی آرام صحبت کند، چه زمانی نجوا کند و چه زمانی هیجان‌زده شود. این سیستم در تولید فایل‌های صوتی طولانی مانند پادکست‌ها، یکدستی و کیفیت صدا را حفظ می‌کند. همچنین، امکان ساخت مکالمه همزمان بین دو کاراکتر وجود دارد و واکنش‌های انسانی نظیر خندیدن، نفس عمیق کشیدن، آه کشیدن و اصوات بین کلامی (مانند «بله» یا «آهان») به شکلی باورپذیر اجرا می‌شوند.

این ابزارها در بررسی‌های تخصصی نیز عملکرد درخشانی از خود نشان داده‌اند. مدل Gemini 3.8 Flash TTS رتبه نخست بنچمارک Hume AI را در زمینه طراحی صدا و شبیه‌سازی لهجه کسب کرده است. همچنین در ارزیابی‌های ترجیح شنیداری پلتفرم Voice Arena، این مدل‌ها در میان زبان‌های مطرح جهانی جایگاه‌های برتر را به خود اختصاص داده‌اند.

برای جلوگیری از سوءاستفاده و حفظ حقوق هنرمندان، سازوکارهای امنیتی سخت‌گیرانه‌ای در نظر گرفته شده است. برای شبیه‌سازی صدا، کاربر باید رضایت شفاهی صاحب صدا را ضبط و بارگذاری کند تا با فایل اصلی تطبیق داده شود. تمامی فایل‌های صوتی تولیدشده نیز به واترمارک صوتی نامحسوس فناوری SynthID مجهز هستند و اطلاعات هویتی استاندارد C2PA را دارند تا غیرواقعی بودن صداها قابل پیگیری باشد.

این مدل‌ها هم‌اکنون از طریق Google AI Studio و Gemini API برای توسعه‌دهندگان، و در ابزارهایی مانند Gemini Notebook و Google Vids برای عموم در دسترس قرار دارند.