گوگل با معرفی دو مدل صوتی نوین به نامهای Gemini 3.8 Flash TTS و ۳٫۸ Flash-Lite TTS، گام بزرگی در زمینه تبدیل متن به گفتار برداشته است. این فناوریهای پیشرفته به کاربران امکان میدهند تا با وارد کردن متن، صداهایی کاملاً طبیعی و با احساسات و لحن دلخواه تولید کنند و دیالوگها را با دقت یک کارگردان حرفهای مدیریت نمایند. این ابزارها به صورت مستقیم در سرویسهایی مانند Gemini Notebook و Google Vids ادغام شدهاند.
مدل Gemini 3.8 Flash TTS به طور خاص برای کاربردهای خلاقانه و صداپیشگی طراحی شده است. کاربران میتوانند با دستورات متنی ساده، صداهای جدیدی خلق کرده و از آنها در ساخت بازیهای ویدئویی، کتابهای صوتی و پادکستها بهرهبرداری کنند. این مدل امکان تغییر ریتم بیان، احساسات و لحن صدا را در هر جمله فراهم میآورد.
در مقابل، مدل Gemini 3.8 Flash-Lite TTS برای پروژههای بزرگ با حجم بالا و نیاز به صرفه اقتصادی بهینه شده دانلود آهنگ جدید است. این مدل گزینهای ایدهآل برای دوبلههای گسترده، تولید محتوای انبوه و ساخت دستیارهای صوتی به شمار میرود.
ویژگیهای برجسته تبدیل متن به گفتار در جمینای ۳٫۸ Flash TTS
فناوری جدید گوگل محدودیت صداهای تکراری و از پیش تعیینشده را از بین برده است. در مدل Gemini 3.8 Flash TTS، کاربران میتوانند با نوشتن متن، جنسیت، نقش و لهجه صدا را در بیش از ۱۰۰ زبان و گویش مختلف تولید کنند. طیف وسیعی از صداها در این مدل موجود است، از صدای پرانرژی یک مجری رادیویی گرفته تا کاراکترهای انیمیشنی.
علاوه بر این، بیش از ۲۰۰۰ صدای آماده در این پلتفرم در دسترس است. اگر مایل به شبیهسازی صدای خود هستید، تنها کافی است یک نمونه صوتی ۳۰ ثانیهای را بارگذاری کنید تا پروفایل صدای شما با دقت بالا بازسازی شود. قابلیت ریمیکس صدا نیز به زودی اضافه خواهد شد تا بتوانید میزان زیر و بمی، سرعت و لحن صداها را با یک متن ساده تنظیم کنید.
کنترل صدا در این مدلها شبیه به کارگردانی یک نمایش واقعی است. شما میتوانید در متن مشخص کنید که گوینده در چه زمانی آرام صحبت کند، چه زمانی نجوا کند و چه زمانی هیجانزده شود. این سیستم در تولید فایلهای صوتی طولانی مانند پادکستها، یکدستی و کیفیت صدا را حفظ میکند. همچنین، امکان ساخت مکالمه همزمان بین دو کاراکتر وجود دارد و واکنشهای انسانی نظیر خندیدن، نفس عمیق کشیدن، آه کشیدن و اصوات بین کلامی (مانند «بله» یا «آهان») به شکلی باورپذیر اجرا میشوند.
این ابزارها در بررسیهای تخصصی نیز عملکرد درخشانی از خود نشان دادهاند. مدل Gemini 3.8 Flash TTS رتبه نخست بنچمارک Hume AI را در زمینه طراحی صدا و شبیهسازی لهجه کسب کرده است. همچنین در ارزیابیهای ترجیح شنیداری پلتفرم Voice Arena، این مدلها در میان زبانهای مطرح جهانی جایگاههای برتر را به خود اختصاص دادهاند.
برای جلوگیری از سوءاستفاده و حفظ حقوق هنرمندان، سازوکارهای امنیتی سختگیرانهای در نظر گرفته شده است. برای شبیهسازی صدا، کاربر باید رضایت شفاهی صاحب صدا را ضبط و بارگذاری کند تا با فایل اصلی تطبیق داده شود. تمامی فایلهای صوتی تولیدشده نیز به واترمارک صوتی نامحسوس فناوری SynthID مجهز هستند و اطلاعات هویتی استاندارد C2PA را دارند تا غیرواقعی بودن صداها قابل پیگیری باشد.
این مدلها هماکنون از طریق Google AI Studio و Gemini API برای توسعهدهندگان، و در ابزارهایی مانند Gemini Notebook و Google Vids برای عموم در دسترس قرار دارند.