Gemini 3.8 Flash TTS وFlash-Lite TTS يوفران التحكم الصوتي الفوري
تطلق Google Gemini 3.8 Flash TTS وFlash-Lite TTS، ونماذج معبرة لتحويل النص إلى كلام مع تصميم صوتي سريع الاستجابة، وأكثر من 2000 صوت، وأكثر من 100 لغة.

لقد شحنت جوجل Gemini 3.8 Flash TTS وGemini 3.8 Flash-Lite TTS، نموذجان جديدان لتحويل النص إلى كلام في عائلة Gemini Audio. تسميهم Google نماذج توليد الصوت الأكثر تعبيرًا حتى الآن. يستهدف Flash TTS التوجيه الإبداعي وأصوات الشخصيات. يستهدف Flash-Lite TTS الإنتاج بكميات كبيرة وفعال من حيث التكلفة. كلاهما يتيح للمطورين توجيه التسليم سطرًا تلو الآخر باستخدام اللغة الطبيعية.
هل هي قابلة للنشر؟ نعم، يتم طرح كلا النموذجين الآن من خلال الجوزاء API و استوديو جوجل للذكاء الاصطناعي. الوصول هو API فقط، بدون أوزان مفتوحة للاستضافة الذاتية. الوصول إلى واجهة برمجة تطبيقات المؤسسة عبر مؤسسة الجوزاء تم إدراجه قريبًا.
ما شحنته جوجل
يقسم الإصدار تحويل النص إلى كلام (TTS) إلى مستويين مع عناصر تحكم مشتركة في الاتجاه:
- الجوزاء 3.8 فلاش تحويل النص إلى كلام تم تصميمه للتوجيه الإبداعي العميق وتصميم الشخصيات. تشمل الاستخدامات المستهدفة الألعاب والكتب الصوتية الغامرة والبودكاست والوسائط التفاعلية. فهو يوفر تحكمًا دقيقًا في إشارات التمثيل والسرعة وتحولات اللهجة والقنوات الخلفية.
- الجوزاء 3.8 فلاش لايت TTS تم تصميمه خصيصًا للكميات الكبيرة والفعالة من حيث التكلفة. تقوم Google بوضعه في الدبلجة وإنشاء المحتوى الصوتي ووكلاء الصوت التعبيريين. فهو يوفر تحكمًا دقيقًا في النغمة والإيقاع والفروق الدقيقة في التعبير.
في AI Studio، تستخدم روابط الملعب معرفات النموذج gemini-3.8-flash-tts و gemini-3.8-flash-lite-tts.
التصميم الصوتي من موجه النص
- التصميم الصوتي التوليدي: يقوم Flash TTS بإنشاء أصوات جديدة من المطالبات التي تصف الدور واللهجة وخصائص الصوت. يعمل هذا عبر أكثر من 100 لغة ولهجة. تشتمل العروض التوضيحية التي تقدمها Google على DJ ملبورن، وروبوت رتيب، وتنين ياباني.
- المكتبة الصوتية: يحصل المطورون على أكثر من 2000 صوت جاهز للإنتاج. تشمل التغطية الأصناف الإقليمية مثل الإسبانية المكسيكية والفرنسية كيبيك والإنجليزية الاسكتلندية.
- الحفظ والقياس: يمكن حفظ الأصوات المخصصة وإعادة استخدامها، مع الحد الأدنى من الانجراف عبر المشاريع.
- إعادة مزج الصوت (قريبا): سيقوم المستخدمون بضبط جرس صوت المكتبة وطبقة الصوت والوتيرة واللهجة من خلال المطالبات.
توجيه الأداء
يقبل كلا النموذجين توجيهات المسرح المكتوبة في النص. يمكن لـ Gemini أيضًا توجيه التسليم من إشارات النص الطبيعية.
- توليد المقاطع: استمرار جودة الصوت وإيقاعه ونبرته على مدار ساعات الصوت باستمرار دون انقطاع.
- أخرج أصلي بمتحدثَين: يمكن لنص واحد أن يقود التغيير المتعدد الأصوات متمايزة ومنفصلة عن بعضها.
- الانفجارات الصوتية: الإشارات غير اللفظية مثل
<laughs>,<sigh>و<gasp>إضافة نسيج المحادثة. - التحويل العكسي: مداخلات الاستماع النشط مثل
|mhm|و|yeah|السيطرة على نبضات رد الفعل والتوقيت الكوميدي.
استنساخ الصوت وضوابط الأمان
يعتمد استنساخ الصوت على بناء ملف صوتي متسلقًا من الابتكار الصوتي مدتها 30 ثانية. ويشترط أن تكون هذه العينة لصوتك أنت أو لصوت تملك حق استخدامه. كما تتطلب الاستنساخ تسجيلًا صوتيًا للموافقة على الصريحة من صاحب الصوت، تتم بما يتوافق معه مع المرجعي.
تم تسجيل كل القسم من نماذج Gemini Audio علامة مائية من نوع SynthID. والعلامة غير المحسوسة حاسوب المخرج الداخلي الصوتي. أما الآلات المستنسخة فتحمل أيضًا بيانات الاعتماد وفقًا للمعايير C2PA. ولنا أن تأخذ على عاتقها الأمان الأوسع، يُشار إلى نموذج بطاقة Gemini 3.8 Audio.
النتائج المعيارية
وهذه النتائج هي النتائج عن النتائج الجديدة:
- معيار هيوم AI Voice Design Benchmark: يتصدر Flash TTS الترتيب العام في المركز الأول ووصل إلى 71.4، وفق هيوم AI.
- اعتماد اللهجات: يأتي Flash TTS في ما بعد 60.8.
- مؤشر الجودة العام من هيوم AI: يحل Flash TTS في المركز الأول بينما يأتي Flash-Lite TTS في المركز الثاني.
- الساحة الصوتية التفضيل الأعمى: ويحتل كلا الطرازين أعلى المراكز في اللغات اليابانية والبرتغالية البرازيلية والفيتنامية والعربية الفصحى الحديثة والإسبانية المكسيكية والهندية.
الوجبات السريعة الرئيسية
- أطلقت Google برنامج Gemini 3.8 Flash TTS للعمل الإبداعي وبرنامج Flash-Lite TTS لتوسيع نطاق العمل.
- يقوم Flash TTS بتصميم أصوات جديدة من خلال المطالبات عبر أكثر من 100 لغة ولهجة.
- يحصل المطورون على أكثر من 2000 صوت إنتاجي، مقارنة بـ 30 صوتًا أصليًا.
- يحتاج النسخ الصوتي إلى عينة مدتها 30 ثانية بالإضافة إلى تسجيل موافقة مطابق.
- يحتل Flash TTS المرتبة الأولى في معيار التصميم الصوتي لشركة Hume AI بحصوله على 71.4.
التعليمات
- ما هو الجوزاء 3.8 فلاش تحويل النص إلى كلام؟ إنه نموذج Google لتحويل النص إلى كلام للتصميم الصوتي الإبداعي وتوجيه الأداء سطرًا تلو الآخر. وهو متاح من خلال Gemini API وGoogle AI Studio.
- كيف يختلف Flash-Lite TTS؟ تم تحسين Flash-Lite TTS لأحمال العمل ذات الحجم الكبير والفعالة من حيث التكلفة مثل الدبلجة ووكلاء الصوت. وهي تحتل المرتبة الثانية في مؤشر الجودة الشاملة لشركة Hume AI.
- هل يمكنني استنساخ صوتي؟ نعم، مع عينة مدتها 30 ثانية وتسجيل الموافقة الشفهية. إنه غير متوفر في AI Studio في العديد من المناطق، بما في ذلك المملكة المتحدة والمنطقة الاقتصادية الأوروبية والهند.
Google has shipped Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS, 2 new text-to-speech models in its Gemini Audio family. Google calls them its most expressive audio generation models yet. Flash TTS targets creative direction and character voices. Flash-Lite TTS targets high-volume, cost-efficient production. Both let developers direct delivery line by line using natural language.
Is it deployable? Yes, both models are rolling out now through the Gemini API and Google AI Studio. Access is API-only, with no open weights for self-hosting. Enterprise API access via Gemini Enterprise is listed as coming soon.
What Google Shipped
The release splits TTS into 2 tiers with shared direction controls:
- Gemini 3.8 Flash TTS is built for deep creative direction and character design. Target uses include gaming, immersive audiobooks, podcasts and interactive media. It offers granular control over acting cues, pacing, dialect shifts and backchanneling.
- Gemini 3.8 Flash-Lite TTS is built for high-volume, cost-efficient scale. Google positions it for dubbing, audio content creation and expressive voice agents. It offers fine-grained control over tone, pacing and expressive nuance.
In AI Studio, the playground links use the model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts.
Voice Design From a Text Prompt
- Generative voice design: Flash TTS creates new voices from prompts describing role, accent and voice characteristics. This works across more than 100 languages and dialects. Google’s demos include a Melbourne DJ, a monotone robot and a Japanese dragon.
- Voice library: Developers get 2,000+ production-ready voices. Coverage includes regional varieties like Mexican Spanish, Quebec French and Scots English.
- Save and scale: Custom voices can be saved and reused, with minimal drift across projects.
- Voice remixing (coming soon): Users will adjust a library voice’s timbre, pitch, pace and accent through prompts.
Directing the Performance
Both models accept stage directions written in the script. Gemini can also steer delivery from natural script cues.
- توليد المقاطع الطويلة: تبقى جودة الصوت وإيقاعه ونبرته ثابتة على مدار ساعات من الصوت المتواصل دون انقطاع.
- إخراج أصلي بمتحدثَين: يمكن لنص واحد أن يقود محادثة متعددة الأدوار بأصوات متمايزة ومنفصلة عن بعضها.
- Vocal bursts: Non-verbal cues like
<laughs>,<sigh>and<gasp>add conversational texture. - Backchanneling: Active-listening interjections like
|mhm|and|yeah|control reaction beats and comedic timing.
استنساخ الصوت وضوابط الأمان
يعتمد استنساخ الصوت على بناء ملف صوتي متسق انطلاقًا من عينة صوتية مدتها 30 ثانية. ويشترط أن تكون هذه العينة لصوتك أنت أو لصوت تملك حق استخدامه. كما تتطلب عملية الاستنساخ تسجيلًا صوتيًا للموافقة الصريحة من صاحب الصوت، تتم مطابقته مع المتحدث المرجعي.
يحمل كل مقطع صادر عن نماذج Gemini Audio علامة مائية من نوع SynthID. وهذه العلامة غير المحسوسة مدمجة مباشرةً داخل المخرجات الصوتية. أما الأصوات المستنسخة فتحمل أيضًا بيانات اعتماد المحتوى وفق معيار C2PA. وللاطلاع على منهجية الأمان الأوسع، يُشار إلى بطاقة نموذج Gemini 3.8 Audio.
Benchmark Results
وهذه هي النتائج المعلنة عن النماذج الجديدة:
- معيار Hume AI Voice Design Benchmark: يتصدر Flash TTS الترتيب العام في المركز الأول بنتيجة بلغت 71.4، وفق Hume AI.
- نمذجة اللهجات: يأتي Flash TTS في الصدارة بنتيجة قدرها 60.8.
- مؤشر الجودة العام من Hume AI: يحل Flash TTS في المركز الأول بينما يأتي Flash-Lite TTS في المركز الثاني.
- Voice Arena blind preference: Both models take top positions in Japanese, Brazilian Portuguese, Vietnamese, Modern Standard Arabic, Mexican Spanish and Hindi.
Key Takeaways
- Google launched Gemini 3.8 Flash TTS for creative work and Flash-Lite TTS for scale.
- Flash TTS designs new voices from prompts across 100+ languages and dialects.
- Developers get 2,000+ production voices, up from 30 originals.
- Voice replication needs a 30-second sample plus a matching consent recording.
- Flash TTS ranks #1 on Hume AI’s Voice Design Benchmark with 71.4.
FAQ
- What is Gemini 3.8 Flash TTS? It is Google’s text-to-speech model for creative voice design and line-by-line performance direction. It is available through the Gemini API and Google AI Studio.
- How is Flash-Lite TTS different? Flash-Lite TTS is optimized for high-volume, cost-efficient workloads like dubbing and voice agents. It ranks #2 on Hume AI’s Overall Quality Index.
- Can I clone my own voice? Yes, with a 30-second sample and a verbal consent recording. It is unavailable in AI Studio in several regions, including the UK, EEA and India.
عبدالرحمن ربيع
Software Engineer & AI Builder
مطور برمجيات متكامل ومصمم جرافيك مع أكثر من 4 سنوات خبرة في بناء تطبيقات الويب الحديثة باستخدام PHP و JavaScript و HTML و CSS. خلفية قوية في تصميم UI/UX واستخدام متقدم لأدوات الذكاء الاصطناعي لتعزيز كفاءة التطوير والأتمتة واتخاذ القرارات. حاصل على ماجستير تنفي...
وسوم المقال
مصادر وروابط خارجية
مقالات ذات صلة
يضيف Fast Excel 5.x عمليات استيراد متدفقة وصادرات أكثر أمانًا - وهو إجراء عملي...
اقرأ المقال
دليل مبسط: بحث في امن المعلومات و التهديدات الأمنية والهجمات الالكت...
اقرأ المقال
دليل خطوة بخطوة: تثبيت Laravel 11 باستخدام Composer
اقرأ المقال
Abdelrhman Rabea

التعليقات (0)
كن أول من يعلّق على هذا المقال.