Gemini 3.8 Flash TTS and Flash-Lite TTS Bring Prompt-Driven Voice
JOURNAL INDEX
الذكاء الاصطناعي/2026.09.24/14 VIEWS/5 MIN READ

Gemini 3.8 Flash TTS وFlash-Lite TTS يوفران التحكم الصوتي الفوري

عبدالرحمن ربيع
عبدالرحمن ربيع Software Engineer & AI Builder

تطلق Google Gemini 3.8 Flash TTS وFlash-Lite TTS، ونماذج معبرة لتحويل النص إلى كلام مع تصميم صوتي سريع الاستجابة، وأكثر من 2000 صوت، وأكثر من 100 لغة.

Gemini 3.8 Flash TTS وFlash-Lite TTS يوفران التحكم الصوتي الفوري

لقد شحنت جوجل Gemini 3.8 Flash TTS وGemini 3.8 Flash-Lite TTS، نموذجان جديدان لتحويل النص إلى كلام في عائلة Gemini Audio. تسميهم Google نماذج توليد الصوت الأكثر تعبيرًا حتى الآن. يستهدف Flash TTS التوجيه الإبداعي وأصوات الشخصيات. يستهدف Flash-Lite TTS الإنتاج بكميات كبيرة وفعال من حيث التكلفة. كلاهما يتيح للمطورين توجيه التسليم سطرًا تلو الآخر باستخدام اللغة الطبيعية.

هل هي قابلة للنشر؟ نعم، يتم طرح كلا النموذجين الآن من خلال الجوزاء API و استوديو جوجل للذكاء الاصطناعي. الوصول هو API فقط، بدون أوزان مفتوحة للاستضافة الذاتية. الوصول إلى واجهة برمجة تطبيقات المؤسسة عبر مؤسسة الجوزاء تم إدراجه قريبًا.

ما شحنته جوجل

يقسم الإصدار تحويل النص إلى كلام (TTS) إلى مستويين مع عناصر تحكم مشتركة في الاتجاه:

  • الجوزاء 3.8 فلاش تحويل النص إلى كلام تم تصميمه للتوجيه الإبداعي العميق وتصميم الشخصيات. تشمل الاستخدامات المستهدفة الألعاب والكتب الصوتية الغامرة والبودكاست والوسائط التفاعلية. فهو يوفر تحكمًا دقيقًا في إشارات التمثيل والسرعة وتحولات اللهجة والقنوات الخلفية.
  • الجوزاء 3.8 فلاش لايت TTS تم تصميمه خصيصًا للكميات الكبيرة والفعالة من حيث التكلفة. تقوم Google بوضعه في الدبلجة وإنشاء المحتوى الصوتي ووكلاء الصوت التعبيريين. فهو يوفر تحكمًا دقيقًا في النغمة والإيقاع والفروق الدقيقة في التعبير.

في AI Studio، تستخدم روابط الملعب معرفات النموذج gemini-3.8-flash-tts و gemini-3.8-flash-lite-tts.

التصميم الصوتي من موجه النص

  • التصميم الصوتي التوليدي: يقوم Flash TTS بإنشاء أصوات جديدة من المطالبات التي تصف الدور واللهجة وخصائص الصوت. يعمل هذا عبر أكثر من 100 لغة ولهجة. تشتمل العروض التوضيحية التي تقدمها Google على DJ ملبورن، وروبوت رتيب، وتنين ياباني.
  • المكتبة الصوتية: يحصل المطورون على أكثر من 2000 صوت جاهز للإنتاج. تشمل التغطية الأصناف الإقليمية مثل الإسبانية المكسيكية والفرنسية كيبيك والإنجليزية الاسكتلندية.
  • الحفظ والقياس: يمكن حفظ الأصوات المخصصة وإعادة استخدامها، مع الحد الأدنى من الانجراف عبر المشاريع.
  • إعادة مزج الصوت (قريبا): سيقوم المستخدمون بضبط جرس صوت المكتبة وطبقة الصوت والوتيرة واللهجة من خلال المطالبات.

توجيه الأداء

يقبل كلا النموذجين توجيهات المسرح المكتوبة في النص. يمكن لـ Gemini أيضًا توجيه التسليم من إشارات النص الطبيعية.

  • توليد المقاطع: استمرار جودة الصوت وإيقاعه ونبرته على مدار ساعات الصوت باستمرار دون انقطاع.
  • أخرج أصلي بمتحدثَين: يمكن لنص واحد أن يقود التغيير المتعدد الأصوات متمايزة ومنفصلة عن بعضها.
  • الانفجارات الصوتية: الإشارات غير اللفظية مثل <laughs>, <sigh> و <gasp> إضافة نسيج المحادثة.
  • التحويل العكسي: مداخلات الاستماع النشط مثل |mhm| و |yeah| السيطرة على نبضات رد الفعل والتوقيت الكوميدي.

استنساخ الصوت وضوابط الأمان

يعتمد استنساخ الصوت على بناء ملف صوتي متسلقًا من الابتكار الصوتي مدتها 30 ثانية. ويشترط أن تكون هذه العينة لصوتك أنت أو لصوت تملك حق استخدامه. كما تتطلب الاستنساخ تسجيلًا صوتيًا للموافقة على الصريحة من صاحب الصوت، تتم بما يتوافق معه مع المرجعي.

تم تسجيل كل القسم من نماذج Gemini Audio علامة مائية من نوع SynthID. والعلامة غير المحسوسة حاسوب المخرج الداخلي الصوتي. أما الآلات المستنسخة فتحمل أيضًا بيانات الاعتماد وفقًا للمعايير C2PA. ولنا أن تأخذ على عاتقها الأمان الأوسع، يُشار إلى نموذج بطاقة Gemini 3.8 Audio.

النتائج المعيارية

وهذه النتائج هي النتائج عن النتائج الجديدة:

  • معيار هيوم AI Voice Design Benchmark: يتصدر Flash TTS الترتيب العام في المركز الأول ووصل إلى 71.4، وفق هيوم AI.
  • اعتماد اللهجات: يأتي Flash TTS في ما بعد 60.8.
  • مؤشر الجودة العام من هيوم AI: يحل Flash TTS في المركز الأول بينما يأتي Flash-Lite TTS في المركز الثاني.
  • الساحة الصوتية التفضيل الأعمى: ويحتل كلا الطرازين أعلى المراكز في اللغات اليابانية والبرتغالية البرازيلية والفيتنامية والعربية الفصحى الحديثة والإسبانية المكسيكية والهندية.


الوجبات السريعة الرئيسية

  • أطلقت Google برنامج Gemini 3.8 Flash TTS للعمل الإبداعي وبرنامج Flash-Lite TTS لتوسيع نطاق العمل.
  • يقوم Flash TTS بتصميم أصوات جديدة من خلال المطالبات عبر أكثر من 100 لغة ولهجة.
  • يحصل المطورون على أكثر من 2000 صوت إنتاجي، مقارنة بـ 30 صوتًا أصليًا.
  • يحتاج النسخ الصوتي إلى عينة مدتها 30 ثانية بالإضافة إلى تسجيل موافقة مطابق.
  • يحتل Flash TTS المرتبة الأولى في معيار التصميم الصوتي لشركة Hume AI بحصوله على 71.4.

التعليمات

  1. ما هو الجوزاء 3.8 فلاش تحويل النص إلى كلام؟ إنه نموذج Google لتحويل النص إلى كلام للتصميم الصوتي الإبداعي وتوجيه الأداء سطرًا تلو الآخر. وهو متاح من خلال Gemini API وGoogle AI Studio.
  2. كيف يختلف Flash-Lite TTS؟ تم تحسين Flash-Lite TTS لأحمال العمل ذات الحجم الكبير والفعالة من حيث التكلفة مثل الدبلجة ووكلاء الصوت. وهي تحتل المرتبة الثانية في مؤشر الجودة الشاملة لشركة Hume AI.
  3. هل يمكنني استنساخ صوتي؟ نعم، مع عينة مدتها 30 ثانية وتسجيل الموافقة الشفهية. إنه غير متوفر في AI Studio في العديد من المناطق، بما في ذلك المملكة المتحدة والمنطقة الاقتصادية الأوروبية والهند.




SHARE شارك المقال
عبدالرحمن ربيع
كتبه

عبدالرحمن ربيع

Software Engineer & AI Builder

مطور برمجيات متكامل ومصمم جرافيك مع أكثر من 4 سنوات خبرة في بناء تطبيقات الويب الحديثة باستخدام PHP و JavaScript و HTML و CSS. خلفية قوية في تصميم UI/UX واستخدام متقدم لأدوات الذكاء الاصطناعي لتعزيز كفاءة التطوير والأتمتة واتخاذ القرارات. حاصل على ماجستير تنفي...

وسوم المقال

#?حويل النص لكلام #?صميم الصوت #?لذكاء الاصطناعي #نماذج جوجل #واجهة جيميني #?لأصوات الاصطناعية
RELATED / READ NEXT

مقالات ذات صلة

كل المقالات
COMMENTS

التعليقات (0)

كن أول من يعلّق على هذا المقال.

أضف تعليقك

يظهر تعليقك بعد المراجعة.