أصبح بإمكان نماذج الذكاء الاصطناعي التابعة لشركة غوغل جيميناي الآن تقديم أداء صوتي أكثر واقعية، بعدما أضافت الشركة قدرات جديدة تتيح للنظام استنساخ الأصوات وتنفيذ النصوص بأسلوب أقرب إلى أداء الممثلين، مع التحكم في النبرة واللهجة والإيقاع والمشاعر وحتى التوقفات والتنهدات.
وتأتي هذه الخطوة ضمن توسع "غوغل" في عائلة Gemini 3.8، التي بدأت بنموذج Gemini 3.8 Flash، قبل أن تضيف الشركة نماذج Live وLive Extended Thinking، والآن نماذج تحويل النص إلى كلام Gemini 3.8 Flash TTS وFlash-Lite TTS.
يتمثل أبرز ما يقدمه التحديث للمستخدمين في مستوى التحكم الجديد. ووفقًا لما أعلنته "غوغل" في منشور على مدونتها، يستطيع Gemini 3.8 Flash TTS إنشاء صوت أصلي بالكامل انطلاقًا من وصف مكتوب باللغة الطبيعية، مع دعم أكثر من 100 لغة ولهجة.
كما توفر "غوغل" أكثر من 2000 صوت جاهز للاستخدام في الإنتاج، إلى جانب إمكانية استنساخ صوت متسق اعتمادًا على عينة صوتية مدتها 30 ثانية، بشرط امتلاك المستخدم الإذن اللازم لاستخدام الصوت، بحسب تقرير نشره موقع "androidauthority" واطلعت عليه "العربية Business".
ولا تقتصر التقنية على تحويل النص المكتوب إلى ملف صوتي، إذ يستطيع النموذجان تنفيذ تعليمات دقيقة سطرًا بسطر لتحديد النبرة وسرعة الحديث واللهجة والهمس والضحك والتنهدات وغيرها من الإشارات الحوارية.
كما يمكن للنظام إنشاء محادثات بين شخصين انطلاقًا من نص واحد، مع الحفاظ على ثبات أصوات الشخصيات عبر تسجيلات صوتية تمتد لساعات.
وتفتح هذه القدرات المجال أمام استخدامات متعددة، من بينها البودكاست والكتب الصوتية والدبلجة والوكلاء الصوتيون ومقاطع الفيديو المروية، مع تقليل الطابع الآلي الذي يميز كثيرًا من الأصوات المولدة بالذكاء الاصطناعي.
وتشير نتائج الاختبارات التي أجرتها "غوغل" إلى أداء قوي للنماذج الجديدة.
فقد تصدر Gemini 3.8 Flash TTS الترتيب العام في اختبار Voice Design Benchmark التابع لشركة Hume AI، وسجل 60.8 نقطة في فئة اللهجات.
كما احتل نموذجا Flash وFlash-Lite المركزين الأول والثاني في مؤشر الجودة العام لدى Hume.
وأظهرت اختبارات Voice Arena أيضًا نتائج وضعت النموذجين في الصدارة أو بالقرب منها عبر عدد من اللغات.
لكن المنافسة لم تُحسم في جميع الفئات، إذ سجلت "ElevenLabs" نتائج أعلى في اختبارات Hume المتعلقة بجودة الصوت الفردي ومدى التنوع الشبيه بالأصوات البشرية.
ولن تقتصر هذه القدرات على أدوات المطورين، إذ بدأت "غوغل" طرح Flash TTS داخل تطبيق Gemini Notebook، بينما يصل Flash-Lite TTS إلى خدمة Google Vids.
ويأتي ذلك بالتزامن مع إتاحة أحدث مولد فيديو Omni في Google Vids لعدد أكبر من المستخدمين.
أما المطورون، فيمكنهم الوصول إلى النموذجين من خلال Gemini API وAI Studio.
وفي ظل المخاوف المرتبطة بإمكانية إساءة استخدام تقنية استنساخ الأصوات، وضعت غوغل عددًا من إجراءات الحماية.
وتتطلب الشركة التحقق من الحصول على موافقة صاحب الصوت قبل استخدامه في عملية الاستنساخ، كما تضيف تقنية SynthID للعلامات المائية، إلى جانب بيانات اعتماد C2PA للمساعدة في تحديد المحتوى المولد بالذكاء الاصطناعي.
كما تحظر "غوغل" ميزة استنساخ الأصوات داخل AI Studio في عدد من المناطق، من بينها المملكة المتحدة والمنطقة الاقتصادية الأوروبية والهند وولاية تكساس وولاية إلينوي.
وبذلك تتحول تقنيات تحويل النص إلى كلام في جيميناي من مجرد أدوات لقراءة النصوص إلى أنظمة قادرة على تقديم أداء صوتي أكثر تعقيدًا، مع منح المستخدم تحكمًا أكبر في الطريقة التي يتم بها إلقاء كل جملة وتقديم كل مشهد.
المصدر:
العربيّة