تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعي

ElevenLabs تطلق Eleven v4 ونسخة Turbo تبدأ النطق خلال 150 ملّي ثانية

من قراءة آلية إلى أداء موجَّه بالوسوم: Eleven v4 يتفوق بنسبة 75% في اختبارات عمياء وفق الشركة، وTurbo يبدأ الكلام خلال 150 ملّي ثانية.

ضمن ملف: نماذج الذكاء الاصطناعي، وكلاء الذكاء الاصطناعي

بقلم: يوسف | محرر أدوات الذكاء الاصطناعي · صوت تحريري بإشراف بشري

المصدر الأساسي: ElevenLabs Blog

لماذا يهم

مطورو الوكلاء الصوتيين وصناع الكتب الصوتية والدبلجة لن يضطروا بعد الآن، بحسب الشركة، إلى الاختيار بين السرعة والتعبير، ويمكنهم توجيه الأداء بوسوم نصية بسيطة عبر API.

أطلقت ElevenLabs نموذجها الجديد لتحويل النص إلى كلام Eleven v4، ومعه نسخة منخفضة التأخير باسم Eleven v4 Turbo. تصفه الشركة بأنه “أكثر نماذجها تعبيراً عن المشاعر” حتى الآن. الفكرة التي تبني عليها الإعلان بسيطة: عبارة مثل “أحتاج أن تبقى هادئاً” تُقال بنبرة رقيقة حين ينطقها طبيب أمام مريض خائف، وتُقال صراخاً حين يطلقها قائد فرقة في لعبة قبل النزول إلى المعركة. المطلوب إذن نموذج يقرأ السياق قبل أن يقرأ الكلمات.

تقول الشركة إن النموذج يحتل المرتبة الأولى في لوحة Provider Voice Arena التي تصدرها Artificial Analysis لشهر سبتمبر 2026 (وفقاً لـ ElevenLabs). وتضيف أن نحو 75% من المستمعين فضّلوه في اختبارات مقارنة عمياء مباشرة (وفقاً لـ ElevenLabs). هذه أرقام معلنة من الشركة نفسها. بحسب ElevenLabs، جرت الاختبارات في سبتمبر 2026 أمام Cartesia Sonic 3.6 وInworld TTS-2 وGoogle Gemini 3.8 Flash-Lite TTS وGoogle Gemini 3.8 Flash TTS. في كل جولة سمع المقيّمون السطر نفسه من Eleven v4 ومن أحد المنافسين دون معرفة المصدر، وحكموا على أيهما أكثر تعبيراً وأيهما أكثر طبيعية، واحتُسب التعادل نصف نقطة. لم تنشر الشركة حجم العينة ولا عدد المقيّمين، ولم يتسنَّ التحقق من النتائج بشكل مستقل. والقصة كلها تستند إلى مصدر وحيد هو مدونة ElevenLabs الرسمية.

بحسب ElevenLabs، بُني النموذج على معمارية جديدة بالكامل، ويمكن تلخيص ما يقدمه في خمس نقاط:

  1. أداء موجَّه بالوسوم واللغة الطبيعية: يستطيع المستخدم أن يصف طريقة إلقاء السطر بكلمات عادية، أو أن يضيف وسوماً داخل النص مثل [laughs] و[said angrily in French accent]، وحتى مؤثرات صوتية مثل [light rain] و[phone buzzing]. في العينات المنشورة يبدأ سطر بوسم [excited, happy] لإعلان قائمة صيفية لمطعم، ويبدأ آخر بوسم [sleepy drowsy voice] ثم [yawning] لشخص يطلب خمس دقائق إضافية من النوم. تؤكد الشركة أن v4 يلتزم بهذه التوجيهات بدقة أعلى من النماذج السابقة، وأن التوثيق البرمجي يشرح الصيغة الكاملة للوسوم وطريقة تمريرها عبر API. كما حسّنت دعم رموز الأبجدية الصوتية الدولية IPA، فصار النطق المخصص للأسماء والمصطلحات أكثر ثباتاً.
  2. حوار متعدد المتحدثين يفهم المشهد: بحسب الشركة، يعتمد النموذج طريقة جديدة لالتقاط هوية كل متحدث والحفاظ على خصائص صوته عبر محادثات الوكلاء والكتب الصوتية والإعلانات. ولأنه يقرأ سياق المشهد كاملاً، يرد كل متحدث على ما قيل للتو، بدلاً من أن يبدو الحوار أسطراً منفصلة جرى لصقها معاً.
  3. Turbo للوكلاء الصوتيين: تذكر الشركة أن زمن الاستدلال الوسيط يبلغ نحو 100 ملّي ثانية (وفقاً لـ ElevenLabs)، أي أقل من متوسط الصمت بين شخصين يتحادثان، وأن الزمن الوسيط حتى أول كلام مسموع يبلغ نحو 150 ملّي ثانية (وفقاً لـ ElevenLabs). وهي أرقام معلنة من الشركة نفسها. قيس الزمن الثاني في سبتمبر 2026 بنصوص متطابقة وإعدادات افتراضية، مقارنة بـ Cartesia Sonic 3.6 وxAI TTS وGoogle Gemini 3.8 Flash-Lite TTS وOpenAI GPT-4o mini TTS، مع حذف تأخير الشبكة لجميع الأنظمة، وتشغيل Turbo عبر بث WebSocket. صُمم Turbo للعمل مع منصة الوكلاء المحادثين ElevenAgents، وتقول الشركة إن فرقها حسّنت النموذج والمنصة كنظام واحد، في حين يجمع منافسون مكونات من موردين مختلفين. من الأمثلة التي تطرحها: وكيل دافئ مطمئن ينطق المصطلحات الطبية بدقة في قطاع الرعاية الصحية، ووكيل سريع الكلام يستخدم العامية لتسلية اللاعبين في الألعاب.
  4. صوت واحد بأكثر من 90 لغة: بحسب الشركة، يدعم النموذجان أكثر من 90 لغة (وفقاً لـ ElevenLabs). والأهم أن صوتاً مسجلاً بلغة واحدة يستطيع الآن التحدث بأي لغة أخرى بلكنة متحدث أصلي مع الاحتفاظ بهوية صاحبه، دون أن ينجرف تدريجياً نحو لكنته الأصلية أثناء التوليد. وتقول الشركة إن التحسن لا يقتصر على نطق الكلمات، بل يشمل الإيقاع والعاطفة وطريقة الإلقاء، وتضرب مثالاً بأن مخاطبة شخص مسن غريب في اليابان تختلف عن مخاطبته في إيطاليا. العينات المنشورة بالكتالونية والإسبانية. أما في الدبلجة والتوطين، فالمعنى أن صوت العلامة التجارية، سواء كان ممثلاً مشهوراً أو نبرة تناسب هوية الشركة، يبقى هو نفسه في كل اللغات المدعومة.
  5. استنساخ أصوات أدق: بحسب ElevenLabs، تستطيع ميزة Instant Voice Clones الآن التقاط صوت بدقة عالية من 10 ثوانٍ فقط من التسجيل (وفقاً لـ ElevenLabs)، مع تشابه أكبر بكثير مع الصوت الأصلي. ويحافظ النموذج على هوية المتحدث عبر التوليدات المتكررة والحوار والسرد والأسطر المعاد توليدها، ما يهم الإنتاجات الطويلة. ويضيف v4 دعم Professional Voice Clones للحالات التي تتطلب أعلى دقة. كما صار ربط الطلبات المتتالية لتوليد محتوى طويل (request stitching) أكثر موثوقية بشكل ملحوظ، وهو ما ينعكس على العمل في ElevenLabs Studio وتطبيق ElevenLabs Reader.

يتوفر النموذجان الآن عبر ElevenAgents وElevenCreative وElevenAPI، ويمكن البدء بحساب مجاني. لكن الإعلان يترك فجوات واضحة. لا يذكر أي تغيير في التسعير ولا حدود الاستخدام في الخطة المجانية. لا ينشر قائمة اللغات التسعين، فلا نعرف مستوى دعم العربية ولا لهجاتها، وهو السؤال الأهم لقرائنا. ويقارن المستخدمين المتنافسين في اختبار التفضيل بقائمة، وفي اختبار السرعة بقائمة أخرى تضم xAI وOpenAI بدل Inworld وGemini Flash TTS. في تقديرنا، تحويل الأداء الصوتي إلى شيء يُكتب بوسوم بسيطة هو القيمة الحقيقية هنا، أكثر من صدارة لوحة ترتيب تصدر نتائجها الشركة. والسؤال العملي لك إن كنت تبني وكيلاً صوتياً: هل يكفي زمن 150 ملّي ثانية لتتخلى عن الصوت الرتيب الأسرع؟ أم أن الاعتماد على منصة واحدة تجمع النموذج والوكيل ثمن لا تريد دفعه؟

مقالات ذات صلة

زر الذهاب إلى الأعلى