تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
اختيار المحررينتعلم و استخدام الذكاء الاصطناعي

NVIDIA Magpie TTS: نموذج صوتي مفتوح بـ 12 لغة وكمون 32ms

بقلم: يوسف | محرر أدوات الذكاء الاصطناعي · صوت تحريري بإشراف بشري

أطلقت NVIDIA تحديثاً جوهرياً لنموذج Magpie TTS Multilingual، نموذج تحويل النص إلى كلام مفتوح الأوزان بـ 364 مليون معامل، يدعم الآن 12 لغة بعد إضافة العربية الفصحى الحديثة والكورية والبرتغالية البرازيلية. ما يميّز هذا الإصدار ليس اتساع اللغات فحسب، بل أن المطوّر يمتلك النموذج كاملاً — على بنيته التحتية، بكمون يقيسه بنفسه، ويتحكم في كل طبقة منه.

منطق الإصدار ينطلق من مشكلة حقيقية: في أي خط أنابيب للذكاء الاصطناعي الصوتي، ثمة «ميزانية كمون» محدودة تُوزَّع بين التقاط الصوت، والتفريغ النصي، ومعالجة نموذج اللغة، وأخيراً توليد الكلام. هذه الخطوة الأخيرة هي ما يسمعه المستخدم فعلاً — وأي تأخر فيها يُشعره بأن التطبيق كله بطيء. الحل الذي تقترحه NVIDIA هو الاستغناء عن مكالمة API خارجية والتحكم الكامل في كل مكوّن على حدة.

نموذج NVIDIA Magpie TTS متعدد اللغات للذكاء الاصطناعي الصوتي
NVIDIA Magpie TTS: نموذج صوتي مفتوح يستهدف بيئات الإنتاج المتعددة اللغات

أرقام الأداء التي نشرتها NVIDIA في توثيق NIM الرسمي واضحة: على معالج B200، يصل زمن الوصول إلى أول صوت (TTFA) إلى 32ms في تدفق واحد، وعلى H100 إلى 47ms، وعلى DGX Spark إلى 53ms، وعلى A100 إلى 79ms (وفقاً لـ Hugging Face / NVIDIA Blog). عند 64 تدفقاً متزامناً، يحقق B200 كمون 239ms مع إنتاجية تبلغ 319.81× من الوقت الفعلي — أي يولّد الصوت أسرع بأكثر من 300 مرة من سرعة تشغيله. H100 يصل إلى 275ms عند 64 تدفقاً بإنتاجية 290.79×، فيما يسجّل A100 395ms بإنتاجية 197×، ويُظهر DGX Spark تراجعاً نسبياً عند الحمل العالي مع 962ms و75.88×.

جدول أداء NVIDIA Magpie TTS على مختلف معالجات GPU
مقارنة الكمون والإنتاجية عبر B200 وH100 وA100 وDGX Spark — المصدر: توثيق NVIDIA NIM v26.07

السر وراء هذه الأرقام يعود إلى تحسينين معماريين متكاملين وصفتهما NVIDIA في ورقة بحثية قُبلت في ICASSP 2026: أولهما Frame Stacking، إذ يتنبأ المُفكِّك بإطارين صوتيين في كل خطوة بدلاً من إطار واحد، مما يخفّض عدد التكرارات إلى النصف. غير أن تكديس الإطارات وحده يُدخل تبعيات بين الرموز المتزامنة تُفقد الصوت جودته — وهنا يأتي التحسين الثاني: المحوّل المحلي (Local Transformer)، الذي ينمذج هذه التبعيات ويستعيد الجودة الضائعة. الاثنان معاً يُقدّمان جيلاً أسرع دون التضحية بطبيعية الصوت.

على صعيد الجودة، تُظهر البيانات تحسناً ملموساً في لغات سبق دعمها: الفرنسية انتقلت من نسبة خطأ في الأحرف (CER) تبلغ 2.70% إلى 1.54%، مع ارتفاع في مؤشر تشابه المتحدث (SSIM) من 0.703 إلى 0.747. الإسبانية سجّلت تحسناً أوضح: CER من 1.14% إلى 0.60%، وSSIM من 0.715 إلى 0.793. الألمانية شهدت طفيف تراجع في CER من 0.66% إلى 0.80% مع قفزة في SSIM من 0.626 إلى 0.742 (وفقاً لـ NVIDIA / Hugging Face). أما اللغات الجديدة فتُقدّم أرقاماً أولية للمقارنة المستقبلية: العربية 1.62% CER، الكورية 2.69%، والبرتغالية البرازيلية 2.91%.

مقارنة جودة الصوت عبر اللغات في NVIDIA Magpie TTS
مقارنة مؤشرات CER وSSIM بين الإصدار السابق والحالي لعدة لغات

لمن يريد البناء على هذا النموذج فوراً، إليك المسارات الرئيسية المتاحة:

  1. تجربة النموذج مباشرةً عبر NVIDIA Build أو العرض التوضيحي على Hugging Face دون أي إعداد.
  2. نشر NVIDIA NIM كحاوية inference محسّنة على بنيتك التحتية الخاصة، للحصول على أرقام الكمون المذكورة أعلاه بدون round-trip لخدمة سحابية مُدارة.
  3. تحميل الأوزان المفتوحة من Hugging Face تحت NVIDIA Open Model License للبحث والـ fine-tuning.
  4. تخصيص النموذج لمجالك عبر NVIDIA NeMo: إضافة مفردات تقنية، أصوات علامتك التجارية، أو بيانات متحدث خاصة.
  5. دمج Magpie TTS ضمن عميل صوتي كامل باستخدام مثال Nemotron Voice Agent، الذي يجمع Nemotron Speech للتعرف على الكلام، ونماذج Nemotron اللغوية والمتعددة الوسائط للاستدلال، مع دعم المقاطعة الفورية (barge-in)، والتنسيق متعدد الوكلاء، وتأخر إجمالي دون الثانية.
  6. ضبط معاملات الـ inference للاستخدام الإنتاجي: cfg_scale = 2.5 للتحكم في مدى التزام النص، وtemperature = 0.6، وtop_k = 80، مع تفعيل apply_attention_prior = True وprior_epsilon = 0.1.

ما لا يقوله المصدر صراحةً هو أن إضافة العربية بـ 1.62% CER تعني أن النموذج يُخطئ في حرف تقريباً من كل 62 حرفاً — وهو مقبول كخط أساس لكن يستدعي اختباراً دقيقاً في سياقات تقنية أو طبية تحتاج نطقاً عالي الدقة. كذلك فإن دعم code-switching المُوسَّع يقتصر حالياً على الهندية واليابانية فقط، وليس على العربية بعد — وهو مطلب جوهري لأي تطبيق عربي يخلط المصطلحات التقنية الإنجليزية مع الكلام العربي اليومي. هذا لا يُقلّل من قيمة الإصدار، لكنه يضع مسؤولية الاختبار الميداني على المطوّر قبل الدفع إلى الإنتاج.

Hugging Face / NVIDIA Blog

مقالات ذات صلة

زر الذهاب إلى الأعلى