
بين 35% و49.5% تتراوح أخطاء الكلمات لدى أقوى أربعة أنظمة تفريغ في 17 لهجة عربية، ولا نظام يتصدر كل المجموعات.
ضمن ملف: OpenAI، الذكاء الاصطناعي في الخليج
بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري
المصدر الأساسي: ArXiv
لماذا يهم
مطورو المساعدات الصوتية وأنظمة التفريغ الموجهة للجمهور العربي باتوا يملكون دليلاً على أن الترتيب الإجمالي لا يكفي لاختيار نموذج، وأن الاختبار على لهجة الجمهور المستهدف ضرورة.
أخطاء الكلمات لدى أقوى أربعة أنظمة تفريغ صوتي تتراوح بين 35.0% و49.5% حين تسمع العربية كما يتكلمها الناس فعلاً (وفقاً لـ arXiv). هذا ما يكشفه ALMIEYAR، وهو معيار جديد لقياس التعرّف الآلي على الكلام (ASR) في اللهجات العربية. بحسب الورقة البحثية المنشورة على arXiv، يغطي المعيار 17 لهجة موزعة على ست عائلات لهجية (وفقاً لـ arXiv). وينطلق الباحثون من ملاحظة يعرفها كل مطوّر عربي: تقنيات الكلام العربية ركزت على الفصحى الحديثة، وأهملت اللهجات الحية التي يتحدثها مئات الملايين.
تستند هذه القصة إلى مصدر وحيد هو الورقة نفسها. وهي نسخة أولية (preprint) قُدّمت في 28 سبتمبر 2026، ووقّعها 40 باحثاً يتقدمهم Omid Ghahroodi (وفقاً لـ arXiv). لم تمر الورقة بعد بمراجعة الأقران، ولم يتسنَّ التحقق من أرقامها بشكل مستقل. ولا يسرد الملخص أسماء اللهجات السبع عشرة، ولا يعرض النتائج لكل لهجة على حدة. كما لا يوضح هل ستُتاح التسجيلات للعموم، ومتى.
تبدأ قيمة المعيار من طريقة بنائه. بحسب الورقة، جاءت كل التسجيلات جديدة، ولم تسمعها أي من النماذج الموجودة من قبل. وهذا يستبعد احتمال أن يكون النموذج قد “حفظ” بيانات الاختبار أثناء تدريبه. اختار منسقون من مجتمع كل لهجة صوراً ذات صلة ثقافية ضمن 10 موضوعات، ثم وصفها متحدثون أصليون عبر خمسة سيناريوهات منظّمة (وفقاً لـ arXiv). بلغت الحصيلة نحو 50 دقيقة لكل لهجة، بإجمالي 13.7 ساعة (وفقاً لـ arXiv). ثم اختُبر 12 نظاماً حديثاً بأسلوب zero-shot، أي دون أي تدريب إضافي على بيانات المعيار (وفقاً لـ arXiv). ضمت القائمة بحسب الورقة GPT-4o-transcribe وVoxtral-Mini-4B وFanar-STT-LF وWhisper وSeamlessM4T-v2، إضافة إلى نماذج مبنية على wav2vec2.
خرجت الورقة بخمس نتائج رئيسية:
- تصدّر GPT-4o-transcribe بمعدل خطأ في الكلمات (WER) بلغ 35.0%، وتلاه Voxtral-Mini-4B بمعدل 41.1%، ثم Fanar-STT-LF بمعدل 45.9%، ثم Whisper-Large-v3 بمعدل 49.5% (وفقاً لـ arXiv). يفصل بين الأول والرابع 14.5 نقطة مئوية، وهذا حساب من موجز بناءً على أرقام الورقة.
- بحسب الورقة، تدل هذه الأرقام على أخطاء متبقية كبيرة عبر المجتمعات اللهجية العربية. فحتى المتصدر يخطئ في كلمة من كل ثلاث كلمات تقريباً.
- يتفاوت الأداء كثيراً من مجموعة لهجية إلى أخرى، ولم يتصدر أي نموذج كل المجموعات، بحسب الورقة.
- معدل WER وحده يخفي جزءاً من الصورة. بحسب الورقة، تُظهر النماذج المبنية على wav2vec2 فجوة كبيرة بينه وبين معدل خطأ الحروف (CER)، إذ يبقى التطابق على مستوى الحروف أعلى بكثير من الدقة على مستوى الكلمات. لهذا يوصي الباحثون بالإبلاغ عن المقياسين معاً.
- يتضمن ALMIEYAR أول معيار منشور للعربية الأهوازية، بحسب الورقة، ويقدّم نفسه إطاراً موحّداً لتقييم التعرّف على الكلام العربي على أساس ثقافي.
نرى أن النتيجة الرابعة أهم من جدول الصدارة. ما يلي تفسير من موجز وليس من الورقة: حين يلتقط النموذج الحروف صحيحة ويخطئ في الكلمة، يكون السبب غالباً غياب إملاء موحّد للهجات، واختلاف طرق وصل الكلمات وفصلها. معنى ذلك أن جزءاً مما يُحسب “خطأً” قد يكون خلافاً على التهجئة لا عجزاً عن الفهم. ولهذا فإن الحكم على نموذج من رقم WER واحد يظلم بعض النماذج ويجامل بعضها الآخر.
إن كنت تبني مساعداً صوتياً أو نظام تفريغ لمركز اتصال، فالدرس المباشر أن الترتيب الإجمالي لا يعفيك من اختبار النموذج على لهجة جمهورك تحديداً. فالنموذج الأول في المعدل العام قد لا يكون الأول في لهجتك. في المقابل، يبقى حجم العينة قيداً واضحاً. 13.7 ساعة في المجموع، ونحو 50 دقيقة للهجة الواحدة (وفقاً لـ arXiv)، قد لا تكفي لتمثيل الفروق داخل اللهجة نفسها بين المدن والأجيال. وسيتبدل جدول الصدارة مع أول جيل جديد من النماذج. أما القيمة التي تبقى فهي مقياس نظيف من التسرّب يستطيع المجتمع البحثي العربي أن يحتكم إليه.
ماذا يعني للمنطقة؟
المعيار مخصص بالكامل للهجات العربية الحية ويشمل أول معيار منشور للعربية الأهوازية، ما يمنح المطورين والمختبرات في المنطقة مقياساً موحداً لجودة التفريغ الصوتي بلهجات جمهورهم.
المصادر






