
بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري
السؤال الذي طرحه باحثون من ثمانية أسماء بارزة في ورقة بحثية نُشرت على arXiv في 4 أغسطس 2026 ليس صغيراً: إذا كانت معاملات النموذج ثابتة، فكيف تُوزّع الحوسبة الإضافية بين مكوّن الرؤية ومكوّن اللغة لتحقيق أفضل أداء؟ الإجابة جاءت في شكل إطار اسمه ParVL، وهو اختصار لـ Parallel Vision-Language.
المشكلة التي تعالجها الورقة تكمن في بنية النماذج متعددة الوسائط الحالية (MLLMs). الاستراتيجيات المعتادة لتحسين الأداء تسير في أحد اتجاهين: إما توسيع عدد المعاملات، وهو مكلف من حيث الذاكرة، أو إضافة خطوات استدلال تسلسلية، وهو ما يرفع وقت الاستجابة. الأسوأ من ذلك أن هذه الاستراتيجيات تُبقي على توزيع ثابت وصارم للحوسبة بين مشفّر الرؤية ViT ونموذج اللغة الكبير LLM، دون أي قدرة على التكيّف حسب طبيعة المهمة.
يحلّ ParVL هذه المعضلة بطريقة مغايرة: بدلاً من تعديل معاملات النموذج الأساسي، يُعيد استخدام معاملات الـ ViT والـ LLM الموجودة عبر فروع متوازية متعددة، كل فرع يحمل معاملات prefix خاصة به فوق العمود الفقري المشترك. هذا يعني أن حجم النموذج لا يتضخم، لكن الحوسبة المتاحة تتضاعف بشكل موازٍ لا تسلسلي، مما يتيح توزيع مرن وقابل للتوسعة بين مسارات الرؤية ومسارات اللغة.
التدريب جرى بالضبط الدقيق الكامل للمعاملات (full-parameter supervised fine-tuning) على ما يقارب 13 مليار رمز (وفقاً للورقة البحثية على arXiv)، وهو رقم يعكس جدية الاختبار وعمقه. ودرس الفريق بشكل منهجي تأثير تغيير نسبة التخصيص بين الفروع البصرية وفروع اللغة، وهو ما يُسمّيه الباحثون “مقايضة التخصيص الحسابي” (computation-allocation trade-off).
النتيجة الرئيسية واضحة: ParVL يتفوق على baselines أحادية الفرع تستخدم نفس الوصفة التدريبية، مما يؤكد أن المقاربة الموازية بحد ذاتها تضيف قيمة حقيقية. لكن الاكتشاف الأكثر إثارة للتفكير هو أن التوزيع الأمثل بين الفروع البصرية وفروع اللغة يتفاوت من مهمة إلى أخرى — فما يناسب مهمة فهم المشاهد المعقدة لا يناسب بالضرورة مهمة الإجابة عن أسئلة نصية مع صور بسيطة. هذا يفتح الباب أمام نماذج قادرة على تعديل توزيعها الحسابي ديناميكياً بحسب نوع المدخلات.
التصميم يُذكّر بمقاربات مثل Mixture of Experts لكنه مختلف جوهرياً: لا توجد “خبراء” منفصلة بمعاملات مستقلة، بل يُعاد توظيف نفس العمود الفقري عبر فروع تحمل فقط معاملات prefix إضافية خفيفة الوزن نسبياً. هذا يجعل ParVL أقرب إلى ما يمكن تسميته “ضغطاً حسابياً رأسياً” بدلاً من توسع أفقي في المعاملات.
الكود متاح للعموم، ما يعني أن الباحثين والمطورين يستطيعون البناء عليه مباشرة. السؤال الذي يستحق المتابعة: هل يمكن استخدام هذا الإطار لبناء نماذج MLLM تُكيّف توزيعها الحسابي تلقائياً أثناء الاستدلال بدلاً من التدريب المسبق على نسبة ثابتة؟ الورقة تفتح الباب لهذا الاحتمال دون أن تُغلقه.







