
بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري
عندما تُعطي نموذجاً لغوياً وثيقةً طويلة وتطلب منه الاستدلال عليها، ما الذي يفعله فعلاً؟ وفقاً لبحث جديد نشره فريق من باحثي arXiv في يوليو 2026، كثيراً ما يلجأ النموذج إلى نسخ فقرات بأكملها من النص المدخل ودمجها داخل سلسلة التفكير — بدلاً من تحليل المعلومات وتوليد استنتاج حقيقي. الظاهرة ليست استثنائية؛ البحث يُثبت أنها منتشرة عبر أفضل النماذج الحدية المتاحة اليوم، وتزداد حدةً كلما طالت نافذة السياق.
الباحثون — Lizhe Fang وWeizhou Shen وTianyi Tang وYisen Wang — أطلقوا على هذا النمط اسم Repetitive Copying، وبنوا عليه تشخيصاً دقيقاً: المشكلة الجوهرية ليست في حجم النموذج ولا في طريقة الضبط الدقيق بمعناه الكلاسيكي، بل في غياب Grounding — أي في عجز النموذج عن التمييز بين الأدلة الجوهرية ذات الصلة بالمهمة وبين السياق الزائد الذي لا علاقة له بها. النماذج التي تفشل في تركيز انتباهها على الأدلة الحاسمة (وفقاً للبحث) تُجيب بشكل خاطئ بنسبة أعلى بكثير من نظيراتها التي تُحسن الاختيار.
لفهم الظاهرة كمياً، قسّم الفريق كل prompt إلى شقّين: Key Evidence وهو النص ذو الصلة المباشرة بالسؤال، وDistractor Context وهو كل ما تبقى من محتوى غير ذي صلة. ثم راقبوا ما الذي تنسخه النماذج داخل خطوات تفكيرها. النتيجة كانت حاسمة: النماذج تنسخ عشوائياً من الجانبين معاً، دون تمييز يُذكر — وهذا هو لبّ الخلل.
الحل الذي يقترحه الفريق يحمل اسم GEAR — اختصار لـ Grounding Evidence-Aware Reward — وهو منهجية لإعادة تشكيل دالة المكافأة في التعلم المعزز. بدلاً من الاكتفاء بمكافأة النموذج على الإجابة الصحيحة فحسب، يضيف GEAR بُعدين إضافيين:
- Grounding Reward: مكافأة إضافية تُمنح للنموذج كلما تداخلت خطوات تفكيره مع Key Evidence الفعلي، أي كلما استشهد بالأدلة الجوهرية التي تخدم الإجابة.
- Distractor Penalty: خصم من المكافأة كلما تداخل تفكير النموذج مع Distractor Context، أي كلما هدر خطواته في نسخ نصوص لا صلة لها بالسؤال.
- Accuracy Signal: مكافأة الدقة الأصلية تبقى محفوظة كاملةً — GEAR لا يستبدلها بل يُعززها بالمكوّنَين السابقَين.
- Automated Evidence Annotation Pipeline: لأن تطبيق GEAR يستلزم بيانات تدريب موسومة بالأدلة الجوهرية ومصادر التشتيت، طوّر الفريق خطاً آلياً كاملاً لاستخراج هذه التوسيمات من أي وثيقة نصية طبيعية، دون الحاجة إلى تدخل بشري.
- Multi-Scale Validation: اختُبر GEAR عبر أحجام نماذج متعددة وعلى مجموعة متنوعة من المعايير القياسية benchmark، وليس على تكوين واحد فقط.
النتائج الكمية لافتة: تحسينات تصل إلى +4.6 نقطة في المتوسط (وفقاً للبحث) مقارنةً بالتعلم المعزز التقليدي المستند إلى مكافأة الدقة وحدها — وهذا الفارق يتّسع تلقائياً كلما ازداد طول السياق. بعبارة أخرى: كلما كانت المهمة أصعب وأطول، كان النفع من GEAR أكبر. وفي الوقت ذاته، انخفض طول سلاسل التفكير ذاتها، لأن النموذج يتوقف عن ملء الفراغ بنسخ لا قيمة منه.
الزاوية الأعمق في هذا البحث أنه يتحدى افتراضاً شائعاً في مجتمع الـ LLM: أن المشكلة في السياقات الطويلة هي مشكلة استرجاع Retrieval. الفريق يُجادل بأن ميزان التحدي بدأ يتحوّل — من البحث البسيط عن المعلومة إلى الاستدلال المركّب عليها — لكن القدرة على الـ Grounding الدقيق لا تزال تفتقر إلى النضج الكافي حتى في أحدث النماذج. هذا يعني أن أي نموذج تُشغّله على وثائق طويلة — سواء لتحليل عقود أو مراجعة أبحاث أو استخراج معلومات من تقارير — قد يُنتج تفكيراً يبدو وافياً لكنه في حقيقته مليء بنسخ غير مُصفّى.
التحدي العملي الذي يُشير إليه البحث دون أن يحلّه بالكامل هو مسألة التعميم: مدى قابلية خط الـ Evidence Annotation الآلي للعمل عبر لغات ومجالات متعددة بالجودة نفسها لم يُختبر بعد على نطاق واسع. لكن البنية النظرية لـ GEAR — وهي إضافة إشارات مكافأة ذات معنى دلالي فوق إشارة الدقة الخام — تمثّل انعطافة منطقية في طريقة تصميم دوال المكافأة لنماذج الاستدلال طويل السياق، وتستحق أن يُعيد المطورون النظر فيها عند ضبط نماذجهم على مهام القراءة والتحليل.







