
إطار مفتوح في 3,500 سطر يربط الـharness الإنتاجي بالتدريب، فيقفز Qwen3.5-9B على SWE-bench Verified من 41.8% إلى 56.4% بـ6 آلاف مثال.
ضمن ملف: وكلاء الذكاء الاصطناعي، نماذج الذكاء الاصطناعي
بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري
المصدر الأساسي: arXiv
لماذا يهم
الفرق التي تبني وكلاء برمجة يمكنها الآن تخصيص نموذج 9B على قاعدة كودها بعدد أمثلة صغير وحوسبة محدودة، بدل بناء بيئة تدريب منفصلة عن بيئة التشغيل.
قفزة من 41.8% إلى 56.4% على SWE-bench Verified، أي 14.6 نقطة مطلقة، باستخدام 6 آلاف مثال تدريبي فقط وحوسبة وصفها الباحثون بالمتواضعة. هذا هو الرقم الذي تدور حوله ورقة Agent Lightning v1.0: Towards Harnessed Agentic RL المنشورة على arXiv في 18 أغسطس 2026 لعشرة باحثين بقيادة Zhiyuan He. النموذج المُدرَّب هو Qwen3.5-9B، والأداة إطار تدريب لا يتجاوز 3,500 سطر برمجي. الأرقام كلها معلنة من الباحثين أنفسهم ولم يتسنَّ التحقق منها بشكل مستقل حتى الآن.
الفكرة المركزية أدق من الرقم. الوكلاء الحديثون لا يعيشون داخل حلقة تدريب، بل داخل harness يدير الأدوات والسياق وتدفق التحكم. الورقة تسمي هذا النمط harnessed agentic RL: أن يشارك الـharness الذي تستخدمه وقت النشر في مرحلة post-training نفسها، بدل أن تُعيد بناء بيئة تدريب اصطناعية لا تشبه الإنتاج. أبرز ما في الورقة، بحسب النص المنشور على arXiv، خمس نقاط:
- النتيجة الأساسية: تحسّن Qwen3.5-9B على SWE-bench Verified من 41.8% إلى 56.4% عبر التعلم المعزز، بـ6 آلاف مثال وحوسبة محدودة (وفقاً لورقة Agent Lightning v1.0 على arXiv). أرقام معلنة من فريق البحث نفسه.
- معمارية مفككة: الوكيل يتصل بمحرّك التدريب عبر LLM endpoint proxy، فيبقى الـharness مالكاً لحلقة التفاعل مع البيئة، بينما لا يرى المدرّب سوى تسلسل أزواج request/response. هذا عكس التعلم المعزز التقليدي للوكلاء حيث يملك محرّك التدريب البيئة.
- خمس مشكلات هندسية يقول الباحثون إنها تحدد استقرار التدريب وفعاليته في هذا النمط: إعادة التقطيع retokenization، ودمج العينات، وحساب الـadvantage، وتطبيع الخسارة، وجدولة الـbackend. الإطار مطروح كمختبر عملي لدراسة هذه المشكلات لا كحلّ نهائي لها.
- انتشار سابق للنمط: المعمارية المفككة التي قدّمها الإصدار الأصلي من Agent Lightning تبنّتها لاحقاً أطر أخرى، تذكر الورقة منها verl Uni-Agent وAReaL 2.0 وslime وPolar.
- تقييم على ثلاثة أنواع من الوكلاء: اتّباع التعليمات، والبحث، والبرمجة، مع خط أنابيب كامل قابل لإعادة الإنتاج لوكيل البرمجة، ونشر سير العمل وسكربتات التدريب.
لماذا يستحق هذا انتباهك إن كنت تبني وكلاء؟ لأن الفجوة الأكثر إيلاماً في تشغيل الوكلاء ليست في النموذج، بل في المسافة بين البيئة التي دُرِّب فيها والبيئة التي يعمل فيها فعلاً. حين يصبح الـharness الإنتاجي نفسه هو بيئة التدريب، تختفي طبقة كاملة من عدم التطابق. والرقم اللافت هنا ليس 56.4% في حد ذاته، بل أن الوصول إليه تطلّب 6 آلاف مثال لا مئات الآلاف، ونموذجاً بحجم 9B لا نموذجاً حدودياً. إن صحّ ذلك عند إعادة الإنتاج، فهو يخفض عتبة الدخول لفرق صغيرة تريد تخصيص وكيل برمجة على قاعدة كودها.
لكن التحفظات واضحة ويجب أن تُقال. المصدر وحيد وهو الورقة نفسها، ولا مراجعة أقران منشورة بعد، ونتائج SWE-bench Verified حسّاسة لتفاصيل الـscaffold والـprompt بقدر حساسيتها لأوزان النموذج، ما يجعل مقارنة 41.8% بـ56.4% ذات معنى داخل هذا الإعداد تحديداً لا كرقم مطلق. الورقة نفسها لا تدّعي أكثر من ذلك: تصف نفسها بإطار خفيف ومختبر عملي، وتضع المشكلات الخمس كأسئلة مفتوحة لا كمسائل محلولة. المكسب الحقيقي، في تقديرنا، هو أن الفريق نشر خط الأنابيب والسكربتات كاملة. في مجال صارت فيه أرقام الوكلاء تُعلن أكثر مما تُعاد، القدرة على إعادة تشغيل التجربة أثمن من النقاط الـ14.6 نفسها.
المصادر






