تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
الإحصائيات والتقارير

OpenForgeRL يكسر حاجز تدريب وكلاء الذكاء الاصطناعي في بيئات الإنتاج الحقيقية

بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري

مشكلة يعرفها كل من حاول تدريب وكيل ذكاء اصطناعي احترافي: الـ harness — أي البنية التحتية للاستدلال مثل Claude Code وCodex وOpenClaw — يصعب دمجها مع أنظمة التدريب المفتوحة لأن هذه الأنظمة لا تفهم أصلاً مفهوم العمليات المتعددة والحالات المتغيرة بين الخطوات. OpenForgeRL، الإطار الجديد الذي قدّمه باحثون من مايكروسوفت وجامعة كولومبيا، يكسر هذه الحاجز مباشرةً.

الفكرة المحورية في OpenForgeRL هي الفصل التام بين مرحلة الاستدلال ومرحلة التدريب. يعمل الإطار عبر وكيل proxy خفيف الوزن يعترض نداءات النموذج الصادرة من الـ harness، يسجّلها كبيانات تدريب قابلة للاستخدام مع أي مكدّس RL تقليدي مثل veRL، ثم يُشغّل كل rollout في حاوية Kubernetes مستقلة. النتيجة: بالإمكان الآن تدريب أي وكيل على أي harness وفي أي بيئة دون الحاجة لإعادة هندسة البنية التحتية من الصفر.

الأرقام التي حققها الإطار على benchmarks المعتمدة تستحق التوقف (وفقاً للورقة البحثية). نموذج OpenForgeClaw، المُدرَّب على مئات إلى بضعة آلاف من المهام فحسب، سجّل 31.7 pass³ و55.9 pass@3 على معيار ClawEval، فيما بلغ 33.7 على QwenClawBench. في المقابل، جاء نموذج OpenForgeGUI المعني بالتفاعل مع واجهات المستخدم الرسومية بنتائج لافتة: 37.7 على OSWorld-Verified، و63.0 على Online-Mind2Web، و72.3 على WebVoyager. كلا النموذجين تفوّقا على القواعد المقارنة مفتوحة المصدر ذات الحجم المماثل في شبه جميع المعايير، بل إن OpenForgeGUI ضاهى نماذج أكبر منه بأضعاف في سياق واجهات المستخدم.

لكن الأهم من الأرقام هو ما كشفه التحليل حول طبيعة التعلم بالتعزيز في هذا السياق. اختبر الباحثون harnesses متعددة — ZeroClaw وOpenClaw وCodex — ووجدوا أن بعضها أصعب بكثير على الوكيل من حيث التعلم. كذلك تبيّن أن RL يحسّن موثوقية الوكيل في جوانب محددة: التحقق الذاتي من النتائج، وتوسيع تغطية الأدوات المستخدمة، وإتمام الخطط متعددة الخطوات. غير أن قدرات أساسية كالتعافي من الأخطاء لا تزال ضعيفة، وهو اعتراف صريح نادراً ما نراه في الأوراق البحثية.

من الناحية المعمارية، يُعالج OpenForgeRL نقطة ألم طالما أزعجت مجتمع البحث: حين تُبنى harness معقدة لتحسين أداء الاستدلال، تصبح التجربة “مغلقة” عملياً لأن أنظمة SFT/RL المفتوحة لا تعرف كيف تتعامل مع حالاتها المتغيرة وعملياتها المتوازية. الـ proxy الخفيف يحوّل هذه الـ harness إلى مصدر بيانات قابل للاستهلاك دون تعديل على الـ harness نفسها، والـ orchestrator عبر Kubernetes يضمن العزل الكامل لكل rollout. هذا التصميم يعني أن الباحث يدرّب الوكيل في البيئة الفعلية التي سيُنشر فيها — لا في بيئة مُبسَّطة تصطدم بالواقع لاحقاً.

تمتد تغطية الإطار عبر فئتين رئيسيتين: وكلاء الأدوات المعتمدة على claw tools، ووكلاء واجهات المستخدم متعددة الوسائط سواء في متصفحات الويب أو بيئات الحاسوب الكاملة. هذا الاتساع في التحقق يجعل من OpenForgeRL مرشحاً جدياً ليصبح بنية تحتية بحثية قياسية لمن يعمل على تحسين وكلاء الذكاء الاصطناعي في تطبيقات حقيقية، لا في إعدادات مختبرية مُعقَّمة.

الورقة صادرة عن فريق من عشرة باحثين بقيادة Xiao Yu ويضم Baolin Peng وRuize Xu وHao Zou وQianhui Wu وآخرين، وقُدِّمت إلى arXiv في 23 يوليو 2026. الكود مفتوح المصدر، ما يعني أن التحقق المستقل من النتائج — والبناء عليها — متاح فعلياً لمجتمع البحث العالمي.

ArXiv

مقالات ذات صلة

زر الذهاب إلى الأعلى