تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعي

PRIME-RL يُطلق بنية وكلاء متعددة بأربعة أنماط تدريب جديدة

بقلم: سارة | محررة نماذج الذكاء الاصطناعي · صوت تحريري بإشراف بشري

أعلنت Prime Intellect اليوم عن توسيع مكدّسها البحثي PRIME-RL ليتجاوز تدريب الوكلاء الفردية، إذ أصبح بالإمكان برمجة تفاعلات اعتباطية بين وكلاء متعددين، وتحديد أيّ الأدوار تتعلم، وتوزيع الائتمان عبر سلسلة التفاعل الكاملة. يأتي هذا التحديث عبر إصداري verifiers 0.3.0 وprime-rl 0.8.0 (وفقاً لـ Prime Intellect Blog).

يرتكز التصميم على تجميع قطعتين كانتا منفصلتين: verifiers v1 الذي أرسى أساسيات تشغيل وكيل فردي على مهمة قابلة للبرمجة، وطبقة الخوارزميات في prime-rl التي جعلت رسم الخرائط من الـ rollouts إلى إشارات التدريب قابلاً للبرمجة. الآن تلتقي الاثنتان في كياني Agent وEnv، وهما النواة المعمارية للنظام الجديد بأكمله.

الفكرة جوهرية في بساطتها: كل ما يحتاجه الوكيل الفردي — مجموعة المهام Taskset، وبرنامج التشغيل Harness، وبيئة التنفيذ Runtime — يسكن الآن داخل Agent. واجهته الأساسية هي Agent.run(task: Task) -> Trace: تعطيه مهمة، يُنتج لك أثراً قابلاً للتدقيق. أما Env فهو الحاوية التي تُنسّق التفاعل بين وكلاء متعددين؛ توقيعه Env.run(task: Task, agents: Agents) -> None، ويجمع كل أثر منتهٍ في Episode موحّد. وأي شيء كان يُكتب في verifiers v1 يتحوّل الآن إلى سطر واحد في SingleAgentEnv.

على هذه البنية، نفّذ الفريق أربعة أنماط بيئية جاهزة للاستخدام، تمثّل مساحات بحثية واعدة في التعلم المعزز الوكيلي:

  1. Agentic Judging (AgenticJudgeEnv): طرحت مقالة scaling agentic RL مشكلة التقييم الحتمي الضيّق — فمثلاً في هندسة البرمجيات، قد تتحقق الاختبارات من تفاصيل تنفيذية بعينها فتعاقب حلاً صحيحاً بمكافأة صفر. الحكم الوكيلي يتجاوز هذا الإشكال: بدلاً من استدعاء LLM واحد يُصدر حكماً أعمى، يستطيع وكيل القاضي استكشاف قاعدة الكود، مراجعة الاختبارات الفاشلة، والتجاوز على الحكم الحتمي. التدفق: يعمل solver أولاً وينتج أثراً، ثم يحوّله JudgeTask.from_trace(solution) مدخلاً لوكيل القاضي.
  2. Proposer-Solver (ProposerSolverEnv): يعالج ندرة المهام، إذ يحتاج التعلم المعزز إلى مهام تقع قرب الحد الأمثل من قدرات النموذج الحالي. هنا يتلقى proposer موضوعاً بذرياً ويبني مهمة جديدة، بينما يحلّها مجموعة من n نسخ من solver (الإعداد الافتراضي n=4). يُكافأ المقترح على المعايرة: إذا نجح الجميع فالمهمة سهلة جداً، وإذا فشل الجميع فهي غير صالحة — ذروة قابلية التعلم تكون عند معدل حل 50%، وهو ما يحثّ البيئة على توليد أقصى إشارة تدريبية، مستلهمةً من ورقة Absolute Zero (Zhao et al. 2025). ولأن GRPO الكلاسيكي لا يستطيع تمثيل هذا التسلسل الهرمي في توزيع الائتمان، طوّر الفريق Hierarchical GRPO الذي يحافظ على مجموعات المقارنة دون خلط الأدوار أو مستويات صعوبة المسائل.
  3. Kuhn-Poker (KuhnPokerEnv): يلعب نموذجان الـ Poker، والبيئة تُدير الأوراق الخاصة والحالة العامة والحركات المسموحة. كلما تحسّن النموذج، أصبح خصماً أقوى، فتتحرك المنهجية التدريبية تلقائياً دون الحاجة لخدمة خصم منفصلة. ولأن الأدوار قد تمتلك توزيعات مكافأة مختلفة هيكلياً، يدعم النظام Role-Conditioned Advantage Estimation (RAE)، الذي يقيس كل دور نسبةً إلى تاريخ مكافأته الخاص بدلاً من خط أساس مشترك.
  4. User-Sim (UserSimEnv): كثير من مهام المساعد لا يمكن اختزالها في موجّه واحد وردّ واحد — المستخدم يملك سياقاً خاصاً، يكشف معلومات بالتدريج، ويتفاعل مع الإجابات، ويقرر وحده متى تحقّق الهدف. هنا يُنمَّذج المستخدم كوكيل مستقل، والحلقة محادثة دورية بين وكيلَي المستخدم والمساعد؛ كلا الأثرين يظلان مرئيَّين في الـ Episode. المستخدم المُحاكى مجمّد افتراضياً بينما يُدرَّب المساعد على أثره مقيَّساً بالمهمة الأصلية. يمكن تبديل مجموعات المستخدمين والشخصيات والأهداف الخفية وسياسات التفاعل دون تغيير البنية الأساسية.

ما يجمع هذه الأنماط الأربعة ليس فقط أنها تعمل الآن، بل أن كلاً منها كانت ستستلزم في السابق هيكلية مخصصة من الصفر. بنية Agent وEnv تجعلها تعبيراً برمجياً طبيعياً — تماماً كما أن المبرمج لا يُعيد كتابة بنية البيانات في كل مشروع.

تمتد الفائدة أبعد من التدريب والتقييم. الفريق يبني بالفعل خطوط توليد بيانات اصطناعية ومعالجتها، مستفيداً من أن كل أثر هو قطعة بيانات موحدة وقابلة للتدقيق. للتجربة المباشرة، يمكنك تشغيل Laguna-S2.1 في بيئة pool harness بأسطر قليلة تضع فيها AgentConfig مع harness={"id": "pool"} وruntime=vf.PrimeConfig()، ثم تُمرّر له Task بأي موجّه وتقرأ trace.last_reply.

التوجّه هنا واضح لمن يتابع مسار Prime Intellect: الفريق يبني طبقات التجريد التي يحتاجها بحث AGI مفتوح المصدر — ليس أدوات إنتاجية بالمعنى الضيّق، بل بنية تحتية تجعل الأسئلة الكبرى في تعلم الوكلاء قابلة للتعبير والاختبار عملياً. التقدم نحو Self-Play والمناهج الديناميكية يضغط تحديداً على الاختناق الأعمق في RL: ندرة المهام ذات الصعوبة المناسبة.

Prime Intellect Blog

مقالات ذات صلة

زر الذهاب إلى الأعلى