تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
الإحصائيات والتقارير

Argus: وقت تشغيل عميل يتطور ذاتياً ويحقق 78% على SWE-Bench Pro

بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري

نظام وقت تشغيل عميل يحقق 78% على SWE-Bench Pro مقارنةً بـ59% فقط لأفضل المنافسين — هذا ما توصّل إليه فريق من ستة وعشرين باحثاً نشروا ورقتهم العلمية عن Argus، وهو وقت تشغيل عميل (agentic runtime) مصمّم للتعامل مع مهام التفكير طويلة الأمد التي تستغرق ساعات أو أياماً. (وفقاً لـ arXiv)

المشكلة التي يعالجها Argus ليست تقنية بسيطة: كيف تبني نظاماً ذكياً يُثابر حين يسير على الطريق الصحيح، ويتراجع حين تكشف القياسات عن فشل أو قيود خفية أو هدف محدّد بشكل خاطئ؟ الأنظمة التقليدية إما تتصلّب على خياراتها الأولى أو تفقد السياق في المهام المطوّلة. الحل الذي يقترحه الباحثون هو فصل نية المستخدم الثابتة عن الأهداف التشغيلية المتغيّرة، والسماح للنظام بالتطور الذاتي عبر حالة مشروع دائمة — لا من خلال تغيير أوزان النموذج، بل من خلال تراكم الذاكرة والمهارات والإجراءات المتحقَّق منها.

البنية الداخلية لـArgus تعتمد على أربعة أدوار متخصصة تعمل على مهام محدودة النطاق فوق حالة مشروع دائمة: Manager الذي يشرف على الأهداف الكبرى، وPlanner الذي يرسم مسار التنفيذ، وEngineer الذي ينجز المهام التقنية، وReviewer الذي يتحقق من النتائج. لا تُقبل الذكريات أو المهارات أو الإجراءات أو قرارات التوجيه إلا بعد مراجعة مرتبطة بالدور المعني، وحين يتوفر تحقق أصيل من المهمة. هذا يعني أن التطور الذاتي للنظام يمر دائماً عبر بوابة تحقق صارمة، لا عبر قبول عشوائي.

النتائج الكمية لافتة بشكل واضح. عبر سبع ساحات benchmark تستخدم نموذج GPT-5.5، سجّل Argus 78% على SWE-Bench Pro مقارنةً بـ59% لـDirect Copilot، مع استخدام 1.41 ضعف من إجمالي الرموز (tokens). (وفقاً لـ arXiv) وبعد التطور الذاتي المقيَّد بالتحقق، تستخدم موجات SWE-Bench الناضجة 21% tokens أقل لكل مهمة و15% وقت سير عمل نشط أقل مقارنةً بموجات البداية — مع تسجيل 34 حالة استرداد عبر verifier و22 إنقاذاً عبر review-loop صارم.

البيانات تمتد إلى ما هو أبعد من هندسة البرمجيات. على AARRI-Bench، بلغ Argus 76.8%، وحقق فجوة 28 نقطة على تركيب البيانات الرياضية، مع نتائج تنافسية في GPU-kernel وتدريب نماذج اللغة. (وفقاً لـ arXiv) لكن الأرقام الأكثر إثارة للاهتمام تأتي من الحالات التطبيقية الحقيقية التي وثّقها الباحثون: دُمج kernel محسَّن لـRWKV6 في المستودع الرئيسي، وأنجزت ست خطوط عمل بحثية 254 مهمة مع 16 حالة rollback للمراحل، وأجرت حملة رياضيات متعددة الأيام احتفظت بمسارات مرفوضة وبتحديثات مُثبتة بالبراهين.

ما يستحق التأمل هنا هو الموقف الفلسفي الكامن خلف التصميم: الوزن ثابت، لكن النظام يتطور. هذا يعكس رهاناً واضحاً على أن قدرة الذكاء الاصطناعي على الأداء الموثوق في المهام المعقدة لا تتطلب بالضرورة نماذج أضخم أو fine-tuning مستمر — بل تتطلب بنية تحتية أكثر ذكاءً تتعلم من التجربة وتحتفظ بالمعرفة المتحقَّق منها. النقطة الأمينة التي يُقرّها الباحثون ضمنياً هي أن تكلفة tokens أعلى في البداية (1.41× مقارنةً بالحلول المباشرة) لكنها تنخفض مع النضج، وهو ما يجعل Argus مُصمَّماً للمهام طويلة الأمد وليس للمهام السريعة.

تجدر الإشارة إلى أن الورقة تعتمد على GPT-5.5 كنموذج أساسي، وهو ما يطرح تساؤلاً مشروعاً: هل تبقى هذه المكاسب مع نماذج أخرى أو أضعف؟ الإجابة غير متاحة حالياً. لكن الحجة الأساسية — أن harness ذاتي التطور يمكنه مراجعة نفسه والتعافي وتراكم المناهج المتحقق منها بينما يُنتج بيانات مُهيكلة للتعلم المُشرَف عليه والتعزيزي مستقبلاً — تبقى ذات قيمة مستقلة عن النموذج المستخدم. ويمكن للمطورين المهتمين الاطلاع على الورقة الكاملة عبر arXiv.

arXiv

مقالات ذات صلة

زر الذهاب إلى الأعلى