
من 62.7% بالحزام القياسي إلى 99.9% بحزام Provider Adapter، وحركات أقل من الإنسان الوسيط في 96% من مراحل ARC-AGI-3.
ضمن ملف: نماذج الذكاء الاصطناعي، وكلاء الذكاء الاصطناعي
بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري
المصدر الأساسي: ARC Prize
لماذا يهم
من يبني وكلاء ذكاء اصطناعي يتعلم أن الفجوة بين 62.7% و99.9% جاءت من إدارة الذاكرة والسياق لا من نموذج أذكى، أي أن هندسة الحزام صارت متغيراً بحجم النموذج نفسه.
سجّل نموذج GPT-6 Astra من OpenAI نسبة 99.9% على النسخة نصف الخاصة (Semi-Private) من اختبار ARC-AGI-3 مقابل نحو 18,817 دولاراً من تكاليف الاستدلال (وفقاً لـ ARC Prize)، لكن الرقم الأهم في التقييم ليس هذا: النموذج استخدم عدداً أقل من الحركات من الإنسان الوسيط في 96% من المراحل، وبمعدل 51.7% حركات أقل لكل مرحلة (وفقاً لـ ARC Prize). هذه أول مرة يتجاوز فيها نموذج حدودي خط الأساس البشري في مقياس كفاءة الحركة على هذا الاختبار.
التقييم أجرته مؤسسة ARC Prize ونشره Greg Kamradt في 3 سبتمبر 2026، وهو تقييم طرف ثالث لا إعلان من الشركة نفسها، وهذا ما يمنحه وزناً أكبر من أرقام البنشمارك المعتادة. وARC-AGI-3 ليس اختبار أسئلة وأجوبة: إنه بيئات تفاعلية مجهولة قائمة على الأدوار، على الوكيل أن يستكشفها، ويستنتج الهدف دون تعليمات، ويبني نموذجاً داخلياً للقواعد، ثم يخطط وينفّذ ويصحّح مساره. البيئات مبنية على معارف بشرية أساسية فقط ومعايَرة بالاختبار البشري، والبشر يحلّون 100% منها بحسب ARC Prize. خمس نقاط تلخّص ما ظهر في هذا التقييم:
- نتيجتان لا نتيجة واحدة، والفرق كله في الـharness. بحزام الاختبار القياسي (Standard) الذي يترك للنموذج أن يقرر ما يحمله معه في ملاحظات مرئية، سجّل Astra عند أقصى مستوى استدلال 62.7% مقابل 26,098 دولاراً. أما بحزام Provider Adapter الذي يحفظ حالة الاستدلال المعتمة بين الطلبات ويستخدم الضغط (compaction) لإدارة المحادثات الطويلة، فقفزت النتيجة إلى 99.9% مقابل 18,817 دولاراً عند مستوى high، و98.6% مقابل 17,332 دولاراً عند max. سلّم مستويات الاستدلال في الحزام القياسي يوضح الفارق: 59.3% ($37,317) عند xhigh، و54.8% ($40,705) عند high، و38.6% ($48,090) عند medium، و17.5% ($38,166) عند low، و35.2% ($49,791) بلا استدلال، بينما بقيت نتائج Provider Adapter بين 96.7% و99.9% في كل المستويات. والمفارقة أن التكلفة تنخفض مع ارتفاع مستوى الاستدلال، لأن النموذج يحلّ الألعاب بحركات أقل فيقلّ عدد نداءات الـAPI والرموز. وبحسب ARC Prize كانت تشغيلات Provider Adapter أسرع بنحو 3.66 مرة واستهلكت 49% رموزاً أقل عبر 167 زوجاً من الألعاب ومستويات الاستدلال حلّها الحزامان معاً.
- كفاءة الحركة سقطت كخط فاصل. قبل إطلاق الاختبار، اختبرت ARC Prize نحو 500 شخص من الجمهور العام دون انتقاء على أساس الخبرة في الألغاز، وحُدّد خط الأساس البشري لكل مرحلة بوسيط عدد الحركات بين من أكملوها (وفقاً لـ ARC Prize). الفرضية كانت أن الذكاء الاصطناعي سيحتاج استكشافاً أكثر بكثير حتى عند نجاحه. ما حدث أن السلوك بدا ثنائياً: بمجرد أن «يفهم» النموذج الميكانيكا، ينفّذ داخل نطاق الكفاءة البشرية أو أفضل منه. الفرضية تبقى صحيحة على مقاربات القوة الغاشمة (brute force) فقط.
- النموذج اخترع لغة ترميز مختصرة لنفسه. أبرز سلوك سجّلته إعادات التشغيل هو تحويل بيئة مجهولة إلى نموذج عالم رمزي مضغوط: تمثيل قواعد اللعبة كقواعد منطقية، وتوليد لغة مخصصة (DSL) لتتبع الحالة والتخطيط. أمثلة حقيقية من الملاحظات بحسب ARC Prize:
L8: hub q2 (8↓). Lengths: 14=1…لتسجيل المرحلة ومؤشر دوران محلي وأطوال الميكانيزمات، وextend8 to3; retract10 to2; shorten8 to1كخطة متعددة الخطوات مرتبة، و9−=(39,4), rotate=(49,18), 14+=(59,11)لربط العمليات بإحداثيات أزرار التحكم، وTurn 5: P=(24,20), empty, facing westلدمج عدّاد الأدوار مع موقع اللاعب وما يحمله واتجاهه. ARC Prize تصفها بأنها اختصار جبري آني لا لغة برمجة مكتملة، وتقول إنها رأت سلوكاً مشابهاً في نماذج أخرى لكن ملاحظات Astra تميّزت بدقتها وكثافتها المعلوماتية. - وحين أُعطي بيئة تنفيذ كود، بنى مكتبات برمجية للعبة واحدة. في حزام PRO-LONG، وهو شريك red-teaming مبكر يمنح النموذج صندوق رمل لتنفيذ كود مخصص، أنشأ Astra أدواته الخاصة لكل لعبة: محلّلات للوحة، ونماذج لحالة اللعبة، وخوارزميات بحث، ومخططات، وملاحظات دائمة. في لعبة
tu93الشبيهة بالمتاهة مع حرّاس ودوريات متحركة، بدأ بالتنقل وبنىmaze_solver.py، ثم أضاف قواعد القتال فيcombat_solver.py، ونمذج الدوريات فيpatrol_solver.py، واستخدمsync_state.pyلمقارنة تنبؤاته بالمشاهدات الفعلية. ARC Prize نفسها تحذّر من قراءة هذه النتائج كأداء نموذج خالص: المشاركون البشريون لم يكن لديهم مفسّر كود ولا مسوّدة، فالنتيجة هي أداء النموذج وأدواته مجتمعين. - مقارنة التكلفة مع البشر مضلّلة بطبيعتها. في الاختبار المضبوط، دُفع للمشاركين 115 دولاراً للجلسة الواحدة (90 دقيقة) زائد 5 دولارات لكل لعبة مكتملة، وحاول المشارك نحو تسع ألعاب في الجلسة، أي ما يقارب 12.78 دولاراً لكل لعبة قبل المكافآت (وفقاً لـ ARC Prize). لكن هذا ثمن وقت الإنسان ورغبته في الخضوع للاختبار، لا ثمن الطاقة التي استهلكها دماغه. وإذا حُسبت طاقة الدماغ فقط وسُعّرت كهرباء، ينزل التقدير إلى نحو 0.6 سنت للجلسة أو 0.067 سنت للعبة. أي أن الفارق بين 19 ألف دولار وأجزاء من السنت هو الرقم الذي يستحق التوقف عنده، لا الفارق بين 19 ألفاً و12.78 دولاراً.
ARC Prize واضحة في أنها لا تعلن ذكاءً عاماً: تصف نتيجة Astra بأنها «تغيّر شبيه بالدالة الدرجية» في قدرات النماذج الحدودية وتقدّم حقيقي نحو التعميم، لكنها تكرّر أن تشبّع الاختبار لا يعني إثبات AGI، وأن ARC-AGI-3 محدود النطاق والصيغة وبيئاته حتمية ومغلقة الأهداف. تعريفها للـAGI يبقى قدرة النظام على اكتساب أي مهارة يكتسبها الإنسان وبالكفاءة نفسها، والاختبار يقيس «الفجوة المتبقية» لا نهايتها.
الأهم بالنسبة لمن يبني وكلاء اليوم ليس رقم 99.9% بل ما تحت الرقم: الفرق بين 62.7% و99.9% لم يأتِ من نموذج أذكى، بل من إدارة ذاكرة وسياق أفضل. هذا يعني أن هندسة الحزام، أي كيف تحفظ الحالة وتضغط المحادثة وتعيد استخدام العمل السابق، صارت متغيّراً بحجم النموذج نفسه. وهنا تكمن المشكلة: حالة الاستدلال في Provider Adapter معتمة ولا يمكن لأحد خارج OpenAI فحصها، وARC Prize نفسها تقول إنها لا تراها، ما يجعل النتيجة الأعلى غير قابلة للتحقق المستقل بالمعنى الدقيق، وغير قابلة للمقارنة العادلة عبر المزوّدين. لهذا قررت المؤسسة نشر نتائج الحزامين على لوحة الصدارة مع تسمية شرط التقييم لكل منهما، ووثّقت المنهجية في مستودع الاختبار المفتوح.
إذا كنت تبني وكيلاً يعمل في بيئة لا يعرفها مسبقاً، فالدرس العملي هو الملاحظات لا الدرجات: نموذج يحوّل مشاهداته إلى ترميز رمزي كثيف ويحمله معه أرخص وأسرع من نموذج يعيد الاستكشاف في كل نداء. أما جميع أرقام التكلفة والسرعة الواردة أعلاه فهي قياسات ARC Prize في ظروف اختبارها الخاصة، ولم يتسنَّ التحقق منها بشكل مستقل حتى الآن.
المصادر
- OpenAI’s GPT-6 Astra on ARC-AGI-3 | ARC Prize arcprize.org
- ARC Prize – What is ARC-AGI? arcprize.org
- GitHub – alexisfox7/PRO-LONG github.com
- GitHub – arcprize/arc-agi-3-benchmarking github.com







