
بلا أي تعديل على النموذج، رفع تغيير إطار التشغيل نتيجة Gemini 3.8 Flash على ARC-AGI-3 من 10.37% إلى 35%.
ضمن ملف: جوجل والذكاء الاصطناعي، نماذج الذكاء الاصطناعي
بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري
المصدر الأساسي: ARC Prize
لماذا يهم
يحصل مطورو الوكلاء على دليل رقمي على أن حفظ حالة التفكير وضغط السياق قد يساويان قفزة جيل في النماذج. وعلى من يقارن النماذج أن يسأل عن الإطار قبل الرقم.
35.00% هي النتيجة التي سجّلها Gemini 3.8 Flash على ARC-AGI-3 بالتفكير المرتفع حين شُغّل عبر إطار Provider Adapter. بالنموذج نفسه ومستوى التفكير نفسه، لكن عبر الإطار القياسي، لم تتجاوز النتيجة 10.37% (وفقاً لـ ARC Prize). لم تتغيّر الأوزان، وتغيّرت فقط طريقة وصل النموذج ببيئة الاختبار، فارتفعت النتيجة نحو 3.4 مرات. في تقديرنا هذا الفارق أهم ما في الصفحة، وأهم من الأرقام شبه الكاملة التي حققها النموذج على النسختين الأولى والثانية من الاختبار.
مصدر الأرقام ليس Google. نشرت مؤسسة ARC Prize هذه النتائج على صفحتها بوصفها “نتائج موثّقة” (Verified scores)، مؤرخة في 2 سبتمبر 2026، وقاستها على المجموعة شبه الخاصة (Semi-Private) عبر 6 إعدادات تشغيل (وفقاً لـ ARC Prize). تجمع هذه الإعدادات ثلاثة مستويات تفكير، هي المرتفع والمتوسط والمنخفض، مع إطارين (harness) على النسخة الثالثة. مواصفات النموذج نفسه موجودة في بطاقة النموذج على DeepMind، وفي تدوينة Google عن إطلاق 3.8 Flash و3.8 Flash Cyber. تعتمد القصة إذن على مصدر وحيد هو جهة الاختبار، ولم يتسنَّ التحقق من الأرقام بشكل مستقل خارجها.
يتضح سبب الفارق من تعريف الإطارين. في الإطار القياسي يحمل النموذج عبر البيئة ملاحظات يختار بنفسه الاحتفاظ بها. أما Provider Adapter فيحفظ حالة التفكير المعتمة (opaque reasoning state) بين الطلبات، ويلجأ إلى الضغط (compaction) في المحادثات الطويلة، فيعيد النموذج استخدام ما أنجزه سابقاً بدل أن يبدأ من الصفر (وفقاً لـ ARC Prize). يظهر أثر ذلك في المستويات الثلاثة كلها. مع الإطار القياسي جاءت النتائج 10.37% و3.99% و5.99% للمرتفع والمتوسط والمنخفض على الترتيب. ومع Provider Adapter صارت 35.00% و24.20% و15.07% (وفقاً لـ ARC Prize). حتى التفكير المنخفض عبر الإطار الأفضل تجاوز التفكير المرتفع عبر الإطار القياسي.
أما النسختان الأقدم فتقتربان من التشبّع. سجّل النموذج على ARC-AGI-1 نسبة 98.5% بالتفكير المرتفع و97.5% بالمتوسط و90.5% بالمنخفض. وعلى ARC-AGI-2 سجّل 89.2% و82.9% و77.5% على الترتيب (وفقاً لـ ARC Prize). هذه أرقام نموذج من فئة Flash، أي الفئة المخصّصة للسرعة وانخفاض التكلفة، على اختبار صُمّم أصلاً ليكشف عجز النماذج الكبيرة.
تفاصيل البيئات الخمس والعشرين في جداول العرض العام (Public Demo) تبيّن حجم التفاوت. هذه الجداول مجموعة مختلفة عن المجموعة شبه الخاصة التي بُنيت عليها النتيجة الرئيسية. بالإطار القياسي وعلى المستوى المرتفع، جاءت النتائج كالتالي: LP85 وS5I5 عند 77.8% لكل منهما، وDC22 عند 47.6%، وAR25 عند 45.9%، وCN04 عند 30.3%، وRE86 عند 27.8%، وSC25 عند 24.7%، وR11L عند 22.6%، وVC33 عند 21.2%. وسجّلت WA30 نسبة 16.1%، وFT09 وSP80 نسبة 14.3% لكل منهما، وSU15 نسبة 12.1%، وLS20 وTN36 نسبة 10.7% لكل منهما، وM0R0 نسبة 7.7%. ثم CD82 عند 4.8%، وTU93 عند 4.4%، وKA59 عند 3.6%، وSB26 وSK48 عند 2.8% لكل منهما، وLF52 عند 1.8%. وسجّلت BP35 وG50T وTR87 صفراً (وفقاً لـ ARC Prize).
ومع Provider Adapter على المستوى المرتفع، بلغ النموذج 100% في سبع بيئات هي AR25 وFT09 وLP85 وRE86 وS5I5 وSB26 وVC33. تلتها R11L بنسبة 89.7%، وSU15 بنسبة 89.5%، وSC25 بنسبة 71.4%، وTN36 بنسبة 64.3%. وقفزت G50T من الصفر إلى 62.7%. ثم جاءت M0R0 عند 59.9%، وDC22 عند 54.6%، وSP80 عند 47.6%، وWA30 عند 43.3%، وCD82 عند 39.9%، وCN04 عند 34.2%، وTU93 عند 33.3%، وSK48 عند 15.1%، وKA59 عند 14.9% (وفقاً لـ ARC Prize). لكن أربع بيئات بقيت شبه مستعصية مع الإطارين: LS20 عند 5.4%، وTR87 عند 4.8%، وLF52 ثابتة عند 1.8% في كل المستويات، وBP35 عند 0.1% فقط.
ولا يتحسّن الأداء دائماً مع إطالة التفكير. في بيئة LP85 بالإطار القياسي، سجّل المستوى المنخفض 86.4%، مقابل 77.8% للمرتفع و41.7% للمتوسط. ومع Provider Adapter يزداد التذبذب. في VC33 سجّل النموذج 100% بالمرتفع و0.0% بالمتوسط، وفي SB26 سجّل 100% بالمرتفع و4.3% بالمنخفض. وفي CN04 تفوّق المنخفض بنسبة 39.9% على المرتفع بنسبة 34.2%، وفي KA59 تفوّق المتوسط بنسبة 25.8% على المرتفع بنسبة 14.9% (وفقاً لـ ARC Prize). ويظهر النمط نفسه في المهام الثابتة. على مجموعة ARC-AGI-2 العامة المكوّنة من 120 مهمة، أخفق المستوى المرتفع في 12 مهمة بحسب عدّنا لجدول ARC Prize. فشلت المستويات الثلاثة معاً في 11 منها، بينها 13e47133 و247ef758 و4e34c42c وfaa9f03d. أما المهمة 6ffbe589 فأخفق فيها المرتفع وحلّها المستويان الآخران. وعلى مجموعة ARC-AGI-1 المكوّنة من 400 مهمة، فشلت المهمة 79fb03f4 بالتفكير المرتفع ونجحت بالمستويين الآخرين.
تضع الصفحة النموذج بجانب منافسين مقيسين، منهم Claude Opus 5 وGPT-6 Astra وGrok 4.6 وKimi K3 وDeepSeek V4 Pro، وبجانب سلفه Gemini 3.7 Flash. لكن النص المتاح لا يعرض أرقامهم، فلا تصح مقارنة مباشرة من هذا المصدر وحده. وللتذكير، نقلت موجز سابقاً نتيجة GPT-6 Astra على ARC-AGI-3، وهي تشير إلى أن الفجوة على النسخة الثالثة ما زالت واسعة بين نموذج Flash ونموذج رائد. هذه الأرقام تحمل ثلاث دلالات:
- نتيجة ARC-AGI-3 تقيس منظومة كاملة لا نموذجاً مجرداً. حين يرتفع الأداء من 10.37% إلى 35% دون تعديل الأوزان، فالرقم يصف النموذج والذاكرة وإدارة السياق معاً. ومن يقارن نماذج الوكلاء عبر أي benchmark عليه أن يسأل عن الإطار المستخدم قبل أن يقرأ الرقم.
- الإطار الذي يحفظ حالة التفكير الخاصة بالمزوّد قد يمنح ميزة يصعب فصلها عن قدرة النموذج الخام. هذا استنتاج تحليلي منا، ولا تقرّه الصفحة صراحة، لكنه يفسّر اتساع الفارق مقارنة بإطار الملاحظات البسيطة.
- مستوى التفكير الأعلى لا يضمن نتيجة أفضل. إن كنت تبني وكيلاً فوق Gemini أو فوق أي نموذج آخر، فاختبر إعداداتك على مهامك الفعلية قبل أن تدفع تكلفة التفكير المرتفع افتراضاً. في حالات عدة موثّقة هنا، أنجز التفكير الأقل ما عجز عنه الأعلى.
المصادر
- Gemini 3.8 Flash – ARC-AGI Results arcprize.org
- Gemini 3.8 Flash – Model Card deepmind.google
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyber blog.google
- ARC-AGI-3 Replay arcprize.org
- ARC-AGI-3 Replay arcprize.org
- ARC-AGI-3 Replay arcprize.org







