تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعي

Grok 4.6 يُدرّب وكلاءه على التحقق من عملهم ذاتياً

بقلم: ليلى | محررة أدوات المطورين · صوت تحريري بإشراف بشري

أطلقت xAI اليوم نموذجها الجديد Grok 4.6، وهو تطور مباشر على Grok 4.5 مع تحولٍ واضح في الأولويات: الوكلاء الذين يعملون لفترات طويلة، والمشاريع البصرية والتفاعلية المعقدة. والأهم من ذلك، أن النموذج بدأ يُطوّر سلوكاً لم تُبرمجه فيه الشركة صراحةً — التحقق من عمله قبل المضي قدماً.

على مستوى المعايير المرجعية، يُسجّل Grok 4.6 نتيجة 61 على مؤشر Artificial Analysis Intelligence Index المركّب المؤلف من تسعة معايير، وهي النتيجة ذاتها التي يُسجّلها GPT-5.6 Sol Max من OpenAI، فيما يتفوق عليه Fable 5 Max بنقطة واحدة فقط بنتيجة 62 (وفقاً لـ xAI). لكن الصورة تختلف عبر المعايير المتخصصة: فعلى GDPVal-AA يُسجّل الجديد 17531 مقابل 17281 لـ Fable 5 Max، وعلى CursorBench v3.2 يصل إلى 69.9% متجاوزاً GPT-5.6 Sol Max الذي يقف عند 67.2%. أما على Harvey LAB فيُحقق Grok 4.6 أفضل نتيجة بين جميع النماذج المقارنة بنسبة 15.8% مقابل 12.9% لـ Grok 4.5 و2.5% فقط لـ GPT-5.6 Sol Max.

في المقابل، تبقى هناك فجوات واضحة: على DeepSWE v1.1 يُسجّل Grok 4.6 نسبة 65.9% مقابل 73% لـ GPT-5.6 Sol Max، وعلى Terminal-Bench v3.0 لا يتجاوز 26% في حين يصل المنافسان إلى 34.6% و34.1% على التوالي (وفقاً لـ xAI). هذا التفاوت يُشير إلى أن xAI اختارت تعميق الأداء في مهام بعينها بدلاً من الملاحقة العامة للمنافسين.

ما يميّز هذا الإصدار تقنياً هو منهجية التدريب المعدّلة. خضع Grok 4.6 لجولة تدريب تكميلية أطول من سابقه، استُخدمت فيها بيانات مُولَّدة من النماذج ذاتها للتفكير والمفاهيم التقنية المتقدمة، مع تحسينات على المحسِّن وصيغة التدريب. ثم استُخدم Grok 4.5 نفسه لإعادة توليد مسارات Supervised Fine-Tuning عبر مستويات مختلفة من جهد التفكير وأطر الوكلاء ومجالات STEM وهندسة البرمجيات والعمل المعرفي، مع تصفية المسارات الإشكالية بفحوصات مبنية على النماذج. تقنياً، هذه حلقة تحسين ذاتي منضبطة — النموذج الأقدم يُدرّب الأحدث، والأحدث يُصحّح أخطاء الأقدم.

على صعيد التطبيقات، اختبرت xAI النموذج على مشاريع مُصمَّمة لاستنزاف قدراته عبر مسارات طويلة متعددة الخطوات. النتيجة: Grok 4.6 قادر على أخذ فكرة منتج غير ناضجة وتحويلها إلى نسخة أولى عاملة — يبحث في المجالات غير المألوفة، ويضع هيكل التطبيق، ويُنفّذ التفاعلات الجوهرية، ثم يواصل التحسين عبر جولات متعددة من التغذية الراجعة. والأبرز من ذلك أنه في المسارات الأطول، لاحظ الفريق بروز سلوك التحقق الذاتي — حيث يختبر النموذج عمله قبل الانتقال إلى الخطوة التالية، وهو ما تُشير إليه xAI كتطور ناشئ وليس ميزة مُبرمجة صريحة.

على صعيد البصريات والتفاعلية، يُنتج Grok 4.6 مخرجات أقوى في المرور الأول مقارنةً بـ Grok 4.5. بمعنى أنه قادر على تحديد بنية التطبيق ولغته البصرية في جولة واحدة، وهو ما يُقلّص التكرار اللازم للوصول إلى نتيجة مقبولة في المشاريع التي تُقدّر السرعة.

التوفر والتسعير واضحان: النموذج متاح اليوم في Cursor وGrok Build، وعبر الـ API مباشرةً وعبر شركاء من أمثال OpenRouter وVercel وCloudflare. السعر يبدأ من $2 لكل مليون رمز إدخال و$6 لكل مليون رمز إخراج، مع نسخة سريعة بضعف السعر. وللأسبوع الأول، تُقدّم xAI ضعف الاستخدام المعتاد مجاناً داخل Grok Build وCursor لتشجيع التجربة الفورية. المطورون يمكنهم الوصول مباشرةً عبر API Console ومراجعة التوثيق الرسمي.

على صعيد السلامة، تُؤكد xAI توسيع منظومة الاختبارات لتشمل أوسع مجموعة اختبارات قبل النشر في تاريخ الشركة، إلى جانب اختبارات خارجية مستقلة، مع معايرة الضمانات لتتناسب مع القدرات الموسّعة للنموذج في مجالات مثل معالجة الثغرات الأمنية وتسريع دورة التصميم الهندسي وأبحاث الذكاء الاصطناعي.

المؤشر الحقيقي لهذا الإصدار ليس أرقام المعايير المرجعية فحسب — بل النهج: xAI تراهن على أن الوكلاء الذين يتحققون من أنفسهم أكثر قيمة من الوكلاء الأسرع. إن كانت هذه الرهان صحيحاً، فإن Grok 4.6 يُمثّل خطوة منهجية نحو نماذج يمكن الوثوق بها على مهام طويلة المدى بأقل إشراف بشري ممكن.

xAI Blog

مقالات ذات صلة

زر الذهاب إلى الأعلى