تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعياختيار المحررين

Claude Opus 5: ذكاء يقترب من الحدود القصوى بنصف التكلفة

بقلم: سارة | محررة نماذج الذكاء الاصطناعي · صوت تحريري بإشراف بشري

أطلقت Anthropic اليوم Claude Opus 5، وهو النموذج الذي صمّمته لتكون إجابتها على سؤال محدد: هل يمكن الحصول على ذكاء يقترب من الحدود القصوى للتكنولوجيا الحالية، لكن بنصف التكلفة؟ الجواب، وفق الأرقام الصادرة اليوم، يبدو نعم — مع قيد واحد سنعود إليه.

النموذج الجديد يصبح النموذج الافتراضي على Claude Max، والنموذج الأقوى على Claude Pro، ويُتيح للعملاء ضبط “مستوى الجهد” للتحكم في التوازن بين الدقة والسرعة والتكلفة — وهي ميزة تجعله مرناً بشكل غير مسبوق في بيئات الإنتاج الحقيقية.

فيما يلي أبرز ما يقدمه Claude Opus 5 مقارنةً بسابقه Opus 4.8 وبأقوى نماذج المنافسين، مدعوماً بأرقام دقيقة من التقييمات الرسمية:

  1. تصدُّر Frontier-Bench في البرمجة: على Frontier-Bench v0.1، يتجاوز Opus 5 جميع النماذج المنافسة، ويُضاعف أداء Opus 4.8 أكثر من مرتين بتكلفة أقل لكل مهمة (وفقاً لـ Anthropic). على CursorBench 3.2 بأقصى جهد، يصل إلى أداء يقل عن Fable 5 بـ 0.5% فقط، لكن بنصف التكلفة.
  2. ثلاثة أضعاف المنافس على ARC-AGI 3: في تقييم حل المشكلات الجديدة ARC-AGI 3، حقق Opus 5 درجة تبلغ ثلاثة أضعاف أفضل نموذج منافس (وفقاً لـ Anthropic). هذا ليس تحسيناً هامشياً — إنه فجوة تُشير إلى قدرة مختلفة نوعياً في التعميم وحل المشكلات غير المألوفة.
  3. 1.5× معدل نجاح Zapier AutomationBench: في اختبار إتمام مهام الأعمال من البداية للنهاية، يُحقق Opus 5 معدل نجاح يبلغ 1.5 ضعف أفضل نموذج منافس بالتكلفة ذاتها (وفقاً لـ Anthropic). حتى على أدنى مستوى جهد، يتجاوز Opus 5 نسبة نجاح أي نموذج آخر. شركة Zapier نفسها وثّقت أنه أكمل تسلسل منع تراجع العملاء كاملاً — تحديد الحسابات المعرضة للخطر، وتنبيه المسؤول، وإعداد الملخص لفريق الاستبقاء — في حين فشلت النماذج السابقة.
  4. أداء استثنائي على computer use بثلث التكلفة: على OSWorld 2.0، يتفوق Opus 5 على كل النماذج بأي تكلفة محددة، بل يتجاوز أفضل نتيجة لـ Fable 5 بأقل من ثلث تكلفته (وفقاً لـ Anthropic). هذا يفتح الباب لسيناريوهات أتمتة واسعة النطاق لم تكن مجدية اقتصادياً من قبل.
  5. قفزة في العلوم الحياتية والكيمياء: يتفوق Opus 5 على Opus 4.8 في جميع تقييمات علوم الحياة، مع تحسّن أكثر وضوحاً في الكيمياء العضوية (+10.2 نقطة مئوية على استنتاج البنى الجزيئية من بيانات الطيف الضوئي) وفي مهام البروتينات (+7.7 نقطة مئوية على التنبؤ بتأثير التغيرات التسلسلية على وظيفة البروتين) (وفقاً لـ Anthropic). شركاء في أبحاث الجينوم وصفوه بأنه “يتصرف كعالم حذر” يختار الاختبارات الإحصائية الصحيحة ويتحقق من نتائجه بطرق مستقلة.
  6. وكالة حقيقية في مواجهة المشكلات المعقدة: ثلاث حالات موثّقة من الاختبار المبكر تكشف شيئاً أعمق من مجرد الأداء على benchmark. في إحداها، أُعطي Opus 5 رسماً لقطعة ميكانيكية وطُلب منه بناؤها كنموذج FreeCAD ثلاثي الأبعاد — لكن دون إتاحة طريقة لرؤية الرسم مباشرة. استجاب بكتابة pipeline للرؤية الحاسوبية لاستخراج الهندسة من البيكسلات الخام، ثم أعاد بناء القطعة كاملة. نجح في ذلك مراراً؛ ولم يستطع أي نموذج منافس حل المهمة بعد خمس محاولات. في حالة ثانية، عثر على السبب الجذري لخطأ في حزمة مفتوحة المصدر شائعة، وأصلح حالة حدودية فاتت التصحيح المجتمعي، بينما اكتفى النموذج المنافس بمعالجة العَرَض السطحي. في الثالثة، بنى مهندس في شركة تداول منظومة بيانات السوق لبورصة جديدة في جلسة واحدة — ولأن لم يكن هناك feed حي للتحقق منه، بنى Opus 5 من تلقاء نفسه منظومة اختبار للتحقق من صحة تحليل البيانات.
  7. كفاءة أعلى في الاستدلال القانوني والمالي: على الأعمال القانونية، أفادت إحدى المنصات بتحقيق أداء مماثل مع توليد أقل بـ 26% من الرموز مقارنةً بـ Opus 4.8 على أقصى مستوى استدلال (وفقاً لـ Anthropic). وفي النمذجة المالية، وثّقت إحدى المنصات دقة أعلى بـ 9 نقاط مئوية في المتوسط عبر مستويات الجهد، مع تقليل عدد الأدوار والأدوات بمقدار الثلث، و60% أقل من الوقت الإجمالي. منصة التداول Harvey أفادت بأنه يُنجز المهام باستخدام سُبع رموز الاستدلال التي يستهلكها Opus 4.8 بأقل من نصف وقت الاستجابة.

على صعيد السلامة والتوافق، تصف Anthropic Opus 5 بأنه أكثر نماذجها توافقاً مع القيم المرسومة، الأقل في السلوك الخادع، والأصعب استغلالاً لأغراض غير مقصودة — متفوقاً في هذا على Opus 4.8 وSonnet 5 وFable 5 معاً. القيد الوحيد المُعلَن: يظل متأخراً عن Mythos 5 في مهام الأمن السيبراني تحديداً.

ما يستحق الانتباه هنا ليس مجرد قائمة الأرقام، بل النمط الذي تكشفه: Opus 5 لا يكتفي بحل المهام، بل يُراجع عمله ويبني أدواته الخاصة حين تنقصه الموارد. هذا النوع من الوكالة الذاتية هو ما يميّزه عن التحسينات التدريجية المعتادة. للمطورين الذين تتطلب أعمالهم نماذج طويلة الأفق وأقل إشرافاً، قد يكون هذا الإصدار هو نقطة التحوّل التي انتظروها — خاصةً أن التكلفة لا تُشكّل عائقاً هذه المرة. ويمكنك الاطلاع على كيف تُؤثر هندسة السياق على أداء نماذج Claude 5 في هذا المقال.

Anthropic Blog

مقالات ذات صلة

زر الذهاب إلى الأعلى