الإحصائيات والتقارير
-

معيار WANDR يكشف عجز وكلاء البحث الذكي عند 0.133 هارد F1
معيار WANDR من Perplexity يختبر 500 مهمة بحث ويكشف أن أفضل وكلاء الذكاء الاصطناعي لا يتجاوز هارد F1 لديها 0.133…
أكمل القراءة » -

نبض سوق الذكاء الاصطناعي — أسبوع اصطاد فيه الوكلاء بعضهم
أخبار الذكاء الاصطناعي في أسبوع واحد: أول اختراق موثق بوكيل مستقل، حقن المطالبات يتحول درعاً، vLLM يطوي PagedAttention، والمصدر المفتوح…
أكمل القراءة » -

Inkling يتصدر النماذج المفتوحة على ARC-AGI بأقل من دولار للمهمة
نموذج Inkling من Thinking Machines يحقق 79.5% على ARC-AGI-1 و36.5% على ARC-AGI-2 ليكون الأعلى بين النماذج مفتوحة الأوزان وفق ARC…
أكمل القراءة » -

Kimi K3 من Moonshot AI يتحدى النماذج الأمريكية بـ 2.8 تريليون معامل
كيمي K3 من Moonshot AI يُطلق نموذجاً بـ 2.8 تريليون معامل ونافذة سياق مليون رمز تنافس أبرز النماذج الأمريكية بتكلفة…
أكمل القراءة » -

تقرير موزيلا 2026: المفتوح يفوز بالتوكنات ويتعثر في الإنتاج
تقرير موزيلا لحالة الذكاء الاصطناعي مفتوح المصدر 2026 يكشف سيطرة النماذج المفتوحة على أغلب التوكنات مع فجوة تشغيلية واضحة تُبطئ…
أكمل القراءة » -

Schema يُوصل نماذج الذكاء الاصطناعي إلى 99% على معيار ARC-AGI-3
إطار Schema يُلزم النماذج الحدية بكتابة آلية اللعبة كبرنامج قابل للتنفيذ واختباره، محققاً 99% على ARC-AGI-3 Public
أكمل القراءة » -

وكلاء الأمن السيبراني: معيار التكلفة يكشف ما يخفيه معدل النجاح
بحث جديد يُفكك أداء وكلاء الأمن السيبراني بمعيار التكلفة، ويكشف أن الوكلاء الهجومية والدفاعية تتبع نمطي توسع مختلفين تماماً
أكمل القراءة » -

وثيقة الجسر — ثلث مستندات الوكيل مُهمة وتبدو عديمة الفائدة
دراسة على 23,322 مشاهدة تُثبت أن معايير الاسترجاع التقليدية لا تتنبأ بالأثر السببي لوثائق البحث في وكلاء الذكاء الاصطناعي متعددة…
أكمل القراءة » -

وكلاء الكود يثبّتون حزماً مخترقة من ملفات التوثيق دون تحقق
بحث أكاديمي يكشف أن هجمات سلسلة التوريد على وكلاء الكود تنجح عبر تعديل README فقط، والأمان يتوقف على ثنائية الإطار…
أكمل القراءة » -

SciDiagramEdit: ذكاء اصطناعي يتعلم تعديل مخططات الأوراق البحثية تلقائياً
SciDiagramEdit إطار عمل يستخرج أزواج قبل وبعد من arXiv ليتعلم تعديل مخططات الأبحاث بتعليمات لغوية طبيعية
أكمل القراءة »