الإحصائيات والتقارير
-

وثيقة الجسر — ثلث مستندات الوكيل مُهمة وتبدو عديمة الفائدة
دراسة على 23,322 مشاهدة تُثبت أن معايير الاسترجاع التقليدية لا تتنبأ بالأثر السببي لوثائق البحث في وكلاء الذكاء الاصطناعي متعددة…
أكمل القراءة » -

وكلاء الكود يثبّتون حزماً مخترقة من ملفات التوثيق دون تحقق
بحث أكاديمي يكشف أن هجمات سلسلة التوريد على وكلاء الكود تنجح عبر تعديل README فقط، والأمان يتوقف على ثنائية الإطار…
أكمل القراءة » -

SciDiagramEdit: ذكاء اصطناعي يتعلم تعديل مخططات الأوراق البحثية تلقائياً
SciDiagramEdit إطار عمل يستخرج أزواج قبل وبعد من arXiv ليتعلم تعديل مخططات الأبحاث بتعليمات لغوية طبيعية
أكمل القراءة » -

نماذج اللغة تعرف الأجزاء لكنها تفشل في بناء الكل الإحصائي
بحث جديد يكشف المغالطة الكلية في نماذج اللغة الكبرى: النماذج تنتهك قانون الاحتمال الكلي وتُنتج تقديرات كلية أقل دقة من…
أكمل القراءة » -

فجوة التقييم: كيف تنشر مؤسسات AI وكلاءها وهي لا تثق باختباراتها
دراسة تشمل 157 مؤسسة تكشف أن فجوة التقييم تتسع: نصفها يعاني أعطال إنتاج رغم اجتياز الوكلاء الاختبارات الداخلية
أكمل القراءة » -

5 استنتاجات من دراسة 101 مؤسسة حول فجوة السياق في وكلاء الذكاء الاصطناعي
دراسة VentureBeat على 101 مؤسسة تكشف فجوة السياق في وكلاء الذكاء الاصطناعي: 57% رصدت إجابات واثقة وخاطئة وأغلبها لم تُكمل…
أكمل القراءة » -

ستة أرقام تكشف فجوة الحوسبة في الذكاء الاصطناعي المؤسسي
دراسة على 107 مؤسسات تكشف فجوة الحوسبة في الذكاء الاصطناعي: 83% من GPU تعمل بنصف طاقتها و64% تغيّر موردها خلال…
أكمل القراءة » -

GPT-5.6 Sol يتصدر تصميم الويب بفجوات مقصودة في نماذجه
كيف تعلّم GPT-5.6 Sol تجنّب أنماط التصميم الركيكة وتصدّر قائمة Design Arena بفارق 18 مرتبة عن GPT-5.5
أكمل القراءة » -

ست نتائج من دراسة 1000 استفسار تعيد رسم خارطة SEO في عصر AI Overviews
تحليل 6,410 استفسار fan-out يكشف أن AI Overviews تُخصص 43% من بحثها الداخلي للتحقق قبل أي توصية تجارية
أكمل القراءة » -

4 استنتاجات من أكبر تقييم بشري لصوت الذكاء الاصطناعي
Real World VoiceEQ يكشف أن نماذج الصوت تتقن الكلام أكثر من الاستماع، وأن المعايير التقليدية تُخفي الإخفاقات الحقيقية في المحادثات…
أكمل القراءة »