الإحصائيات والتقارير
-

نماذج اللغة تعرف الأجزاء لكنها تفشل في بناء الكل الإحصائي
بحث جديد يكشف المغالطة الكلية في نماذج اللغة الكبرى: النماذج تنتهك قانون الاحتمال الكلي وتُنتج تقديرات كلية أقل دقة من…
أكمل القراءة » -

فجوة التقييم: كيف تنشر مؤسسات AI وكلاءها وهي لا تثق باختباراتها
دراسة تشمل 157 مؤسسة تكشف أن فجوة التقييم تتسع: نصفها يعاني أعطال إنتاج رغم اجتياز الوكلاء الاختبارات الداخلية
أكمل القراءة » -

5 استنتاجات من دراسة 101 مؤسسة حول فجوة السياق في وكلاء الذكاء الاصطناعي
دراسة VentureBeat على 101 مؤسسة تكشف فجوة السياق في وكلاء الذكاء الاصطناعي: 57% رصدت إجابات واثقة وخاطئة وأغلبها لم تُكمل…
أكمل القراءة » -

ستة أرقام تكشف فجوة الحوسبة في الذكاء الاصطناعي المؤسسي
دراسة على 107 مؤسسات تكشف فجوة الحوسبة في الذكاء الاصطناعي: 83% من GPU تعمل بنصف طاقتها و64% تغيّر موردها خلال…
أكمل القراءة » -

GPT-5.6 Sol يتصدر تصميم الويب بفجوات مقصودة في نماذجه
كيف تعلّم GPT-5.6 Sol تجنّب أنماط التصميم الركيكة وتصدّر قائمة Design Arena بفارق 18 مرتبة عن GPT-5.5
أكمل القراءة » -

ست نتائج من دراسة 1000 استفسار تعيد رسم خارطة SEO في عصر AI Overviews
تحليل 6,410 استفسار fan-out يكشف أن AI Overviews تُخصص 43% من بحثها الداخلي للتحقق قبل أي توصية تجارية
أكمل القراءة » -

4 استنتاجات من أكبر تقييم بشري لصوت الذكاء الاصطناعي
Real World VoiceEQ يكشف أن نماذج الصوت تتقن الكلام أكثر من الاستماع، وأن المعايير التقليدية تُخفي الإخفاقات الحقيقية في المحادثات…
أكمل القراءة » -

Hindcast: إغلاق ثغرة التسرب في تقييم نماذج LLM التنبؤية
Hindcast إطار تقييم يمنع نماذج اللغة من الغش في اختبارات التنبؤ بإعادة تشغيل أسواق Polymarket من نقطة زمنية مجمدة قبل…
أكمل القراءة » -

نموذج Evo 2 يكشف مقاومة المضادات الحيوية في البيانات الجينومية بدقة 97%
مسابر خفيفة على نموذج Evo 2 الجينومي تكشف مقاومة المضادات الحيوية في بيانات الميتاجينوميك بدقة ROC-AUC تبلغ 0.977 دون ضبط…
أكمل القراءة » -

MetaPerch: نموذج يتعلم من بيانات الموقع والزمن لتمييز أصوات الحيوانات
MetaPerch نموذج أساسي للصوتيات الحيوانية يستخدم البيانات الوصفية كإشارات تدريب لتحسين التعرف على الأنواع عبر 17 مجموعة بيانات
أكمل القراءة »