الإحصائيات والتقارير
-

النقد اللغوي بديلاً للأرقام في تعليم الذكاء الاصطناعي من بيانات ناقصة
إطار LCIL يستخدم النقد اللغوي المنظَّم إشارةً للتدريب في تعلّم المحاكاة من بيانات غير مثالية، متفوقاً على Offline RL وImitation…
أكمل القراءة » -

طبقة واحدة في المحوّل تُعادل التدريب المعزز الكامل لنماذج اللغة
دراسة على 7 نماذج Qwen تكشف أن layer contribution في التعلم المعزز يتركز في الطبقات الوسطى، ما يفتح آفاقاً لخفض…
أكمل القراءة » -

دراسة تقيس الفجوة بين أفكار الباحثين ونماذج اللغة الكبيرة
باحثون من Yale يبنون أول إطار كمي لقياس فجوة أفكار البحث العلمي بين البشر ونماذج اللغة الكبيرة LLM
أكمل القراءة » -

ثلث محادثات ChatGPT تولّد خيالاً أدبياً وفق دراسة جديدة
دراسة تحلّل 500,000 محادثة حقيقية تكشف أن توليد الخيال الأدبي في ChatGPT يهيمن عليه مستخدمون كثيفو الاستخدام يطلبون قصصاً لا…
أكمل القراءة » -

GeneBench-Pro يكشف الهوة الحقيقية بين الذكاء الاصطناعي والخبرة العلمية
معيار GeneBench-Pro من OpenAI يختبر "ذوق البحث العلمي" لدى الوكلاء الذكيين، وأفضل النماذج لم يتجاوز 31.5% من المهام التي يستغرق…
أكمل القراءة » -

5 استنتاجات تُعيد تعريف ظهور علامتك في الذكاء الاصطناعي
دراسة على 12,000 استجابة تكشف أن ذكر علامتك التجارية في الذكاء الاصطناعي لا يعني الاستشهاد بموقعك — وكيف تُغلق هذه…
أكمل القراءة » -

نماذج اللغة تُخطئ في قراءة الجداول رغم فهمها لبنيتها
ورقة بحثية تُقيّم أخطاء الإسناد البياني في نماذج LLM وتُثبت أن ناقدًا بحجم 4B يُحسّن الدقة 12% ويرصد الأخطاء بنسبة…
أكمل القراءة » -

QVal يكشف أن prompting البسيط يتفوق على 21 طريقة إشراف في وكلاء LLM
QVal إطار تقييم جديد يقيس جودة إشارات الإشراف الكثيف لوكلاء LLM قبل التدريب، باختبار 21 طريقة عبر 1,200 تجربة
أكمل القراءة » -

ScarfBench من IBM: أقل من 10% نجاح لوكلاء الكود في هجرة Java المؤسسية
ScarfBench معيار IBM لقياس وكلاء الذكاء الاصطناعي في هجرة أطر Java يكشف أن أفضل الوكلاء لا يتجاوز نجاحها 10% في…
أكمل القراءة » -

فجوة الذكاء الاصطناعي في بريطانيا تُنتج نخبة تكسب أكثر وترتقي أسرع
دراسة جوجل وPublic First تكشف أن تبني الذكاء الاصطناعي في بريطانيا تضاعف إلى 73%، لكن 15% فقط من القوى العاملة…
أكمل القراءة »