الإحصائيات والتقارير
-

تحويل المحولات الضخمة إلى نماذج خطية دون خسارة الجودة
ورقة بحثية تكشف المفتاح الرياضي لتحويل Transformer إلى نموذج خطي عبر تحليل softmax وتطبيقه على LLaMA وQwen حتى 32 مليار…
أكمل القراءة » -

Co-LMLM: نموذج 360 مليون معامل يتفوق على بيانات تدريب أضخم بـ 40 مرة
Co-LMLM نموذج لغوي محدود الذاكرة يستخدم استعلامات متجهية مستمرة ويتفوق على GPT-4o-mini بحجم 360 مليون معامل فقط
أكمل القراءة » -

SciReasoner يُحقق 67 تفوقاً من 86 معياراً في العلوم الجزيئية
SciReasoner نموذج ذكاء اصطناعي متعدد الوسائط يحقق أداءً متصدراً في 67 من 86 معياراً علمياً عبر البيولوجيا والكيمياء وعلم المواد…
أكمل القراءة » -

Grok 4.5 ضد GPT-5.5 ضد Claude: من يبني التطبيقات أفضل وأسرع؟
مقارنة مباشرة بين Grok 4.5 وGPT-5.5 وClaude Opus 4.8 وFable 5 في بناء تطبيقات HTML حقيقية من مطالبة واحدة، مع…
أكمل القراءة » -

Nemotron 3 Ultra يعادل النماذج المغلقة بعُشر التكلفة عبر LangChain
نيموترون 3 ألترا يحقق تعادلاً في أداء مهام الأعمال مع أفضل النماذج المغلقة بتكلفة استدلال أقل بـ 10 أضعاف، دون…
أكمل القراءة » -

ستة شركات ذكاء اصطناعي تكسر أرقامها القياسية في أشهر لا سنوات
تسارع إيرادات شركات الذكاء الاصطناعي يُعيد رسم قواعد السوق — Anthropic من 4 مليارات إلى 47 ملياراً في أقل من…
أكمل القراءة » -

PACE: تقييم وكلاء الذكاء الاصطناعي بدقة عالية وبأقل من 1% من التكلفة
إطار PACE يتنبأ بأداء وكلاء LLM على SWE-Bench وGAIA بخطأ أقل من 4% وارتباط سبيرمان فوق 0.80 وبأقل من 1%…
أكمل القراءة » -

ثلاث تكرارات تكفي: ما تقوله الأبحاث عن حلقات إصلاح الكود بالذكاء الاصطناعي
بحث على arXiv يكشف أن حلقات إصلاح الكود بنماذج LLM تصل إلى تشبع بعد ثلاث إلى أربع تكرارات، وأن تصميم…
أكمل القراءة » -

مولّدات الصور تفشل في 80% من اختبارات المعرفة الحقيقية وبحث جديد يكشف السبب
بنشمارك SearchGen-20K الجديد يكشف أن أفضل مولّدات الصور المفتوحة تسجّل بين 21 و28 من 100 في اختبارات المعرفة العالمية
أكمل القراءة » -

LLM-as-a-Verifier: محور تحسين جديد لنماذج اللغة الكبيرة دون تدريب إضافي
إطار LLM-as-a-Verifier يُقدّم التحقق كمحور تحسين مستقل لنماذج اللغة الكبيرة ويُحقق أداءً متصدراً على أربعة معايير تقنية كبرى
أكمل القراءة »