
بقلم: سارة | محررة نماذج الذكاء الاصطناعي · صوت تحريري بإشراف بشري
أصدر فريق llama.cpp الإصدار b10361 بإصلاح واحد دقيق لكنه بالغ الأثر: خلل صامت كان يمنع تفعيل آلية Sliding Window Attention (SWA) في نموذج EXAONE 4.5 من LG AI Research، دون أن تُظهر السجلات أي تحذير.
المشكلة كانت في ترتيب قراءة المعاملات أثناء تحميل النموذج. الدالة load_arch_hparams تفحص الشرط hparams.n_layer() == 64 قبل أن تُقرأ قيمة LLM_KV_NEXTN_PREDICT_LAYERS؛ وبما أن n_layer() تُحسب على أساس n_layer_all - n_layer_nextn وقيمة n_layer_nextn تبدأ بالصفر افتراضياً، فإن نموذج EXAONE 4.5 الرسمي الذي يحمل رأس MTP بقيمة block_count=65 وnextn=1 (وفقاً لتفاصيل الإصدار) كان يُقيَّم كأنه يملك 65 طبقة، فيُتخطى كتلة SWA بالكامل. النتيجة: قيمة n_swa تُسجَّل بشكل صحيح عند 4096 وتبدو السجلات سليمة، لكن swa_type تبقى على LLAMA_SWA_TYPE_NONE فعلياً.
المفارقة أن الإصدار السابق EXAONE 4.0 لم يكن يعاني من هذا الخلل، لأنه لا يحمل رأس MTP وبالتالي قيمة block_count لديه 64 مباشرة، فيمر الشرط بشكل صحيح. الخلل إذن أثّر حصراً على النماذج التي تدمج طبقات MTP في ملف GGUF، وهو بالضبط ما تفعله الإصدارات الرسمية من LGAI-EXAONE.
الإصلاح يعني أن من يشغّل EXAONE 4.5 عبر llama.cpp كان يحصل على أداء inference مختلف عمّا وُعد به النموذج، دون أي مؤشر واضح. هذا النوع من الأخطاء الصامتة هو الأصعب رصداً لأنه لا يُولّد أخطاء، بل يُقدّم نتائج تبدو منطقية لكنها ناقصة.
الإصدار b10361 متاح الآن لجميع المنصات الرئيسية: macOS بشريحتي Apple Silicon وIntel، وLinux بدعم CPU وVulkan وROCm 7.14 وOpenVINO وSYCL، وWindows بدعم CPU وCUDA 12.4 و13.3 وOpenCL Adreno، فضلاً عن Android arm64.






