تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
الإحصائيات والتقارير

llama.cpp يُسرّع الاستدلال على Apple Silicon بنسبة تصل لـ 47%

بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري

في الإصدار llama.cpp b10236، جاء التحديث الوحيد والمركّز: تطبيق Lightning Indexer على واجهة Metal من Apple، وهو تحسين عميق في آلية البحث عن المؤشرات داخل KV Cache يُغير موازين الأداء بشكل ملموس عند العمل مع سياقات طويلة.

الأرقام هي القصة هنا. (وفقاً لـ llama.cpp GitHub) عند سياق قصير (d=0)، يرتفع معدل معالجة الـ prompt من 153.73 إلى 155.19 توكن/ثانية — تحسن هامشي. لكن المشهد يتغير جذرياً مع اتساع السياق: عند 10,000 توكن ترتفع سرعة المعالجة من 73.90 إلى 86.95 توكن/ثانية، أي بزيادة تقارب 18%. عند 20,000 توكن تقفز من 45.83 إلى 62.01 توكن/ثانية، زيادة 35%. أما عند 30,000 توكن فتنتقل من 33.40 إلى 49.18 توكن/ثانية، بما يعادل نحو 47% تحسناً في الأداء — وهو الرقم الأبرز في هذا الإصدار.

سرعة توليد النصوص (tg128) تستفيد هي الأخرى، لكن بقدر أكثر اعتدالاً: من 8.91 إلى 8.95 توكن/ثانية بدون سياق ممتد، ومن 7.94 إلى 8.60 توكن/ثانية عند 30,000 توكن. (وفقاً لـ llama.cpp GitHub) المكاسب الكبيرة تتركز في مرحلة prefill، وهي المرحلة التي يعاني فيها Metal تاريخياً مع ذاكرة KV المتضخمة.

من الناحية التقنية، يعمل Lightning Indexer على مدخلات ذات 128 بُعداً و64 رأساً، مع queries وأوزان بصيغة F32، ومفاتيح وأقنعة بصيغة F16. المرحلة الثانية من التطوير أضافت تقسيم مصفوفات K إلى tiles داخل ذاكرة threadgroup وإلغاء تكميمها إلى F16 قبل تحميلها بواسطة simdgroup matrix — وهي تقنية تقلل الضغط على bandwidth الذاكرة وتمهّد الطريق لدعم صيغ كمّية متعددة. الإصدار يدعم الآن مخازن K بصيغ: F32, F16, BF16, Q4_0, Q4_1, Q5_0, Q5_1, وQ8_0، ما يمنح المطورين مرونة كاملة في اختيار التوازن بين الدقة والسرعة وحجم الذاكرة.

ما يستحق الإشارة هنا أن التسريع الأكبر يقع بالضبط في المشكلة الأصعب: التعامل مع نماذج كبيرة تُشغَّل على سياقات ممتدة على أجهزة Apple Silicon. هذا هو السيناريو الذي يشغل ذاكرة الـ RAM بسرعة ويجعل الاستدلال يتباطأ بشكل تدريجي. التحسن النسبي الأكبر عند 30,000 توكن يشير إلى أن المكاسب ستتصاعد كلما اتسع السياق أكثر — وهو ما يُرجَّح أن يُظهره الاختبار عند 40,000 أو 50,000 توكن.

الإصدار متاح لتنزيله مباشرة لمنصات macOS Apple Silicon وIntel، وLinux وWindows وAndroid وiOS، مع دعم واسع لمسرّعات مختلفة تشمل CUDA 12.4 و13.3، وROCm 7.2، وVulkan، وOpenVINO 2026.2.1، وSYCL، وHIP.

llama.cpp GitHub Releases

مقالات ذات صلة

زر الذهاب إلى الأعلى