
أرقام معلنة من Liquid AI: نقاط تفتيش Q4_0 تستعيد 96.5% إلى 97.4% من أداء BF16، بإنتاجية أعلى 3-33% من Q4_K_M وQ5_K_M على أجهزة الحواف.
ضمن ملف: نماذج الذكاء الاصطناعي، ميتا والذكاء الاصطناعي
بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري
المصدر الأساسي: Hugging Face Blog
لماذا يهم
من يشغّل نماذج محلياً على هاتف أو حاسب صغير أو Raspberry Pi يحصل الآن على جودة صيغ أثقل بتكلفة ذاكرة Q4_0 نفسها. المطوّرون الذين اضطروا للترقية إلى Q4_K_M أو Q5_K_M لأسباب جودة يمكنهم التراجع إلى أسرع صيغة وأوسعها دعماً.
نقاط تفتيش Q4_0 جديدة لعائلة LFM2.5 تستعيد 97% من متوسط الدقة الذي يخسره النموذج عادةً عند التكميم إلى 4 بت، مع الحفاظ على البصمة الذاكرية والسرعة نفسها لصيغة Q4_0، (وفقاً لـ Hugging Face Blog). الأرقام كلها معلنة من Liquid AI نفسها ولم يتسنَّ التحقق منها بشكل مستقل.
الفكرة التقنية ليست تكميماً بعد التدريب (PTQ) كما هو معتاد في ملفات GGUF، بل Quantization-Aware Distillation: نموذج معلّم بدقة عالية يُقطَّر داخل نموذج طالب مكمَّم أصلاً، فيتعلّم الطالب التعايش مع خسارة الدقة بدل أن تُفرض عليه بعد انتهاء التدريب. النتيجة، بحسب الشركة، ملف Q4_0 عادي تماماً من ناحية التشغيل، لكن بجودة أقرب إلى صيغ أثقل مثل Q4_K_M وQ5_K_M. الإصدار يغطي أربعة أحجام: LFM2.5-230M وLFM2.5-350M وLFM2.5-1.2B-Instruct وLFM2.5-2.6B.

ما يستحق الانتباه في المخطط أعلاه هو حجم الفجوة التي تُغلقها QAD مقارنة بملفات PTQ المنشورة سابقاً، وليس مجرد تجاوزها. أما تفاصيل القياس فهي كالتالي:
- نسب الاستعادة لكل نموذج: نقاط تفتيش QAD تحافظ على 97.1% و96.5% و97.4% و96.6% من أداء خطوط الأساس BF16 لكل من 230M و350M و1.2B-Instruct و2.6B على التوالي (وفقاً لـ Hugging Face Blog). أرقام معلنة من الشركة نفسها.
- مجموعة التقييم: ستة اختبارات تغطي الاستدلال واتباع التعليمات واستخدام الأدوات والقدرات الوكيلية: GPQA Diamond، MMLU-Pro، IFEval، IFBench، Multi-IF، وBFCLv4. أضافت الشركة تقييماً رياضياً واحداً مناسباً للحجم: GSM8K للنموذجين 230M و350M، وAIME25 للنموذجين 1.2B-Instruct و2.6B. المتوسط محسوب على خمس إعادات، وملف BF16 يُستخدم سقفاً داخل الصيغة.
- الأجهزة الأربعة: قياس إنتاجية فك الترميز (decode throughput) جرى على MacBook Pro وNucBox EVO-X2 وSamsung Galaxy S26 Ultra وRaspberry Pi 5. الجهازان الأولان بالاستدلال على GPU، والآخران بالاستدلال على معالجات Arm، مع إظهار BF16 وF16 كمراجع دقة كاملة حيث توفّر القياس.
- مكسب السرعة في الأحجام الصغيرة: نموذجا 230M و350M بصيغة QAD Q4_0 يوازيان جودة Q5_K_M داخل هامش تغاير التقييم، لكن بإنتاجية فك ترميز أعلى بنسبة 4% إلى 33%.
- مكسب السرعة في الأحجام الأكبر: نموذجا 1.2B و2.6B يوازيان جودة Q4_K_M بإنتاجية أعلى بنسبة 3% إلى 14%، ويوازيان أيضاً ملف UD-Q4_K_XL من Unsloth حيث ينطبق القياس، أي في 230M و1.2B، وهو مرجع قوي للتكميم بعد التدريب من طرف خارجي.

التشغيل لا يحتاج بيئة خاصة: الملفات تعمل مع llama.cpp أو أي وقت تشغيل يدعم مصنوعات GGUF بصيغة Q4_0، والأمر المباشر الذي أوردته الشركة هو:
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"النماذج الأربعة متاحة على Hugging Face اعتباراً من اليوم، بينها LFM2.5-230M. وإن كنت تشغّل نماذج محلياً على هاتف أو Raspberry Pi، فالمقايضة هنا واضحة ومغرية: تدفع صفر تكلفة إضافية في الذاكرة وتحصل على جودة كانت تتطلب حتى الآن صيغة أثقل. الأثر العملي أكبر مما تبدو عليه النسب، لأن Q4_0 هي أبسط صيغة كمية وأوسعها دعماً في أوقات التشغيل القديمة والعتاد المحدود.
ما يبقى مفتوحاً هو ما لم يُقَس. الإعلان يعتمد على مصدر وحيد هو مدونة Liquid AI على Hugging Face، ولا يوجد حتى الآن تقييم مستقل من طرف ثالث. القياس يغطي إنتاجية فك الترميز فقط، لا زمن المعالجة الأولى للمُدخل ولا الاستقرار في السياقات الطويلة، والاستعادة بنسبة 96% إلى 97% تعني أن هناك 3% إلى 4% لم تُستعد، وهي نسبة قد تكون مهمة في مهام وكيلية حساسة مثل BFCLv4. النقطة المنهجية الجيدة أن الشركة نشرت متوسط خمس إعادات لا قراءة واحدة، وهذا وحده يميّز الإعلان عن معظم بطاقات النماذج المكمَّمة التي تُنشر بلا أي ذكر للتغاير.
المصادر
- LFM2.5 Q4_0 Checkpoints from Quantization-Aware Distillation huggingface.co
- LiquidAI/LFM2.5-230M-GGUF · Hugging Face huggingface.co







