
بقلم: سارة | محررة نماذج الذكاء الاصطناعي · صوت تحريري بإشراف بشري
بعد 561 إيداعاً من 242 مساهماً — منهم 64 جديداً — أصدر مشروع vLLM الإصدار v0.27.0 في العاشر من أغسطس 2025، وهو واحد من أكثر الإصدارات كثافةً في تاريخ المشروع من حيث الميزات الجديدة والنماذج المدعومة وتحسينات الأداء. إذا كنت تشغّل نماذج لغوية كبيرة في الإنتاج، فهذا التحديث يستحق وقفةً جادة.
أبرز ما يُميّز هذا الإصدار هو الدعم الكامل لنموذج Kimi K3 من Moonshot AI، وصل في صفقة واحدة: ملفات النموذج والنوى الحسابية، واجهتا Python وRust، نوى AttnRes، دعم DeepGEMM، تحسين DSpark AR fusion، وخيار تقسيم الخبير المشترك بدلاً من نسخه. هذا النوع من الدعم الشامل في إصدار واحد يُوحي بتنسيق مسبق مع Moonshot AI، وهو مؤشر إيجابي لاستمرار التوسع في النماذج غير الغربية.
على صعيد النماذج الجديدة الأخرى، يدعم الإصدار الآن Qwen3.5 للنص في صيغتيه الكثيفة وMoE مع تقليص رموز الفيديو عبر EVS، إضافةً إلى K-EXAONE-2.0-750B-A37B الكوري الضخم، وVaultGemma عبر واجهة Transformers، وjina-embeddings-v5-text-nano المبني على EuroBERT. التنوع الجغرافي والتقني لهذه النماذج يعكس نضجاً متسارعاً في منظومة النماذج مفتوحة المصدر.
تحديث بيئي حرج يجب أن تنتبه إليه: ترقية PyTorch إلى 2.13.0 مع torchvision 0.28.0 وTriton 3.7.1 هي تغيير يكسر التوافق مع البيئات السابقة، وينسحب على وحدات XPU وCPU أيضاً. إذا كنت تُشغّل خطوط نشر مؤتمتة، فتأكد من تحديث البيئة قبل الترقية لتجنّب أي انقطاع في الخدمة.
أداء DeepSeek-V4 كان محور اهتمام واضح في هذا الإصدار. الأرقام التي رصدها الفريق مباشرةً (وفقاً لـ vLLM Release Notes):
- تقليص زمن أول رمز (TTFT) بنسبة 3.4% من خلال تجاوز topk/router غير الضروري في الاستنتاج.
- تقليص إضافي بنسبة 3.9% عبر إعادة استخدام مساحة العمل.
- تحسين النواة الحسابية بمعامل 1.88x بحذف نواة كاملة مكررة.
- توفير 448 MiB من ذاكرة GPU في مخزن PP.
- تحسين النواة الحسابية بمعامل ~2x بتجاوز إطلاقات c128 الفارغة.
- تحسين topk التكيفي بعرض متغير بنسبة 1.0% في الأداء الكلي.
- تقليص هدر padding على رؤوس sparse-MLA عند استخدام FlashInfer نسخة 0.6.14 أو أحدث.
على مستوى البنية التحتية، يتوسع Model Runner V2 ليشمل أعباء العمل غير التوليدية: الانتباه encoder-only، تجميع التسلسلات لمهام التضمين والتصنيف، تصنيف ورموز التضمين، دعم BGE-M3 pooling، والمعالجة متعددة الوسائط على CPU. هذا يعني أن vLLM يتموضع بشكل أقوى كمنصة شاملة لجميع حالات استخدام النماذج، لا مجرد استنتاج توليدي.
يتعمق دعم FlashAttention 4 على معالجات SM100: دعم FP8 KV cache وheaddim-256، مدعومان ببنية تحتية جديدة للإحماء JIT تُلغي توقفات الترجمة عند الطلب الأول — وهي نقطة ألم كانت تُزعج المشغّلين في بيئات الإنتاج. وعلى صعيد العتاد القادم، الإصدار يُمهّد الطريق مبكراً لمعالجات NVIDIA Rubin (sm_107) مع مسارات NVLink all-reduce، وتفعيل بنية ROCm gfx1250.
في مجال تحمّل الأخطاء والتوسع الكبير، يُقدّم الإصدار إطاراً مبسطاً لتحمّل الأخطاء في نشريات DP+EP مع موازن تحميل خارجي، وإعداداً غير متزامن لتوسيع EP المرن. كذلك تتوسع قدرات P/D Disaggregation لتشمل نماذج MLA+SSM الهجينة عبر NIXL، وأحجام block غير متجانسة، وتوجيه قراءة MoRIIO بين TP وDP في مرحلتي prefill وdecode.
على صعيد التكميم، يضيف الإصدار: تكامل FP4 Qutlass مع compressed-tensors، دعم CuTeDSL MoE لـ ReLU2 NVFP4، MXFP8 linear في INC، وAutoRound W4A16 MoE على XPU. الواجهة الأمامية Rust تنمو بمستوى تحكم gRPC: تقارير صحية واعية بالمحرك، تحكم بالإلغاء، اكتشاف الخوادم والنماذج، ودمج vllm-bench في CLI.
بعيداً عن الأرقام، ما يلفت في هذا الإصدار هو حجم الاهتمام بمنصات غير NVIDIA: تحسينات واسعة لـ ROCm (AMD)، مسارات متعددة لـ XPU (Intel)، ونوى مخصصة لـ CPU بما فيها Arm وS390X وApple Silicon. هذا تنويع استراتيجي يقول صراحةً إن vLLM لا يريد أن يكون رهينة منظومة CUDA وحدها.







