تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعي

vLLM v0.26.0: دعم Inkling الكامل وتسريع DeepSeek وإصلاحات أمنية جوهرية

بقلم: سارة | محررة نماذج الذكاء الاصطناعي · صوت تحريري بإشراف بشري

vLLM v0.26.0 خرج رسمياً في 25 يوليو 2025، وهو إصدار استثنائي بكل المقاييس: 411 commit من 212 مساهماً — 61 منهم يشاركون للمرة الأولى (وفقاً لـ vLLM GitHub). الإصدار يمسّ كل طبقة في المنظومة: نماذج جديدة، أداء MoE، أمان أقوى، وواجهة Rust أكثر اكتمالاً.

أبرز ما جاء في هذا الإصدار سبع محاور رئيسية:

  1. عائلة Inkling بدعم كامل من الألف إلى الياء — النمذجة الأساسية (#48799)، دعم CUDA graph المجزّأ (#48822)، الانتباه النسبي Hopper FA4 (#48858)، الفك التخميني MTP=1 (#48869)، LoRA (#48884)، وتحديد الكميات NVFP4 عبر ModelOpt. هذا يعني أنك تستطيع تشغيل نماذج Inkling بكامل ميزات الإنتاج فوراً دون أي تعديلات.
  2. دفعة أداء DeepSeek-V4 عبر مزودين متعددين — kernel توجيه متخصص يُحسّن E2E TPOT بنسبة 2.94%، fused_topk_bias يُعطي تسريعاً بمقدار 1.5 إلى 2 مرة، وإزالة التكرار الزائد تُحسّن TPOT بـ1.8% إضافية (وفقاً لـ vLLM GitHub). على ROCm، يضاف ضاغط ثنائي المرحلة لـ HCA prefill، وتحسينات sparse decode/prefill، وفك تخميني DSpark على AMD وXPU.
  3. fp32 lm_head لنماذج التوليد عبر معامل head_dtype — يمتد إلى مسار LoRA وإلى fast path عبر torch.mm على ROCm. هذا يُصلح مشكلة دقة حقيقية كانت تؤثر على رؤوس التوليد في بعض النماذج.
  4. backends الانتباه المرنة ودعم النماذج الهجينة — صار بالإمكان اختيار attention backend مختلف لكل KV-cache group، وأصبح sliding-window قدرة صريحة في الـ backend، ما يُحسّن دعم النماذج الهجينة بشكل ملحوظ. يُضاف إليها KV offloading ناضج يشمل: مقاييس offloading، معالجة أحداث tier، طبقة تخزين ثانوية مرتبطة بـ object store مع workload identity، تقسيم الكاش حسب DP replica، وموصلات encoder-cache مع CPU offloading.
  5. واجهة Rust تكتمل تدريجياً — دعم الفيديو والصوت متعدد الوسائط، محلل أداة Seed-OSS، ومنفذ vllm-bench أصلي. كذلك انتقلت نماذج Olmo/Olmo2 وMistralLarge3 وHunyuanVL إلى backend الـ Transformers مع التوافق مع Transformers 5.13.0.
  6. نماذج جديدة وتوسّع في التغطية — إلى جانب Inkling، يضم الإصدار: BertForMaskedLM، RobertaForTokenClassification، XLMRobertaForTokenClassification، LongCat-Flash-Lite n-gram embedding، Cosmos3 Edge Reasoner، Cosmos3-Super، TranslateGemma-12b-it. في المقابل، جرى حذف نموذجَي TeleChat وPersimmon/Fuyu. على صعيد LoRA: دعم FlashInfer MoE LoRA لنماذج BF16، وLoRA لـ tower/connector في LlavaNextVideo، وتحسين TrtLlmLoRAExperts.
  7. تحديثات أمنية لا يمكن تجاهلها — الإصدار يستبدل مكتبة diskcache بالكامل لاستئصال خطر pickle deserialization، ويُصلح race condition كان يتحايل على ثغرة CVE سابقة. تُضاف إليها: تحقق من حدود الموارد في derender endpoints، تعقيم مسارات الملفات من رسائل الخطأ، تحديد حد أقصى لقوائم completion prompt، وحماية regex compilation بـ timeout. هذه ليست تحسينات طوعية — بعضها يسدّ ثغرات معروفة.

على صعيد الأجهزة والأداء، تستمر سباقات التحسين على طول الجبهة: Qwen يحصل على دمج RMSNorm + all-reduce، و تحسينات H20 خاصة بـ Qwen3.5، وتوسّع في Triton warmup. MLA يأخذ مسار MHA كثيف للتسلسلات القصيرة، وdecode indexer لـ MiniMax-M3 على sm100. أما الأجهزة البديلة فحظها وافر: XPU يحصل على batch-invariant kernels وHND KV layout، والمعالج CPU يكتسب فك تخميني DFlash لنماذج GDN ودعم macOS arm64 بعجلات أصلية، فضلاً عن تحسينات POWER VSX.

في جانب التحديد الكمي، يدعم الإصدار الاستدلال بأوزان Humming w[2-7]a[4,8]، تحديد int4 لـ emulation MoE backend، INT2 على XPU، وتحديد MoE عبر nvfp4_per_token. على واجهة API، تضمّن الإصدار إضافة bad_words في /v1/completions، كشف logprob_token_ids، معامل include_reasoning للنماذج غير Harmony، وعداد num_cache_creation_tokens في ردود Messages.

التبعيات المحدّثة تشمل: Transformers 5.13.0، FlashInfer 0.6.14، NIXL 1.3.1، nvidia-cutlass-dsl 4.6.0، مع تثبيت FlashAttention 3 على torch stable-ABI commit وبناء ABI-stable لـ FlashMLA. الحجم الإجمالي لهذا الإصدار يجعله واحداً من أكثر إصدارات vLLM كثافةً منذ انطلاق المشروع.

GitHub

مقالات ذات صلة

زر الذهاب إلى الأعلى