تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعياختيار المحررين

LFM2.5-VL-3B نموذج رؤية يعمل على أجهزتك بسرعة 228 رمزاً في الثانية

بقلم: ليلى | محررة أدوات المطورين · صوت تحريري بإشراف بشري

أطلقت Liquid AI نموذج LFM2.5-VL-3B في أغسطس 2026، وهو أقوى نموذج رؤية-لغة تنتجه الشركة حتى اللحظة بحجم 3.1 مليار معامل قابل للتشغيل على الأجهزة الشخصية دون الحاجة إلى سحابة. النموذج يفهم الشاشات والمستندات، يحدد مواضع الأجسام، ويستدعي الأدوات — كل ذلك بإجابات مباشرة دون تفكير تسلسلي مطوّل، مما يجعله مناسباً للتطبيقات التي تتطلب استجابة فورية.

مقارنة أداء LFM2.5-VL-3B عبر مجموعات المهام المختلفة مقارنة بالنماذج المنافسة
متوسط أداء LFM2.5-VL-3B عبر فئات المهام — النموذج يتصدر فئة الـ 3B في معظم مجالات الرؤية

ما يميّز هذا الإصدار عن سابقه أربعة محاور فعلية: فهم واجهات المستخدم والشاشات الرقمية عبر مختلف الأجهزة، وتحسين ملحوظ في تحديد مواضع الأجسام بالاستعلامات النصية، ودعم الإدخال المتعدد للصور مع استدلال أفضل بينها، فضلاً عن قفزة حادة في استدعاء الدوال سواء في البيئات النصية أو المختلطة. هذه ليست تحسينات هامشية — مثلاً في اختبار ScreenSpot-v2 الذي يقيس فهم الشاشات، سجّل LFM2.5-VL-3B على سطح المكتب 78.7 مقارنة بـ 6.0 لسابقه LFM2-VL-3B، وعلى الجوّال 81.2 مقارنة بـ 7.6، وعلى الويب 82.2 مقارنة بـ 2.5 فقط.

من الناحية التقنية، يجمع النموذج بين مشفّر رؤية SigLIP2 400M NaFlex والعمود الفقري نفسه لنموذج LFM2.5-2.6B النصي. المرحلة التدريبية تضمنت نحو 34 تريليون رمز مع تضاعف حجم بيانات الرؤية أربع مرات مقارنة بالإصدار السابق، وتوسيع المفردات إلى 128 ألف رمز لدعم النصوص غير اللاتينية — بما فيها العربية — دون إعادة تدريب كاملة للمحوّل. مرحلة ما بعد التدريب تضمنت ضبطاً دقيقاً تحت إشراف نموذج معلّم أكبر، ثم تعلماً معززاً بمكافآت متعددة.

سرعة الاستنتاج على الأجهزة المختلفة: M5 Max وRyzen AI وGalaxy S26 Ultra
سرعة الاستنتاج على الأجهزة — LFM2.5-VL-3B يحقق 228 رمزاً/ث على M5 Max و20 رمزاً/ث على Galaxy S26 Ultra

على صعيد السرعة، الأرقام مقنعة للمطوّرين الذين يبنون تطبيقات on-device. وفقاً لـ Liquid AI، يُنجز النموذج 228 رمزاً في الثانية على M5 Max، و116 رمزاً في الثانية على Ryzen AI Max+ 395، ويصل إلى 20 رمزاً في الثانية على Galaxy S26 Ultra — ويشغل ذاكرة لا تتجاوز 3 غيغابايت. أما على GPU، فيحقق نحو 11 ألف رمز في الثانية عند التحميل العالي، وهو ضعف ما تقدمه نماذج فئة الـ 4B تقريباً، بما يعادل قرابة مليار رمز يومياً على بطاقة H100 واحدة.

نتائج benchmark الأشمل تضع هذا النموذج في موضع قوي داخل فئته. المتوسط العام عبر جميع المهام بلغ 69.4 مقارنة بـ 57.2 لسابقه، متجاوزاً gemma-4-E2B-it (52.0) وInternVL 3.5 2B (64.6)، ومقارباً gemma-4-E4B-it (59.7) رغم صغر حجمه. في grounding تحديداً، سجّل 87.9 على RefCOCO-avg مقارنة بـ 57.1 للنسخة السابقة. وفي الاستدلال الرياضي MathVista حقق 68.5 مقارنة بـ 62.1 سابقاً. في المقابل، لا يزال MMMU-Pro عند 30.5 — وهو مؤشر على أن المهام الأكاديمية المعقدة تظل تحدياً أمام نماذج الحجم الصغير عموماً. على استدعاء الأدوات النصي، يتساوى أداؤه مع Gemma-4-E2B وQwen3.5-2B في ToolSandbox بنتيجة 59.5.

زمن الاستجابة الأولى TTFT لنموذج LFM2.5-VL-3B على GPU مقارنة بالنماذج المنافسة
زمن الاستجابة الأولى على GPU — LFM2.5-VL-3B يحافظ على انخفاض ثابت حتى مع الإدخالات متعددة الإطارات

النموذج متاح اليوم على Hugging Face مع دعم يوم الإصدار لبيئات الاستنتاج الرئيسية: llama.cpp وMLX وvLLM وSGLang وONNX. للبدء، تحتاج إلى تثبيت transformers بإصدار 5.0.0 أو أحدث:

  1. ثبّت المكتبات المطلوبة: pip install -q torch torchvision accelerate "transformers>=5.10.1"
  2. حمّل النموذج والمعالج باستخدام AutoModelForImageTextToText وAutoProcessor مع MODEL_ID = "LiquidAI/LFM2.5-VL-3B"
  3. أعدّ الرسائل بتنسيق المحادثة مع الصورة والنص، ثم مرّرها عبر processor.apply_chat_template()
  4. شغّل الاستنتاج بـ model.generate() مع ضبط درجة الحرارة على 0.2 وعدد الرموز الجديدة على 256
  5. فكّ ترميز الناتج باستخدام processor.batch_decode() لاستخراج الاستجابة النهائية

إذا كنت تبني تطبيقاً يستوجب معالجة رؤية مباشرة على الجهاز — سواء كان مساعداً يقرأ الشاشة، أو أداة تستخرج بيانات من مستندات، أو نظاماً يستدعي APIs بناءً على ما يراه — فهذا هو النموذج الذي يستحق التجربة الفعلية قبل غيره في فئة الـ 3B. الرهان الحقيقي لـ Liquid AI هنا ليس فقط الأداء، بل الجمع بين السرعة والحجم الصغير والقدرة المتكاملة في حزمة واحدة تعمل حتى على الهاتف.

Liquid AI Blog (Hugging Face)

مقالات ذات صلة

زر الذهاب إلى الأعلى