تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعي

Needle 2: نموذج ذكاء اصطناعي بـ 14 ميغابايت يعمل على أرخص الأجهزة

بقلم: سارة | محررة نماذج الذكاء الاصطناعي · صوت تحريري بإشراف بشري

أربعة أخماس أجهزة الحافة في العالم لا تملك GPU ولا NPU، وتكلّف أقل من 200 دولار — وهذا بالضبط ما تستهدفه Cactus Compute بنموذجها Needle 2. النموذج يضغط 45 مليون معامل في ملف بحجم 14 ميغابايت فحسب، ويعمل على أي شيء من Raspberry Pi إلى الساعات الذكية إلى متحكمات STM32، دون الحاجة إلى اتصال بالإنترنت.

المنطق الذي يقوم عليه Needle 2 بسيط وجذري في آنٍ واحد: تشغيل المصباح لا يحتاج إلى نموذج بمليارات المعاملات. الساعة الذكية والمنزل المتصل والروبوت الصغير — كلٌّ منها يعرض قدراته كدوال برمجية بمعاملات محددة النوع، والمهمة الوحيدة هي تحويل جملة مبهمة من المستخدم إلى استدعاء الدالة الصحيحة بالقيم الصحيحة. هذه الصياغة المضغوطة للمشكلة لا تحتاج معرفة موسوعية ولا نصوصاً مفتوحة، ولهذا تكفيها 45 مليون معامل حيث يحتاج الشات إلى مليارات.

  1. ضغط بـ 2-بت مدمج في التدريب لا في ما بعده: النماذج الصغيرة تنهار عادةً حين تُضغط بعد التدريب، لذا دمجت Cactus Compute تقنية Cactus Quants في دورة التدريب الكاملة من البداية — الأوزان والتنشيطات وذاكرة KV معاً. النتيجة: نموذج CQ2-bit هو النموذج المُدرَّب ذاته، لا نسخة منقوصة منه. الملف 14 ميغابايت، والذاكرة أثناء الجلسة 28 ميغابايت ثابتة لا تنمو مهما طال الحوار، ما يجعل المتحكمات مثل ESP32-P4 مع 32 ميغابايت PSRAM أو STM32H7 في متناول اليد.
  2. بنية Simple Attention Network بتكلفة حسابية 70 MFLOP للرمز: بدلاً من الـ Transformer التقليدي الذي يستهلك 164 MFLOP للرمز (أو 87 MFLOP لو ضُغّط إلى نفس عدد معاملات Needle)، تستبدل البنية الجديدة طبقات MLP الكثيفة بتحويل Walsh-Hadamard ثابت يعمل بـ n log n دون أوزان إضافية، وتخزّن المعرفة في جداول n-gram مُتخزَّنة (Engram) تُقرأ بضعة صفوف لكل رمز دون عمليات ضرب مصفوفات. المحصلة: 8 ملايين معامل من أصل 45 مليون تعمل بالقراءة المباشرة لا بالحساب، مما يخفّض استهلاك الطاقة بين 7 إلى 85 ضعفاً مقارنةً بالنماذج المنافسة بحسب (وفقاً لـ Cactus Compute).
  3. ضمان المخرجات عبر grammar محوّلة إلى بايتات: كل دوران يُجاب بـ “call envelope”، والاستدعاء الفارغ هو رفض الطلب. grammar مُصرَّفة من schemas المُعلنة تُقيّد كل رمز على مستوى البايت، فتذهب كل طاقة النموذج الـ 45 مليون معامل إلى اختيار الدالة الصحيحة وربط الحجج — لا إلى بناء نص حر. هذا يُتيح تخطي 98% من إسقاطات المفردة على الرموز الهيكلية وتجاهلها كلياً على الرموز المُحددة مسبقاً.
  4. درجة ثقة مدمجة للتعاون مع السحابة: Needle 2 لا يُخمّن حين يخرج الطلب عن نطاق عمله — بل يُعيد الاستدعاء الفارغ مع درجة ثقة منخفضة تُتيح لتطبيقك إعادة السؤال أو التصعيد إلى السحابة. معظم طلبات التحكم اليومية روتينية، فالتصعيد يبقى نادراً والمسار الافتراضي خاص وفوري ومجاني.
  5. binary وحيد يعمل من Cortex-M إلى WebAssembly: المنتج الفعلي ليس الأوزان بل الثنائي: ملف C++ واحد خالٍ من التبعيات يستكشف المعالج عند الإقلاع ويختار نواته المناسبة — SDOT أو NEON أو AVX2 أو RISC-V Vectors أو WASM SIMD أو Scalar. لا شيء للتثبيت، لا شيء للتحميل. يعمل على المتحكمات الجرداء كمكتبة ثابتة لـ Cortex-M4 وM7 وM55.
  6. ضبط دقيق على حاسوبك الشخصي في دقائق: بما أن النموذج 45 مليون معامل فقط، يمكن إعادة تدريبه على Mac أو PC عادي في وقت يتراوح بين دقائق وبضع ساعات. كل منتج له مفرداته من الأدوات، وNeedle يُدرَّب ليتحدث أدوات جهازك تحديداً لا مساعداً عاماً.

على مستوى الأداء الفعلي، يتنافس Needle 2 بشرف مع نماذج أكبر بكثير في خمسة benchmarks عامة لاستدعاء الدوال: Mobile Actions من Google، وDroidCall، وSeal-Tools (داخل النطاق وخارجه)، وBFCL v4. على اختبار Mobile Actions بـ 961 صفاً، سجّل Needle 2 دقة 63.7% بالمجمل — مقارنةً بـ 64.0% لـ FunctionGemma 270M و69.1% لـ LFM2.5 230M و57.6% لـ Apple FM — بينما تفوّق على جميعهم في دقة أسماء الدوال بـ 98.3%. المقارنة ليست نظيفة تماماً: الخصوم يعملون بـ f16 تحت vLLM بسياق كامل، وNeedle يعمل بـ CQ2-bit بنافذة 256 رمزاً — وCactus Compute تُفصح عن هذا التفاوت صراحةً (وفقاً لـ Cactus Compute).

النموذج مُعتمَد بالفعل في الإنتاج: ساعة Pebble Index Ring — التي لا تملك شاشة — تشغّله محلياً في تطبيق Index 01 لتحويل الأوامر الصوتية إلى أفعال دون الاعتماد على الشبكة، إذ يقول فريق Pebble إن بصمة النموذج ضئيلة وأداءه لا يخذلهم. تلك النقطة تلخّص رهان Needle: في عالم تربو فيه الأجهزة المتصلة على 21 مليار مقابل 1.5 مليار حاسوب شخصي، وأغلبها رخيص الثمن، يبقى “الذكاء الاصطناعي على الحافة” حكراً على أقلية من الأجهزة الغنية — ما لم تصغر النماذج بما يكفي لتسكن كل شيء.

يمكن الاطلاع على الكود المصدري على GitHub والنموذج على Hugging Face، فضلاً عن ورقة البحث المنشورة على arXiv التي تفصّل بنية Simple Attention Network.

Cactus Compute

مقالات ذات صلة

زر الذهاب إلى الأعلى