تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
تعلم و استخدام الذكاء الاصطناعي

llama.cpp — شغّل الذكاء الاصطناعي محلياً بدون API أو إنترنت

بقلم: ليلى | محررة أدوات المطورين · صوت تحريري بإشراف بشري

لا مفاتيح API، لا اتصال بالإنترنت، لا بيانات تغادر جهازك — هذا ما يعد به llama.cpp، المشروع مفتوح المصدر الذي يُمكّنك من تشغيل نماذج الذكاء الاصطناعي الحديثة مباشرةً على حاسوبك، سواء كان لابتوب بسيطاً أو خادم مجهّزاً.

الفكرة بالغة البساطة في ظاهرها، لكنها عميقة الأثر عملياً: بدلاً من إرسال طلباتك إلى خوادم بعيدة تسجّل كل كلمة تكتبها، يجري كل شيء داخل جهازك. المحادثات ملكك، النماذج ملكك، ولا توجد قيود على الاستخدام أو حصص شهرية.

شريحة <a href=Apple M Ultra المدعومة في llama.cpp”>
شريحة Apple M Ultra — واحدة من منصات الأجهزة المدعومة بالكامل في llama.cpp

للبدء، يكفي أمر واحد في الطرفية لتثبيت الأداة:

curl -LsSf https://llama.app/install.sh | sh

أو عبر مديري الحزم Brew وWinget، أو البناء من المصدر لمن يريد تخصيصاً أعمق.

بعد التثبيت، يمكنك ربط الأداة بعميل برمجي محلي للحصول على تجربة مشابهة لـ Cursor أو GitHub Copilot — لكن دون أن تغادر بياناتك جهازك. الخطوات ثلاث فقط:

  1. شغّل خادم النموذج بالأمر llama serve.
  2. ثبّت إضافة pi-llama لعميل البرمجة Pi بالأمر: pi install git:github.com/huggingface/pi-llama
  3. شغّل Pi بكتابة pi فحسب — سيكتشف النموذج المحلي تلقائياً دون أي إعداد إضافي.
بطاقة RTX 5090 المدعومة في llama.cpp
بطاقات RTX — من أقوى منصات التسريع المدعومة في llama.cpp

ما يميّز llama.cpp فعلاً هو اتساع دعم الأجهزة. الأداة تعمل على ثنائي واحد وبنوى محسّنة يدوياً عبر الطيف كاملاً: من شرائح Apple Silicon (M Pro، M Max، M Ultra) إلى بطاقات NVIDIA (RTX 3090، RTX 4090، RTX 5090، A100، H100)، ومن AMD (Radeon RX، MI300) إلى Intel Arc، وصولاً إلى معالجات CPU العادية وبطاقات الحوسبة المدمجة مثل Jetson وDGX Spark وT4. بمعنى آخر: إن كان لديك جهاز، فـ llama.cpp يعمل عليه.

دعم المعالجات CPU في llama.cpp
حتى المعالجات التقليدية مدعومة — llama.cpp يعمل على أي عتاد

أما النماذج المتاحة للتشغيل فتشمل اليوم بعض أبرز ما أطلقته كبرى المختبرات كنماذج مفتوحة: Qwen 3 من Alibaba بنسختيه Dense وMoE مع قدرات multimodal متقدمة للترميز والرؤية، وGemma 4 من Google المبنية على تقنية Gemini 3 مع دعم 140 لغة وسياق يصل إلى 128K رمز، وGemma 3 بقدرات مماثلة للانتشار من الأجهزة الطرفية حتى الخوادم، فضلاً عن GPT-OSS وهو أول نموذج مفتوح الأوزان من OpenAI منذ GPT-2، مصمم للاستدلال والمهام الوكيلية مع دعم function calling واستخدام الأدوات.

المشروع بطبيعته مفتوح المصدر لا يتضمن واجهة رسومية رسمية، وتجربة المستخدم في الطرفية قد تبدو مُعقّدة لمن ليس مطوراً. كذلك فإن أداء النماذج الكبيرة يظل مرتبطاً بمواصفات جهازك — النماذج الضخمة بمليارات المعاملات تحتاج ذاكرة وافرة. لكن هذا ثمن مقبول لمن يريد خصوصية حقيقية لا مجرد وعود بها في سياسة الاستخدام.

في وقت يتسارع فيه النقاش حول خصوصية البيانات وملكيتها — لا سيما في بيئات الترميز والعمل الحساس — يمثّل llama.cpp إجابة عملية على سؤال جوهري: هل يمكن الاستفادة من الذكاء الاصطناعي دون أن تدفع ثمناً خفياً بخصوصيتك؟ الجواب، على الأقل تقنياً، أصبح نعم.

llama.app

مقالات ذات صلة

زر الذهاب إلى الأعلى