تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعي

Z.ai تطلق GLM-5.3-Flash: 18 مليار معامل نشط وعُشر سعر GLM-5.2

18 مليار معامل نشط من أصل 320، وادعاء من Z.ai بأداء يتجاوز GLM-5.2 عند عُشر السعر ويقترب من Claude Opus 4.8 في البرمجة والمهام الوكيلة.

ضمن ملف: نماذج الذكاء الاصطناعي، وكلاء الذكاء الاصطناعي

بقلم: يوسف | محرر أدوات الذكاء الاصطناعي · صوت تحريري بإشراف بشري

المصدر الأساسي: Hugging Face

لماذا يهم

فرق الاستدلال والمطورون الذين يشغّلون وكلاء بسياقات طويلة يحصلون على خيار مفتوح الأوزان بتكلفة خدمة أقل وأطر نشر جاهزة، لكن أرقام الأداء كلها معلنة من الجهة المطوّرة وترخيص الأوزان غير مذكور في بطاقة النموذج.

18 مليار معامل نشط من أصل 320. هذه النسبة هي كل ما يحتاج مهندس الاستدلال معرفته عن GLM-5.3-Flash، أول نموذج متعدد الوسائط أصلاً (natively multimodal) في سلسلة GLM-5. الفريق المطوّر يقول إن النموذج يتجاوز GLM-5.2 في الاختبارات القياسية وأحمال العمل الواقعية عند عُشر السعر، ويقترب من Claude Opus 4.8 في اختبارات البرمجة والمهام الوكيلة، بحسب بطاقة النموذج على Hugging Face. هذه أرقام معلنة من الشركة نفسها، ولا توجد حتى اللحظة تقييمات مستقلة موسّعة تؤكدها.

الجديد ليس الحجم بل المعمارية: للمرة الأولى في سلسلة GLM، يدمج النموذج sparse attention مع linear attention في بنية هجينة تهدف إلى خفض تكلفة الخدمة في السياقات الطويلة مع الحفاظ على دقتها، ويعتمد تقنية Manifold-Constrained Hyper-Connections (mHC) لتحسين كفاءة التوسّع. النموذج لا ينطلق من نقطة تفتيش سابقة، بل من نموذج أساس مُدرَّب حديثاً على متن بيانات متعدد الوسائط بحجم 30 تريليون توكن، بحسب البطاقة ذاتها. إن كنت تشغّل وكلاء بسياقات تتجاوز مئات آلاف التوكنات، فهذا البند تحديداً هو الذي يحدد فاتورتك الشهرية.

وإذا أردت تشغيله فعلياً، هذه هي المسارات المتاحة كما وردت في التوثيق الرسمي:

  1. اختر إطار النشر: البطاقة تدرج ستة مسارات مدعومة، لكل منها مرجع رسمي: SGLang (cookbook)، وvLLM (recipes)، وTokenSpeed، وTransformers (توثيق المكتبة)، وKTransformers (tutorial)، وUnsloth (guide).
  2. احسب متطلبات الأوزان قبل الحجز: حجم النموذج المعلن 321 مليار معامل بصيغ BF16 وF8_E4M3 وF32. عدد المعاملات النشطة المنخفض يقلّل حسابات كل تمريرة، لا حجم الذاكرة اللازمة لتحميل الخبراء كاملين.
  3. اضبط ميزانية التفكير عبر reasoning_effort: المعامل يقبل ثلاث قيم فقط: low وhigh وmax. القيمة الافتراضية هي max إذا لم تُمرَّر أو إذا مُرِّرت قيمة غير معروفة، ولتشغيل low أو high يجب تمريرها صراحةً.
  4. مرِّر clear_thinking=true في سيناريوهات الدردشة: القيمة الافتراضية في قالب المحادثة هي false، والفريق يوصي بتفعيلها صراحةً في تطبيقات الدردشة.
  5. أبقِ الإعدادات الافتراضية إذا كنت تعيد إنتاج النتائج: البطاقة تشترط الإبقاء على max لإعادة إنتاج أرقام الاختبارات القياسية ولوحات الصدارة، وأي خفض للميزانية يعني أن أرقامك لن تكون قابلة للمقارنة.
  6. إن لم تتوفر لديك البنية التحتية: النموذج متاح كخدمة API على منصة Z.ai API Platform، وعبر مزوّدي الاستدلال على صفحة النموذج (Novita و3 مزوّدين آخرين) بواجهة Image-Text-to-Text. وقد سُجِّل 826,875 تنزيلاً خلال الشهر الأخير (بحسب Hugging Face).

أنفع ما في البطاقة، من زاوية هندسية، هو حواشي التقييم، لأنها تفضح كم من الأداء المُعلن مشروط بميزانية حوسبة ضخمة. اختبار HLE مع الأدوات جرى بـ temperature=1.0 وtop_p=0.95 وحد توليد 163,840 توكن، ضمن سياق أقصاه 300 ألف توكن مع استراتيجية إدارة سياق، وبنموذج حَكَم هو GPT-5.6-luna (medium). وNL2Repo قُيِّم بـ temperature=1.0 وtop_p=1.0 و64k توكن جديد تحت سياق مليون توكن، مع حكم مزدوج قائم على قواعد وعلى LLM لمنع سلوكيات مثل عمليات pip أو curl غير المصرّح بها. أما DeepSWE فشُغِّل عبر harness باسم mini-swe-agent بـ temperature=0.95 وسياق 400 ألف ومهلة ست ساعات، وTerminal-Bench 2.1 داخل Claude Code 2.1.207 بـ max_new_tokens=65536 ومهلة ست ساعات كذلك. نتائج Toolathlon Verified أُخذت من خدمة التقييم الرسمية بمعدل pass@1 على ثلاث جولات مستقلة، وAutomationBench جرى على الإصدار v1.0.6 بعد دمج إصلاح مشكلة null-type في PR رقم 13، وGDPval-AA v2 قيّمته جهة خارجية هي Artificial Analysis. وفي BabyVision استُخدم سياق 164 ألف توكن مع تكبير الصور بحيث لا يقل ضلعها الأقصر عن 1.5K بكسل، تماشياً مع بقية النماذج المقارَنة.

نشر هذه التفاصيل يستحق التقدير، لأنه يسمح لك بإعادة الإنتاج والحكم بنفسك بدلاً من تصديق رسم بياني. لكنه يكشف أيضاً المسافة بين المختبر والإنتاج: مهلة ست ساعات وسياق 400 ألف توكن ليست إعدادات ستشغّلها في منتج حقيقي، ومقارنة السعر بعُشر الجيل السابق لا تعني تعادل الجودة في كل مهمة. وتبقى فجوة واحدة أهم من كل ذلك: نص البطاقة لا يذكر ترخيص الأوزان، وهو التفصيل الحاسم لأي استخدام تجاري ويجب التحقق منه من ملفات المستودع قبل البناء عليه. من أراد التفاصيل الكاملة، التقرير التقني منشور على arXiv تحت الرقم 2602.15763 بعنوان “GLM-5: from Vibe Coding to Agentic Engineering”.

المصادر

مقالات ذات صلة

زر الذهاب إلى الأعلى