تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعي

H Company تطلق Holo4 بأوزان مفتوحة وتسجل 61.7% على OSWorld 2.0

فجوة 20 نقطة تفصل Holo4 27B عن Opus 5.5 على OSWorld 2.0، مقابل معاملات أقل بمراتب وتكلفة أدنى لكل مهمة بحسب الشركة.

ضمن ملف: وكلاء الذكاء الاصطناعي، إنفيديا

بقلم: ليلى | محررة أدوات المطورين · صوت تحريري بإشراف بشري

المصدر الأساسي: Hugging Face Blog (H Company)

لماذا يهم

فرق الأتمتة داخل المؤسسات تحصل على وكيل مفتوح الأوزان يعمل عبر الشاشة والكود وMCP وAPI بنموذج واحد، ويمكنها تدقيق مساراته قبل تشغيله على بنيتها بدل الارتهان لنماذج مغلقة مكلفة.

يسجل نموذج مفتوح الأوزان بـ27 مليار معامل 61.7% على اختبار OSWorld 2.0 للتحكم بسطح المكتب، بينما يسجل Opus 5.5 نسبة 81.8% (وفقاً لـ H Company). تراهن H Company على أن السعر المنخفض يعوّض هذه الفجوة البالغة 20 نقطة. هذا هو جوهر إطلاق سلسلة Holo4 في 28 سبتمبر 2026، والقصة كلها تستند إلى مصدر وحيد هو تدوينة الشركة على Hugging Face، ولم يتوفر مصدر مستقل يراجع أرقامها. تأتي السلسلة بحجمين: Holo4-27B الكثيف، وHolo4-35B-A3B بمعمارية Mixture of Experts، أي 35 مليار معامل ينشط منها 3 مليارات. ويرافقهما نموذج صغير محدّث هو Holotron4 Nano. تقول الشركة إن Holo4 يبني على نموذجها السابق، ويتفوق بوضوح على نموذج الأساس Qwen الذي انطلق منه. وتقول أيضاً إنه صُمم لسير العمل الفعلي داخل الشركات قبل أن يُصمم لنتائج الاختبارات الأكاديمية.

  1. نموذج واحد لكل الواجهات. بحسب H Company، ينقر Holo4 ويكتب على الشاشة، ويكتب الكود وينفذه، ويستدعي أدوات MCP وواجهات API، ويختار منها ما يناسب المهمة. وتوضح الشركة المشكلة التي تريد حلها: معظم النماذج الوكيلة تُدرَّب على واجهة واحدة. نماذج الواجهات الرسومية لا ترى شيئاً حين تغيب الشاشة، ونماذج استدعاء الأدوات تتوقف أمام تطبيق لا يملك API. يعمل Holo4 على سطح المكتب والويب وAndroid وداخل بيئة كود معزولة ومع واجهات الأعمال. وهو النموذج نفسه في كل حالة، ويُستدعى بالطريقة نفسها، فلا تحتاج إلى اختيار نموذج مختلف لكل منصة. هذا في رأينا أقوى ما في الإطلاق، لأن مهمة واحدة داخل مؤسسة قد تمر بنظام قديم بلا API ثم بخدمة سحابية حديثة.
  2. أداء قريب من النماذج المغلقة بحجم أصغر بكثير. على OSWorld 2.0 سجل Holo4 27B نسبة 61.7% مقابل 81.8% لـOpus 5.5، وسجل Holo4 35B-A3B نسبة 30.9% (وفقاً لـ H Company)، وهذه أرقام معلنة من الشركة نفسها. ومن النقاط المرجعية التي تعرضها الشركة 70.2% لـOpus 5 و66.2% لـGPT-5.6 Sol، وكلاهما من رسم إطلاق OpenAI بإعداد الجهد الأقصى والمكافآت الجزئية على مجموعة v2026.08.08 غير المتصلة (وفقاً لـ H Company). وأما بقية النقاط المرجعية فمصدرها بطاقات النماذج واللوحة الرسمية. تعترف الشركة بأن Holo4 يأتي خلف أقوى النماذج المغلقة في سير العمل الطويل. لكنها تقول إنه يعمل بمعاملات أقل بمراتب وبتكلفة أدنى بكثير لكل مهمة، سواء على OSWorld 2.0 أو على AutomationBench الخاص باستخدام الـ API.
  3. أمثلة على برمجيات احترافية. عرضت الشركة ثلاث مهام نفّذها Holo4 27B ونموذج الأساس Qwen3.8 27B، بالتعليمات نفسها وعلى الـ harness نفسه. المهمة الأولى مجسم لبرج إيفل في FreeCAD بمقياس 1 ملم لكل متر، يتمركز عند نقطة الأصل ويتحاذى مع المحورين X وY. مقطع البرج مربع عند كل ارتفاع. ونصف عرضه من المحور إلى الزاوية 62.5 ملم عند الأرض، و32.5 ملم عند الارتفاع 57، و17.5 ملم عند 115، و9.35 ملم عند 276، ويتبع بين هذه النقاط منحنى ناعماً لا خطاً مستقيماً. للبرج أربع أرجل متطابقة مفتوحة الفراغ بينها، عرض كل منها 14 ملم عند الأرض ويضيق إلى 4 ملم عند 276. وفيه ثلاث منصات: 72 ملم بسماكة 4 ملم عند 57، و40 ملم بسماكة 3 ملم عند 115، و22 ملم بسماكة 3 ملم عند 276. ويعلوه صارٍ من 276 إلى 324، عرضه 8 ملم عند القاعدة و2 ملم عند القمة. استهلك Holo4 فيها 84 استدعاء و1.3 مليون token، مقابل 60 استدعاء و1.0 مليون token لـQwen. المهمة الثانية شعار الشركة في FreeCAD: قرص مصمت بجوار حرف H كتلي، بسماكة واحدة ولون أسود. استهلك فيها Holo4 94 استدعاء و1.5 مليون token، مقابل 118 استدعاء و1.9 مليون token لـQwen. المهمة الثالثة لعبة على طراز Pac-Man في Godot، فيها متاهة وحبيبات وثلاثة أشباح، ولاعب يقود نفسه بقاعدة بسيطة ويعمل بلا لوحة مفاتيح إلى ما لا نهاية. أنجزها Holo4 في 68 استدعاء و2.4 مليون token و268 سطراً، مقابل 197 استدعاء و11.4 مليون token و327 سطراً لـQwen (وفقاً لـ H Company). هذه أمثلة اختارتها الشركة بنفسها، ولم يتسنَّ التحقق منها بشكل مستقل.
  4. مصنع مهام وharness أُعيد بناؤه. دُرّب Holo4 بالتعلم الموجّه والتعلم المعزز على بيئات ومهام متنوعة، منها ما أنتجه نظام Agentic Task Factory الداخلي. يبني هذا النظام بيئات تفاعلية ومهام قابلة للتحقق من التوثيق وحده، مثل لقطات شاشة لمواقع حقيقية أو برمجيات مفتوحة المصدر. وأنتج حتى الآن نحو 10,000 مهمة عبر تطبيقات الويب وخوادم MCP وبيئات سطح المكتب، منها بيئات هجينة تعرض الحالة نفسها عبر واجهة رسومية وعبر MCP (وفقاً لـ H Company)، وهو رقم معلن من الشركة نفسها. وأعادت الشركة بناء الـ harness، أي الحلقة التي تنفذ أفعال النموذج وتدير سياقه عبر مئات الخطوات، مستندة إلى أداء الوكيل على OSWorld 2.0. صنّفت الوكلاء سبب فشل كل مهمة، وراجع المهندسون الإصلاحات. وكان أكبر تغييرين ذاكرة موثوقة تتتبع مئات الخطوات، وshell على جهاز سطح المكتب نفسه.
  5. وصفة قابلة للنقل عبر Holotron4 Nano. بصفتها عضواً في تحالف NVIDIA Nemotron، طبّقت الشركة حزمة ما بعد التدريب على نموذج Nemotron 3 Nano Omni كمتابعة لنموذج Holotron 3. والنتيجة وكيل عام يتحسن بوضوح على نموذج الأساس في مهام الواجهات الرسومية وفي بيئات MCP وAPI والكود، بحسب الشركة. وتقول الشركة إن المكاسب نقاط مئوية مطلقة وإن الوصفة لا ترتبط بحجم معيّن، لكن النص لا يذكر أرقام هذه المكاسب، فهي تظهر في الرسوم فقط.
جدول نتائج نماذج Holo4 وتكلفة المهمة الواحدة مقارنة بنموذج Qwen3.8 27B والنماذج الرائدة
نتائج Holo4 وتكلفة كل مهمة مقابل Qwen3.8 27B والنماذج الرائدة، بحسب H Company.

أرقام التكلفة هي أضعف حلقات القصة. بحسب ملاحظات الشركة، قُدّرت التكاليف على OSWorld 2.0 من tokens الإدخال والإخراج لكل تشغيل. سُعّر Holo4 بأسعار H Models API في تشغيل واحد. وأُخذت نتيجة Qwen3.8 27B من بطاقة النموذج، مع حساب تكلفتها من tokens تشغيل الشركة بأسعار Alibaba Cloud المعلنة. وقيس Qwen3.6 35B-A3B في تشغيل واحد داخل harness الشركة، مع احتساب إصابات الذاكرة المؤقتة بـ20% من سعر الإدخال. أما منحنيات الجهد لنماذج GPT وOpus فمأخوذة من بيانات إطلاق OpenAI، وبقية النقاط من اللوحة الرسمية. وعلى AutomationBench قيس Holo4 ونموذجا Qwen على الإصدار v1.0.6 داخل harness الشركة الداخلي. في المقابل، جاءت نتائج بقية النماذج من المجموعة العامة في ملف README، وتكلفتها من اللوحة الرسمية التي تعمل على المجموعة الخاصة. ولم يُقيَّم Holo4 على المجموعة الخاصة بعد، ولم يُحدد الموعد بعد. الشركة نفسها تقر بأن الإصدارات والـ harness ومجموعات المهام تختلف. وهناك إشكال آخر: ضبط الـ harness انطلاقاً من إخفاقات OSWorld 2.0 تحديداً يصعّب الفصل بين تحسّن النموذج وتكيّفه مع الاختبار. أما الفجوة بين الحجمين، 61.7% مقابل 30.9%، فتعني أن النسخة الأخف ليست بديلاً مجانياً للأكبر.

رسم بياني لمتوسط النتيجة الجزئية على OSWorld 2.0 مقابل تكلفة المهمة الواحدة لعدة نماذج
OSWorld 2.0: متوسط النتيجة الجزئية مقابل تكلفة المهمة الواحدة.

في الرسم، يربط الخط بين النماذج المغلقة التي لا يتفوق عليها غيرها في النتيجة والتكلفة معاً، وقد استُبعد Holo4 منه عمداً ليظهر موقعه بالنسبة إليه. ما يعوّض ضعف المنهجية جزئياً هو الشفافية: نشرت الشركة كل المسارات التنفيذية خلف نتائجها العامة. يمكنك إعادة تشغيلها خطوة بخطوة عبر trajectories.hcompany.ai أو تنزيلها كمجموعة بيانات من Hugging Face، وبهذا يستطيع أي فريق التدقيق بنفسه بدل تصديق الأرقام. الحجمان متاحان اليوم عبر H Models API، والتدوينة لا تذكر أسعار الاستدعاء. الأوزان منشورة بصيغ BF16 وFP8 وNVFP4 وGGUF رباعي البت، ضمن مجموعة Holo4 التي تتضمن أيضاً نسخاً بصيغة FP16. ووعدت الشركة بنقاط DSpark drafter محسّنة لتسريع الـ inference خلال الأيام المقبلة. إن كنت تبني وكيلاً لأتمتة عمل داخلي، فابدأ بمراجعة المسارات المنشورة على مهام تشبه مهامك قبل أي قرار.

مقالات ذات صلة

زر الذهاب إلى الأعلى