تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعي

Cosmos 3 Edge من NVIDIA: نموذج مفتوح للروبوتات على أجهزة الحافة

بقلم: ليلى | محررة أدوات المطورين · صوت تحريري بإشراف بشري

Cosmos 3 Edge هو رهان NVIDIA الجديد على ذكاء الأجهزة المُقيَّدة: نموذج مفتوح بـ4 مليار معامل صُمِّم خصيصاً ليعمل داخل المصانع والمستودعات والمستشفيات، لا في مراكز البيانات. أُطلق اليوم على منصة Hugging Face، ويستطيع النموذج أن يفهم المشهد المرئي ويُولِّد الإجراءات الروبوتية في الوقت الفعلي على أجهزة الحافة، بدءاً من بطاقات RTX PRO وصولاً إلى وحدات Jetson T2000 وT3000 المُعلَن عنها حديثاً.

فيديو تعريفي بنموذج Cosmos 3 Edge من NVIDIA للذكاء الاصطناعي الفيزيائي
Cosmos 3 Edge — نموذج العالم المفتوح للروبوتات على أجهزة الحافة

ما يُميِّز Cosmos 3 Edge عن نماذج الرؤية المدمجة المعتادة هو بنيته المزدوجة: برجان من المحوِّلات يتشاركان طبقات الاهتمام متعددة الوسائط. البرج الأول ذاتي الانحدار (Autoregressive) يُعالج رموز الرؤية والنصوص لأغراض الفهم والاستدلال، والثاني الانتشاري (Diffusion) يُعالج رموز الرؤية والصوت والإجراءات لأغراض التنبؤ والتوليد والمحاكاة العصبية. الطبقتان تحتفظان بطبقات التطبيع الخاصة بهما والشبكات متعددة الطبقات، لكنهما تتشاركان طبقات الاهتمام التي تُوازن المعلومات عبر اللغة والفيديو والصوت والإجراءات. النتيجة: نموذج واحد يفهم ما يجري الآن، يُحاكي ما قد يحدث لاحقاً، ويُنتج الإجراء المناسب.

ما يجعل هذا الإطار مفيداً فعلاً للروبوتات هو تمثيل الإجراءات الموحَّد. الأجهزة الفيزيائية المختلفة — السيارة التي تُمثِّل الحركة بـ ego pose، الكاميرا بحركة المحور، ذراع الروبوت بموضع المُشغِّل النهائي، والمقبض بحالة الإمساك — كل هذه الأشكال تُرمَّز في متَّجهات هندسية مدمجة تجمع الإزاحة والدوران وحالة التلاعب. هذا يُتيح للنموذج أن يربط تغيُّرات البكسل بالحركة الفيزيائية وعلاقات الفضاء، فيصبح الفيديو المُولَّد أكثر من مجرد تنبؤ بصري — إنه تمثيل لكيفية تغيُّر العالم استجابةً لإجراء ما.

ذراع روبوت يرفع موزة ويضعها في طبق استجابةً لأمر Cosmos 3 Edge
Cosmos 3 Edge يُنفِّذ أمر «التقط الموزة وضعها في الطبق» — مثال على وضع السياسة الروبوتية

على صعيد الأداء، يعمل النموذج (وفقاً لـ NVIDIA) بدقة 640×360 للتحكم الروبوتي، ويُولِّد 32 إجراءً لكل استدلال على Jetson Thor محققاً 15 هرتز في الوقت الفعلي. وفي معيار VANTAGE-Bench لتحليلات الرؤية، يحتل Cosmos 3 Edge المرتبة الأولى بين النماذج ذات الحجم المماثل (4 مليار معامل)، مع أداء في طليعة الفن لتعلُّم سياسات الروبوت.

تُرفق NVIDIA بإطلاق النموذج Cosmos 3 Edge Policy (DROID)، وهو نموذج مُدرَّب مسبقاً على مجموعة بيانات DROID لمهام الإمساك والوضع. كما تُتيح سكريبتات post-training للمطورين ضبط النموذج على مجموعة صغيرة من H100 أو DGX Station قبل النشر على أجهزة الحافة. إلى جانب ذلك، يُصدر الفريق نقطة تفتيش Cosmos 3 Super 4-Step Distillation للنموذج الأكبر (64 مليار معامل)، التي تُقلِّص خطوات إزالة الضوضاء من 35–50 خطوة إلى 4 خطوات فقط، محققةً سرعة أكبر تصل إلى 25 ضعفاً مع الحفاظ على جودة الصورة والفيديو.

بنية نموذج Cosmos 3 Edge المزدوجة تجمع برجي المحوِّلات لفهم العالم وتوليد الإجراءات
البنية المزدوجة لـ Cosmos 3: برج ذاتي الانحدار وبرج انتشاري يتشاركان طبقات الاهتمام

النموذج مُتاح الآن للتنزيل على Hugging Face بصيغة مفتوحة. المسار الواضح للمطور الذي يريد الاستفادة منه فعلياً:

  1. تنزيل النموذج الأساسي من مستودع nvidia/Cosmos3-Edge على Hugging Face، وهو يعمل كـ VLM مدمج للتحليل والاستدلال البصري.
  2. تقييم Cosmos 3 Edge Policy (DROID) جاهزاً لمهام الإمساك والوضع دون الحاجة إلى post-training إن كان التطبيق مشابهاً.
  3. استخدام سكريبتات post-training المُرفقة مع مجموعة بيانات مخصصة على H100 أو DGX Station لضبط النموذج على البيئة المستهدفة.
  4. تجربة نقطة تفتيش Cosmos 3 Super 4-Step Distillation إن كان المشروع يتطلب توليد صور أو فيديو بسرعة أعلى (25× أسرع من النموذج الكامل).
  5. نشر النموذج المُدرَّب على أجهزة الحافة المدعومة: RTX PRO GPUs أو GeForce RTX أو Jetson (بما يشمل T2000 وT3000) أو DGX.
  6. متابعة تحسينات vLLM القادمة التي تعمل NVIDIA على دمجها لتسريع الـ inference وتقليل متطلبات post-training.

على الورق، هذا هو النموذج الذي يُعنى به أي مطور يبني روبوتات صناعية أو أنظمة رؤية ذكية تحتاج للعمل في بيئات مُقيَّدة الموارد. القيد الأهم حتى الآن هو أن دعم vLLM والأدوات المحسَّنة للنشر لا تزال قيد التطوير، مما يعني أن التجربة الأكثر انسيابية لم تصل بعد — لكن النموذج بإصداره المفتوح اليوم يُتيح للمطورين البدء فعلاً.

NVIDIA on Hugging Face Blog

مقالات ذات صلة

زر الذهاب إلى الأعلى