
بقلم: ليلى | محررة أدوات المطورين · صوت تحريري بإشراف بشري
Cosmos 3 Edge هو رهان NVIDIA الجديد على ذكاء الأجهزة المُقيَّدة: نموذج مفتوح بـ4 مليار معامل صُمِّم خصيصاً ليعمل داخل المصانع والمستودعات والمستشفيات، لا في مراكز البيانات. أُطلق اليوم على منصة Hugging Face، ويستطيع النموذج أن يفهم المشهد المرئي ويُولِّد الإجراءات الروبوتية في الوقت الفعلي على أجهزة الحافة، بدءاً من بطاقات RTX PRO وصولاً إلى وحدات Jetson T2000 وT3000 المُعلَن عنها حديثاً.

ما يُميِّز Cosmos 3 Edge عن نماذج الرؤية المدمجة المعتادة هو بنيته المزدوجة: برجان من المحوِّلات يتشاركان طبقات الاهتمام متعددة الوسائط. البرج الأول ذاتي الانحدار (Autoregressive) يُعالج رموز الرؤية والنصوص لأغراض الفهم والاستدلال، والثاني الانتشاري (Diffusion) يُعالج رموز الرؤية والصوت والإجراءات لأغراض التنبؤ والتوليد والمحاكاة العصبية. الطبقتان تحتفظان بطبقات التطبيع الخاصة بهما والشبكات متعددة الطبقات، لكنهما تتشاركان طبقات الاهتمام التي تُوازن المعلومات عبر اللغة والفيديو والصوت والإجراءات. النتيجة: نموذج واحد يفهم ما يجري الآن، يُحاكي ما قد يحدث لاحقاً، ويُنتج الإجراء المناسب.
ما يجعل هذا الإطار مفيداً فعلاً للروبوتات هو تمثيل الإجراءات الموحَّد. الأجهزة الفيزيائية المختلفة — السيارة التي تُمثِّل الحركة بـ ego pose، الكاميرا بحركة المحور، ذراع الروبوت بموضع المُشغِّل النهائي، والمقبض بحالة الإمساك — كل هذه الأشكال تُرمَّز في متَّجهات هندسية مدمجة تجمع الإزاحة والدوران وحالة التلاعب. هذا يُتيح للنموذج أن يربط تغيُّرات البكسل بالحركة الفيزيائية وعلاقات الفضاء، فيصبح الفيديو المُولَّد أكثر من مجرد تنبؤ بصري — إنه تمثيل لكيفية تغيُّر العالم استجابةً لإجراء ما.

على صعيد الأداء، يعمل النموذج (وفقاً لـ NVIDIA) بدقة 640×360 للتحكم الروبوتي، ويُولِّد 32 إجراءً لكل استدلال على Jetson Thor محققاً 15 هرتز في الوقت الفعلي. وفي معيار VANTAGE-Bench لتحليلات الرؤية، يحتل Cosmos 3 Edge المرتبة الأولى بين النماذج ذات الحجم المماثل (4 مليار معامل)، مع أداء في طليعة الفن لتعلُّم سياسات الروبوت.
تُرفق NVIDIA بإطلاق النموذج Cosmos 3 Edge Policy (DROID)، وهو نموذج مُدرَّب مسبقاً على مجموعة بيانات DROID لمهام الإمساك والوضع. كما تُتيح سكريبتات post-training للمطورين ضبط النموذج على مجموعة صغيرة من H100 أو DGX Station قبل النشر على أجهزة الحافة. إلى جانب ذلك، يُصدر الفريق نقطة تفتيش Cosmos 3 Super 4-Step Distillation للنموذج الأكبر (64 مليار معامل)، التي تُقلِّص خطوات إزالة الضوضاء من 35–50 خطوة إلى 4 خطوات فقط، محققةً سرعة أكبر تصل إلى 25 ضعفاً مع الحفاظ على جودة الصورة والفيديو.

النموذج مُتاح الآن للتنزيل على Hugging Face بصيغة مفتوحة. المسار الواضح للمطور الذي يريد الاستفادة منه فعلياً:
- تنزيل النموذج الأساسي من مستودع
nvidia/Cosmos3-Edgeعلى Hugging Face، وهو يعمل كـ VLM مدمج للتحليل والاستدلال البصري. - تقييم Cosmos 3 Edge Policy (DROID) جاهزاً لمهام الإمساك والوضع دون الحاجة إلى post-training إن كان التطبيق مشابهاً.
- استخدام سكريبتات post-training المُرفقة مع مجموعة بيانات مخصصة على H100 أو DGX Station لضبط النموذج على البيئة المستهدفة.
- تجربة نقطة تفتيش Cosmos 3 Super 4-Step Distillation إن كان المشروع يتطلب توليد صور أو فيديو بسرعة أعلى (25× أسرع من النموذج الكامل).
- نشر النموذج المُدرَّب على أجهزة الحافة المدعومة: RTX PRO GPUs أو GeForce RTX أو Jetson (بما يشمل T2000 وT3000) أو DGX.
- متابعة تحسينات vLLM القادمة التي تعمل NVIDIA على دمجها لتسريع الـ inference وتقليل متطلبات post-training.
على الورق، هذا هو النموذج الذي يُعنى به أي مطور يبني روبوتات صناعية أو أنظمة رؤية ذكية تحتاج للعمل في بيئات مُقيَّدة الموارد. القيد الأهم حتى الآن هو أن دعم vLLM والأدوات المحسَّنة للنشر لا تزال قيد التطوير، مما يعني أن التجربة الأكثر انسيابية لم تصل بعد — لكن النموذج بإصداره المفتوح اليوم يُتيح للمطورين البدء فعلاً.







