
نموذج مفتوح بأربعة مليارات معامل يرفع الاستدلال السببي من 2.6 إلى 41.3 ويسجل 90.7 PDMS على NAVSIM، مقابل تراجع طفيف في القدرة العامة.
ضمن ملف: نماذج الذكاء الاصطناعي
بقلم: يوسف | محرر أدوات الذكاء الاصطناعي · صوت تحريري بإشراف بشري
المصدر الأساسي: GitHub
لماذا يهم
فرق أبحاث القيادة الذاتية والروبوتات المجسّدة تحصل على نموذج رؤية ولغة مفتوح تجارياً يعمل على بطاقة واحدة، بدل الاعتماد على نظام مغلق أو بناء خط بيانات وتقييم من الصفر.
أربعة مليارات معامل، بطاقة رسومية واحدة بذاكرة 24 غيغابايت، وترخيص Apache 2.0 يسمح بالاستخدام التجاري. هذه هي حدود Qwen-Drive-1.0، النموذج الذي أصدره فريق Qwen بالتعاون مع جامعة هواتشونغ للعلوم والتكنولوجيا، ويدمج الإدراك ثلاثي الأبعاد والإجابة عن أسئلة الرؤية والتخطيط الحركي داخل إطار واحد، بحسب مستودع المشروع على GitHub. الأوزان متاحة من Hugging Face ومن ModelScope، وكل ما يلي في هذا التقرير يعود إلى مصدر وحيد هو المستودع الرسمي والتقرير التقني المرفق، ولم يتسنَّ التحقق منه بشكل مستقل.
البنية نفسها هي أهم قرار هندسي في الإصدار. لم يُبنَ النموذج من الصفر: بقي Qwen3.5-4B متعدد الوسائط كما هو نموذجاً مشتركاً، وعُلّقت عليه وحدتان خارجيتان فقط. الأولى BEV Perception Head، رأس إدراك بمنظور الطائر يؤدي ثلاث مهام معاً: كشف الأجسام ثلاثي الأبعاد، والتنبؤ بالإشغال الدلالي، وتقطيع خريطة BEV. وظيفته مزدوجة بحسب المستودع: مخرج عملي من جهة، ومسبار يكشف كم من البنية ثلاثية الأبعاد متاح أصلاً داخل التمثيلات المشتركة من جهة أخرى، أي واجهة قابلة للفحص لا صندوق أسود. الثانية Planning Expert، خبير تخطيط يشتق مسار المركبة المستقبلي من التمثيلات ذاتها. مفكك الترميز اللغوي الأصلي بقي دون تعديل، ولهذا يظل النموذج قادراً على أسئلة الرؤية العامة وأسئلة مشاهد القيادة في الوقت نفسه.
ما يسند هذه البنية هو استراتيجية تدريب مرحلية تدمج أهداف الإدراك واللغة والتخطيط، مع خط بيانات موحّد يقوم بثلاث عمليات: تحويل تعليقات الإدراك المتباينة إلى فضاء تسميات مشترك، وإعادة توسيم إجابات أسئلة القيادة لضمان اتساق الصيغة والوقائع، وتوحيد المسارات القادمة من مجموعات بيانات قيادة عامة متعددة في تمثيل نقاط طريق واحد. هذا التفصيل يستحق انتباهك أكثر من أرقام الصدارة: خلط بيانات Waymo وNAVSIM وغيرها في تدريب واحد بدون فضاء تسميات مشترك هو أسرع طريق إلى نموذج مشوّش.
على التخطيط، تسجّل نسخة التدريب بالتقليد (SFT) 88.2 PDMS على NAVSIM v1.1 navtest، وترتفع إلى 89.3 بأفضل ست عيّنات، بينما تصل نسخة التحسين بالمكافأة (RL) إلى 90.7 و91.4 على التوالي (وفقاً لمستودع Qwen-Drive على GitHub). وعلى Waymo Open Dataset E2E تسجّل النسختان 7.78 و7.91 RFS. لكن التقدم ليس خطياً: على مقياس NVIDIA PhysicalAI مفتوح الحلقة، متوسط الخطأ الأدنى للمسافة عند ثلاث ثوانٍ هو 0.34 متر لنسخة SFT مقابل 0.38 متر لنسخة RL. أي أن تحسين المكافأة على أهداف اختبارات بعينها كلّف النموذج دقة في التقليد المباشر، وكلاهما يتقاسم النموذج اللغوي البصري نفسه. هذه أرقام معلنة من الفريق نفسه.
القفزة الأوضح في فهم مشاهد القيادة. على LingoQA يصل Qwen-Drive-1.0-SFT إلى 77.8 مقابل 70.4 للأساس Qwen3.5-4B و72.0 لـMiMo-Embodied-7B و65.0 لـCosmos3-nano و64.0 لـAlpamayo-1.5-10B و59.6 لـCosmos-Reason2-8B و46.4 لـInternVL3.5-8B-Instruct و41.2 لـLLaVA-OV2-8B. وينخفض خطأ Ego3D RMSE إلى 7.78 (الأقل أفضل) مقابل 9.85 لـMiMo و12.62 لـCosmos-Reason2 و13.17 للأساس و26.71 لـCosmos-Reason1-7B. أما بقية الأعمدة فترتفع كلها فوق الأساس: VLAD من 65.4 إلى 66.5، وSURDS من 53.0 إلى 66.1، وWaymoQA للسلامة من 62.5 إلى 70.7، والدرجة الكلية من 67.1 إلى 74.5، والمجموعة الداخلية الصينية لقرارات القيادة في المدن (IH) من 59.0 إلى 71.0. والرقم الأغرب على مجموعة الاستدلال السببي PAI-AV Chain-of-Causation: من 2.6 إلى 41.3، في حين لم يتجاوز أي نموذج مرجعي في الجدول 4.0.
وهنا تبدأ التحذيرات المنهجية، والفريق نفسه يذكر معظمها. أولاً، استُبدل حَكَم LingoJudge الرسمي بـQwen-Plus لأن الأول يمنح درجات متساهلة وغير متسقة بين المشاهد بحسب المستودع، وتحت البروتوكول الرسمي يسجّل النموذج 79.4. القرار قد يكون محقاً تقنياً، لكنه قرار اتخذه صاحب النموذج، ويجعل مقارنة هذه الأرقام بأرقام منشورة سابقاً لنماذج أخرى غير مباشرة. ثانياً، بعض قيم النماذج المرجعية منهارة بشكل يصعب تفسيره بالقدرة وحدها، مثل 7.5 لـAlpamayo-1.5-10B على MMBench و3.2 على OCRBench و9.1 على VLAD، مع خانات يشرح المستودع أنها استجابات غير صالحة أو غير قابلة للتحليل. هذه أرقام تنسيق ومحلّلات إخراج بقدر ما هي أرقام قدرة. ثالثاً، أُعيد إنتاج كل المقارنات من قبل الفريق تحت بروتوكول واحد بفك ترميز شبه حتمي، وهو ما يوحّد الشروط لكنه لا يغني عن تحقق طرف ثالث.
الادعاء الثاني في الإصدار هو أن التخصص لم يلتهم القدرة العامة، والأرقام تدعمه جزئياً فقط. تراجع النموذج على MMBench من 87.1 إلى 85.5، وعلى MMMU من 73.4 إلى 72.7، وعلى MMMU-Pro النصية من 64.9 إلى 62.7 والبصرية من 61.3 إلى 59.7، وعلى CharXiv من 65.1 إلى 64.4، وعلى OCRBench من 86.9 إلى 86.4، وعلى SimpleVQA من 47.8 إلى 46.1، وبأوضح فارق على CountQA من 35.9 إلى 31.7. في المقابل تقدّم على MMStar من 75.3 إلى 75.9، وعلى RealWorldQA من 76.3 إلى 79.0. وفي الفهم المكاني والتأريض ترتفع EmbSpatial من 76.0 إلى 78.9 وERQA من 46.3 إلى 48.5 وODinW13 من 40.8 إلى 45.9، لكن RefSpatial تنزل من 54.5 إلى 50.8 وOmni3D من 47.4 إلى 45.8. الثمن الحقيقي إذن كان تراجعاً طفيفاً في المعرفة العامة والعدّ وبعض التأريض المكاني، مقابل مكسب واضح في القيادة والإدراك الواقعي. نتائج الكشف ثلاثي الأبعاد والإشغال وتقطيع الخرائط ليست على صفحة المستودع، بل في التقرير التقني وفي docs/evaluation.md.
إن أردت تشغيله بنفسك، الطريق أقصر مما يبدو:
- جهّز العتاد. يوصي الفريق ببطاقة بذاكرة 24 غيغابايت فأكثر. الأوزان كاملة نحو 13.8 غيغابايت موزعة على النموذج اللغوي البصري (9.1 غيغابايت) وplanner-sft (2.1) وplanner-rl (2.1) ورأس الإدراك (0.5).
- ثبّت البيئة. استنسخ المستودع، أنشئ بيئة Python 3.10 (المثال الرسمي يستخدم conda)، ثم نفّذ
pip install -e . --no-build-isolationأو ثبّت من ملف requirements. رأس الإدراك يحمل أنوية CUDA خاصة تحتops/، فتوقّع خطوة بناء وليس تثبيتاً فورياً. - نزّل كل شيء من مجلد واحد. النموذج المشترك في الجذر وكل رأس مهمة في مجلد فرعي بجانبه. إن كان كل ما تريده هو وضع VQA، فالنموذج وحده يكفي دون أي رأس إضافي.
- اختر المخطِّط بوعي. يُعلّق الرأس عند التحميل عبر معامل
plannerفيQwenDriveForPlanning.from_pretrained. نسخة planner-rl حُسّنت بالمكافأة على مسارات مشروطة بالاستدلال فقط، لذا يجب تشغيلها في وضع reasoning planning حصراً، بينما تغطي planner-sft الوضعين المباشر والاستدلالي. - ابدأ من العرض التوضيحي الجاهز. مجلد
data/demo/يضم أربعة مشاهد تخطيط من WOD-E2E في ملف Parquet واحد مع ست لقطات إدراك: تقاطع ليلي تتحول إشارته إلى الأخضر، ودوران يسار، ودوران يمين، وتباطؤ بمحاذاة شاحنة متوقفة. تشغيلscripts/demo.py --plotيُخرج صورة تجمع حلقة الكاميرات يساراً (صف لكل منظور وعمود لكل خطوة زمنية) والمسارات المتوقعة مقابل الحقيقة الأرضية يميناً، مع نص الاستدلال أسفلها. - افهم شكل المخرجات قبل أن تبني عليها. استدعاء
model.runبوضع REASONING_PLANNING معnum_samples=6يعيد نصاً استدلالياً ومصفوفة مسارات بأبعاد (6, 50, 3): ست عيّنات، لكل منها 50 نقطة بإحداثيات x وy واتجاه، تغطي خمس ثوانٍ بتردد 10 هرتز. - ارجع إلى الوصفات للبقية. يغطي
docs/cookbook.mdوضع VQA وتخطيط best-of-N وتشغيل الاختبارات المعيارية والتقييم متعدد البطاقات واستدلال الإدراك والتصور، فيما تشرح ملفات model وdata وevaluation وperception حقول الإعداد ومعاملات فك الترميز وصيغة ملفات المشاهد وتعريفات المقاييس واصطلاحات الإحداثيات وتخطيط بيانات العرض.
ولا يناسبك هذا الإصدار إن كنت تبحث عن نظام قابل للنشر على مركبة. كل نتائج التخطيط المعلنة مفتوحة الحلقة أو على محاكيات معيارية، ولا يوجد في المادة المنشورة اختبار مغلق الحلقة ولا تشغيل على طريق حقيقي، والعنوان نفسه يصف المشروع بأنه “خطوة أولى”. المجموعة الداخلية IH التي يسجّل عليها النموذج 71.0 غير عامة، فلا يمكن لأحد خارج الفريق إعادة إنتاجها. والتقرير التقني منشور كمسوّدة على arXiv برقم 2609.00111 ولم يمر بمراجعة أقران.
ما يجعل الإصدار مهماً رغم ذلك ليس رقم 90.7، بل أن أربعة مليارات معامل بترخيص Apache 2.0 تعمل على بطاقة واحدة تضع أبحاث القيادة الذاتية متعددة الوسائط في متناول فرق صغيرة كانت أمامها خياران: نظام مغلق، أو بناء خط البيانات والتقييم من الصفر. الأرقام تحتاج تحققاً مستقلاً، والشيفرة والأوزان والوصفات وبيانات العرض متاحة أمامك للقيام بذلك، وهذا وحده أكثر مما يقدمه معظم ما يُعلن في هذا المجال.
المصادر







