تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعي

Qwen-CUA يتحكم بحاسوبك من لقطة الشاشة فقط

بقلم: ليلى | محررة أدوات المطورين · صوت تحريري بإشراف بشري

نموذج واحد، واجهة واحدة، وأي برنامج تقريباً — هذا ما يعِد به Qwen-CUA، الوكيل الذي أطلقه فريق xlang-ai مبنياً على عائلة Qwen، ويعمل بطريقة لا تحتاج إلى DOM أو بيانات إمكانية الوصول أو shell access أو APIs خاصة بكل مهمة. النموذج يرى ما تراه أنت بالضبط — لقطة شاشة — ثم يُنفذ إجراءات حقيقية عبر أحداث لوحة المفاتيح والفأرة.

المبدأ بسيط لكن تطبيقه مركّب: Qwen-CUA يتلقى لقطات الشاشة والتعليمات، يتتبع التقدم، يستدل على الواجهة المرئية، ثم يقترح إجراءات محددة وقابلة للتنفيذ. في الوقت ذاته، تتولى بنية runtime المرافقة التقاط المشاهدات وإدارة السياق متعدد الوسائط والتحقق من الإجراءات وتنفيذها وطلب موافقة المستخدم وحفظ أدلة إعادة التشغيل. النتيجة هي حلقة تفاعل كاملة: افحص الصفحة، خطّط، نفّذ، تعافَ حين تتغير الواجهة، وتحقق من النتيجة.

التحدي التقني الأساسي في وكلاء استخدام الحاسوب هو السياق الطويل المثقل بالصور. Qwen-CUA يعالج ذلك بإبقاء آخر 20 لقطة شاشة نشطة في الذاكرة الفعّالة، بينما يطوي اللقطات الأقدم في كتل — أسلوب يحدّ من نمو السياق ويحسّن إعادة استخدام البادئة الثابتة، مما يتيح للنموذج الحفاظ على حالة المهمة عبر تسلسلات طويلة دون أن ينهار أداؤه.

على صعيد التدريب، وسّع الفريق الطاقة الحسابية من ألف مهمة إلى 40 ألف مهمة مع بنية تحتية تصل إلى 100 ألف وحدة vCPU لتنفيذ التجربات (وفقاً لـ xlang-ai GitHub). المنهجية تعتمد على دورات تدريب متتالية: النموذج الحالي يكشف الاستفسارات غير المحلولة والمجالات الضعيفة، وتلك التشخيصات تُحدّث خليط البيانات الخاضعة للإشراف وتوزيع مهام الـ RL القابلة للتحقق قبل الجولة التالية. كل دورة SFT تبدأ من نقطة تحقق منتصف التدريب ذاتها بدلاً من الضبط الدقيق المتراكم للنموذج السابق، والنموذج الناتج يُعيد معايرة مجموعة RL بثماني تجارب لكل مهمة، محتفظاً بالاستفسارات التي ليست بعيدة المنال ولا مُشبعة بالفعل.

النتائج على benchmark التقييم واضحة: النموذج الأساسي Qwen-CUA (397B-A17B) يسجّل 86.2 على OSWorld-Verified، فيما يرتفع النموذج الأكبر Qwen-CUA-Max (أكثر من تريليون معامل) إلى 87.6 على OSWorld-Verified مع تحسينات على كلٍّ من الأداء الثنائي والجزئي في OSWorld 2.0 (وفقاً لـ xlang-ai GitHub). التقييم يمتد عبر ثماني عائلات من المعايير تشمل التحكم بسطح المكتب والعمل طويل المدى وتفاعل الويب والمتانة في مواجهة الهجمات الخصومية.

للتجربة المحلية، يوفر المستودع تطبيقاً مرجعياً يعتمد المتصفح أولاً داخل مجلد demo/، ويضم لوحة تحكم للمشغل تتيح فحص لقطات الشاشة والإجراءات والموافقات واستجابات النموذج الخام، إلى جانب بوابات أمان لإيقاف الإجراءات الحساسة وعزل كل جلسة Playwright في سياق مستقل، وحفظ الأحداث واللقطات والملفات المحملة وأدلة التحقق الحتمية لإعادة التشغيل. خطوات التشغيل مباشرة:

  1. استنسخ المستودع: git clone https://github.com/xlang-ai/Qwen-CUA.git
  2. انتقل إلى مجلد العرض التوضيحي: cd Qwen-CUA/demo
  3. انسخ ملف البيئة: cp .env.example .env
  4. اتبع دليل البدء السريع لربط نقطة نهاية multimodal متوافقة مع OpenAI.
  5. أطلق لوحة تحكم المشغل لبدء جلسة التحكم بالحاسوب.

قيد جوهري ينبغي أخذه بعين الاعتبار: المستودع الحالي يتضمن التقرير التقني والعرض التوضيحي المرجعي فحسب — أوزان النموذج غير مضمّنة. ستحتاج إلى نقطة نهاية متوافقة مع OpenAI لتشغيل النموذج فعلياً. فضلاً عن ذلك، وكلاء استخدام الحاسوب معرّضون لحقن الـ prompt والإجراءات العرضية التي قد تكون ذات عواقب — لذا يوصي الفريق باستخدام سياقات متصفح معزولة، وتجنب سير العمل الحساسة أو المصادق عليها، واشتراط موافقة بشرية على العمليات الحرجة. إعلان النموذج بنجاح المهمة لا يُعدّ دليلاً على تحقق النتيجة المرجوة فعلياً في العالم الحقيقي.

ما يميز Qwen-CUA عن الأطر المنافسة هو رهانه الكامل على البكسل بدلاً من الاعتماد على طبقات وصول مخصصة — وهو ما يجعله نظرياً قادراً على العمل مع أي برنامج يظهر على الشاشة، من تطبيقات سطح المكتب إلى المتصفحات، دون الحاجة إلى تكاملات مسبقة. المشروع مرخّص بموجب Apache-2.0، مما يفتح الباب أمام استخدامه في بيئات الإنتاج التجارية.

xlang-ai GitHub

مقالات ذات صلة

زر الذهاب إلى الأعلى