تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
الإحصائيات والتقارير

AutoDesign يتفوق على Claude في تصميم ملصقات الأبحاث تلقائياً

بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري

نظام ذكاء اصطناعي يُنجز في 40 دقيقة وبأقل من 3 دولارات ما يستغرق الباحثون ساعات في تنفيذه يدوياً — هذا ما يقدمه AutoDesign، الإطار البحثي الجديد الذي نشره فريق من 14 باحثاً بقيادة Yaxin Luo، والذي يُعيد تعريف مهمة تحويل الأوراق البحثية إلى ملصقات مؤتمرات احترافية عبر حلقة وكيل برمجي ذاتية التحسين.

الفكرة الجوهرية أن إنتاج المخرجات المرئية المنظّمة من مصادر متعددة الوسائط ليست مجرد مهمة توليدية بسيطة، بل هي عملية وكيل طويلة الأفق تحتاج إلى نظام يتعلم من تجاربه ويحسّن أدواته ذاتياً. الأنظمة الحالية — سواء كانت مفتوحة أو تجارية — تعمل بنمط ثابت لا يتكيّف مع الأخطاء السابقة ولا يجمع خبرة قابلة للإعادة. AutoDesign يعالج هذا القصور بمنهجية مختلفة: محسّن “meta-harness” يوجّه وكيلاً برمجياً لكتابة وتعديل أدوات التصميم بناءً على التغذية الراجعة من كل جولة تشغيل فعلية.

ولاختبار الإطار وقياسه بشكل موضوعي، قدّم الفريق معياراً جديداً أسماه PosterBench، يتكوّن من مسارين: المسار الرئيسي الذي يضم 100 ورقة بحثية موزعة على خمس تخصصات علمية، ومسار PosterBench-mini المكوّن من 10 أوراق مشتركة يُستخدم للتقييم المضبوط بين الأنظمة المختلفة. هذا التمييز بين المسارين يمنح الباحثين أداة مقارنة عادلة لا تتأثر بفروق في مجموعات الاختبار.

النتائج على PosterBench كانت لافتة. على المسار الرئيسي المكوّن من 100 ورقة، (وفقاً للورقة البحثية على arXiv) حقق AutoDesign أعلى نتيجة بمجموع 78.32 نقطة، متجاوزاً نظام Claude Design التجاري المغلق المصدر بفارق 7.45 نقطة. لكن الأكثر إثارة من الرقم المطلق هو ما يكشفه الاختبار عبر سبع تهيئات مختلفة لنماذج الوكلاء البرمجيين: دمج DesignHarness المكتسب بالتعلم أدى إلى تحسين الأداء بشكل منتظم في جميع التهيئات السبع، رافعاً متوسط PosterBench Score من 54.99 إلى 67.39، أي بزيادة 12.4%. هذا يعني أن قيمة ما تعلّمه النظام لا تنحصر في نموذج واحد بل تنتقل عبر بيئات مختلفة.

أما على مستوى الكفاءة التشغيلية، فالنظام في حلقته الاستقلالية الكاملة ينفّذ 253 استدعاءً للأدوات عبر 11 جولة تحرير خلال جلسة واحدة لا تتجاوز 40 دقيقة، وبتكلفة تبقى دون حاجز الـ3 دولارات. الملصقات الناتجة بلغت في التقييم البشري مستوى جودة “ملصق مؤتمر متوسط”، وهو مستوى كافٍ للاستخدام الفعلي دون تدخل يدوي مكثف. وفي دراسة التفضيل البشري العمياء — التي لم يعرف فيها المُقيّمون أي نظام أنتج أي ملصق — اختار المشاركون مخرجات AutoDesign كأفضل المخرجات بين جميع الأنظمة المُقيَّمة.

ما يستحق التأمل هنا ليس فقط الأداء المتفوق، بل بنية التحسين الذاتي التي يقترحها الإطار. معظم الأنظمة الحالية تُصمَّم مرة واحدة ثم تُنشر كما هي؛ AutoDesign يتبنى نموذجاً مختلفاً يشبه آليات التحسين التي نراها في reinforcement learning، لكنه يطبّقها على مستوى أدوات النظام ذاتها لا على مستوى الأوزان. هذا النهج — إن ثبت قابليته للتعميم خارج مهمة الملصقات — قد يفتح باباً واسعاً أمام وكلاء تصميم تتطور أدواتهم بالتجربة لا بإعادة التدريب.

القيد الواضح حتى الآن هو أن التقييم اقتصر على مهمة واحدة محددة: تحويل الأوراق البحثية إلى ملصقات. لا نعرف بعد كيف يتصرف النظام حين تتسع المدخلات أو تتعدد أنواع المخرجات المطلوبة. لكن PosterBench كمعيار قياس مستقل هو إضافة حقيقية للمجال — إذ يمنح الباحثين أرضية مشتركة لمقارنة الأنظمة المستقبلية بدلاً من الاعتماد على تقييمات ذاتية متفرقة.

arXiv

مقالات ذات صلة

زر الذهاب إلى الأعلى