
بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري
0.133 — هذا هو أعلى درجة هارد F1 حققها أي نظام على معيار WANDR الصادر عن Perplexity Research، وهو رقم يكشف بوضوح أن وكلاء البحث المدعومة بالذكاء الاصطناعي لا تزال بعيدة عن تغطية مجموعات البيانات الكاملة بشكل موثوق — حتى حين تبدو نتائجها مقنعة للوهلة الأولى.

المشكلة التي يضعها WANDR على الطاولة ليست جديدة في جوهرها، لكنها تصبح حادة الآن مع انتشار وكلاء البحث في سياقات احترافية حقيقية: الوكيل قد يجد أمثلة جيدة، بل ممتازة، على الموضوع الذي تطلبه — لكنه يفشل في إكمال المهمة لأنه لا يسترجع المجموعة كاملة. (وفقاً لـ Perplexity Research) الفرق بين “بحثت ووجدت بعضاً” و”بحثت واستوعبت الصورة كلها” هو بالضبط ما يقيسه هذا المعيار.
يضم WANDR 500 مهمة تجميع مصممة لاختبار قدرة الوكلاء على البحث عرضاً وعمقاً في آنٍ واحد. المهام ليست أسئلة بسيطة تحتاج إجابة واحدة، بل تجميعات تتطلب استرجاع سجلات متعددة مع أدلة دقيقة على كل سجل. النظام الرائد في الاختبار سجّل 0.363 سوفت F1 و0.133 هارد F1 (وفقاً لـ Perplexity Research). الهوّة بين الرقمين ليست تفصيلاً تقنياً — إنها تعني أن الوكيل يجد أجزاء صحيحة من الإجابة بسهولة نسبية، لكنه يعجز عن تقديم الأدلة الكاملة الموثّقة لكل عنصر في المجموعة.

الدلالة التقنية لمقياسَي F1 هنا جوهرية لفهم ما يحدث فعلاً. السوفت F1 يقيس التشابه الدلالي بين ما أعاده الوكيل وما كان مطلوباً — فإذا أعاد الوكيل معلومة قريبة من الصحيح، يُحتسب له جزء من النقاط. أما الهارد F1 فلا يرحم: إما أن يُطابق السجل المطلوب بدليله بدقة كاملة، أو لا يُحتسب شيء. النتيجة 0.133 على الهارد F1 تعني أن نحو سبعة أثمان المطلوب يغيب عن الإجابات الأفضل حتى الآن.
ما يجعل هذا المعيار مختلفاً عن معظم الاختبارات التي يُقاس بها الوكلاء اليوم هو نقطة تصميمية واحدة: التقييم ليس على عيّنة مختارة من النتائج، بل على المجموعة الكاملة. كثير من أُطر التقييم الحالية تسمح للوكيل بالظهور بمظهر لامع إذا قدّم عدداً محدوداً من النتائج عالية الجودة — وهو ما يخفي الفشل الحقيقي في الاستدعاء الشامل. WANDR يسدّ هذه الثغرة بتصميمه القائم على الاسترجاع الكامل للمجموعة مع أدلة على مستوى كل سجل.
التطبيق العملي لهذا يمس مباشرة أي فريق يبني أو يشتري أدوات بحث وكيل: إذا كنت تقيّم الوكيل على جودة العيّنات التي يُقدّمها، فأنت لا تقيّس المشكلة الحقيقية. السؤال ليس “هل وجد الوكيل أمثلة جيدة؟” بل “هل غطّى المجموعة كلها؟ وهل يملك الدليل على كل سجل؟”. هذا التمييز يصبح حاسماً حين يُستخدم الوكيل في مهام مثل مراجعة الأدبيات، أو تجميع بيانات السوق، أو البحث القانوني — أي سياق تكون فيه الفجوات في التغطية خطيرة بقدر الأخطاء الصريحة.
الخلاصة التشغيلية من WANDR واضحة: قبل أن تُوسّع من نشر وكلاء البحث، اختبر المقيّم نفسه أولاً. منهجية التقييم القائمة على الاسترجاع الكامل والأدلة على مستوى السجل ليست خياراً متقدماً — هي الحد الأدنى لمعرفة ما يعمل فعلاً. الكود والبيانات متاحة على GitHub في مستودع perplexityai/wandr لمن يريد البناء عليها أو المقارنة بها.







