
بقلم: يوسف | محرر أدوات الذكاء الاصطناعي · صوت تحريري بإشراف بشري
اطرح على أي pipeline من أنظمة RAG سؤالاً من نوع “أدرج كل الاستثناءات في هذه الوثيقة”، وستحصل غالباً على قائمة نظيفة واثقة من خمسة عناصر — كل عنصر حقيقي، والتنسيق أنيق — في حين أن الوثيقة الأصلية تحتوي على تسعة. لا شيء في الإجابة يُلمّح إلى الفجوة، والمستخدم لا يملك أي سبب للتشكيك في قائمة تبدو مكتملة. هذا هو الفشل الصامت لأسئلة القوائم في أنظمة الاسترجاع المعزّز بالتوليد.
المشكلة بنيوية في جوهرها: وفقاً للتحليل المنشور على Towards Data Science، تفترض أنظمة RAG التقليدية أن الإجابة موجودة في مقطع واحد يمكن الوصول إليه عبر top-k retrieval. لكن أسئلة القوائم تكسر هذا الافتراض جذرياً: الإجابة هنا ليست أفضل مقطع، بل كل مقطع. وعندما تكون العناصر متشابهة دلالياً — كما هو الحال دائماً في القوائم — تُعيد آلية embedding نفس المقاطع المتكررة بدلاً من تغطية القائمة كاملةً، فيُنتج النموذج إجابة تبدو شاملة وهي منقوصة.

يُقدّم التحليل — وهو الجزء الثاني عشر من سلسلة Enterprise Document Intelligence — ثلاث استراتيجيات عملية للتعامل مع هذا النوع من الأسئلة، مطبّقةً على إطار NIST للأمن السيبراني وورقة “Attention Is All You Need”، مع الكود المرجعي في مستودع doc-intel/notebooks-vol1.
أول خطوة في بناء pipeline يتعامل مع هذه الأسئلة هي التعرف عليها. يعتمد التحليل على regex بسيط يرصد عبارات مثل “what are all”، و”list all”، و”every”، وأسئلة العدّ التي تستلزم ضمنياً استرجاعاً شاملاً. لكن التحليل يُشير بوضوح إلى أن الإصدار الأنضج يستخدم LLM classifier في مرحلة فهم السؤال، يُعيد intent مع cardinality متوقعة — أي عدد العناصر المتوقع في الإجابة. بمجرد أن يُصنَّف السؤال كـ listing، تتفعّل مسارات الاسترجاع المختلفة:
- الاسترجاع البنيوي (Structural Retrieval): الأقوى حين يكون المستند منظّماً بعناوين وأرقام وجداول. في مثال إطار NIST، تكفي العلاقة الأب-ابن في toc_df للحصول على الفئات الست تحت GOVERN في أجزاء من الثانية — بلا embedding، بلا top-k، بلا استدعاء LLM. نفس المنطق يعمل على ورقة Transformer حيث تمثّل العناوين الغامقة داخل القسم 5.4 تعداداً ضمنياً لتقنيات التنظيم مثل “Residual Dropout” و”Label Smoothing”. يستهدف هذا الأسلوب المستندات التي كتب فيها المؤلف القائمة بعلامات هيكلية واضحة — وهو الحال في أغلب الوثائق المؤسسية من عقود ومعايير وأوراق بحثية.
- الاسترجاع النمطي (Pattern-based Aggregation): حين لا توجد بنية صارمة لكن العناصر تتبع شكلاً منتظماً كأكواد أو معرّفات أو بنود مرقّمة. للسؤال “ما كل رموز الفئات الفرعية تحت GOVERN؟”، يُصيغ التحليل تعبيراً منتظماً واحداً للنمط
GV.XX-NNيجتاح كامل المستند ويُعيد 31 رمزاً فريداً باستنفاد تام بالبناء — أي مضمون رياضياً أنه لن يُفوّت رمزاً واحداً طالما النمط صحيح. هذا الأسلوب لا يستدعي LLM إلا في نهاية المطاف لتنسيق النتائج. - الاسترجاع الدلالي مع حلقة التكرار (Semantic Retrieval with Loop): للأسئلة التي لا تستجيب لا للبنية ولا للنمط، يُشغّل النظام جولات متعددة من الاسترجاع الدلالي. في كل جولة يُوسّع استعلام البحث بناءً على العناصر المُكتشفة حتى الآن، وتتوقف الحلقة حين يتطابق عدد العناصر مع cardinality hint الصادرة من مرحلة فهم السؤال. في المثال الوارد، اكتشف
list_via_semanticفي جولة ثانية تقنية تنظيم ثالثة كانت الجولة الأولى قد فاتتها حين كانت الإشارة إلى cardinality تقول ثلاثة. بدون هذه الحلقة كانت الإجابة ستبدو مكتملة وهي ناقصة — وهذا بالضبط الفشل الذي يُكافح الإطار بأكمله لتجنّبه.

بعد اكتمال الاسترجاع بأي من الاستراتيجيات الثلاث، تُدمج النتائج وتُزال التكرارات عبر deduplicate_items، ثم تنطلق إشارة اكتمال القائمة assess_completeness التي تقارن العدد المُسترجع بالـ cardinality المتوقعة. حين تتطابق الأرقام يُمرَّر السياق للنموذج اللغوي لصياغة الإجابة النهائية. التصميم يعكس فلسفة واضحة: الخبير البشري يعرف أن القائمة محدودة ويعرف شكل اكتمالها، والنظام يُنفّذ إشارات الاكتمال وإعادة الاسترجاع، والخبير يُقرّ النتيجة.
المقارنة مع أسئلة الحقائق الواحدة تكشف لماذا لا يُصلح top-k المشكلة: في أسئلة الحقائق تبحث عن مقطع واحد والترتيب بالمشابهة يعمل. في أسئلة القوائم تبحث عن N مقطعاً حيث N مجهول، وزيادة k لتغطية كل العناصر تجلب معها مكرراتها وملخصاتها ومراجعها العابرة فيُغرق النموذج في عشرين إشارة إلى “GOVERN” ويتعذّر عليه التمييز بين التعريفات الفعلية والإشارات العارضة. (وفقاً للتحليل على Towards Data Science)، حتى النماذج ذات السياق الطويل تقع في الفخ ذاته: تُعيد أربعة أو خمسة عناصر، تُفوّت العنصر المُصاغ بأسلوب مختلف في مكان آخر من المستند، وتعرض القائمة المنقوصة بكل ثقة.
ما يستحق التوقف عنده هنا هو أن benchmark الإبرة في كومة القش (Needle-in-a-Haystack لـ Kamradt, 2023) لا يختبر هذا الشكل من الأسئلة أصلاً — إذ يقيس إبرة واحدة وحيدة وجملة حرفية واحدة، وتُسجّل النماذج الحدودية درجات قريبة من الكمال. ست إبر مبعثرة في المستند، لا واحدة منها بصياغة حرفية مطابقة، تظهر فجوة أداء مختلفة تماماً لا يغطيها أي benchmark شائع حتى الآن. هذا يجعل التوجيه نحو استراتيجيات استرجاع مُصمَّمة خصيصاً للقوائم خياراً هندسياً لا ترفاً.
إن كنت تبني أنظمة RAG على وثائق مؤسسية — عقود، سياسات، معايير، أوراق بحثية — فإن أسئلة القوائم ستظهر لا محالة، وصمت النظام عن العناصر المفقودة أخطر بكثير من اعترافه بعدم المعرفة. الاستراتيجية البنيوية والنمطية يُحسمان الاكتمال بالبناء، والدلالية مع حلقة التكرار تُغطي ما تبقى — والثلاثة معاً يُشكّلون pipeline قادراً على الإجابة حين يكون الجواب هو كل مقطع، لا أفضل مقطع.







