تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
الإحصائيات والتقارير

ALTK-Evolve يتفوق على ACE بسبع مرات أقل في تكلفة الاستدلال

بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري

نظام وكالة يحقق دقة أعلى بتكلفة أقل بسبع مرات — هذا ليس وعداً تسويقياً بل نتيجة قابلة للقياس. في تقرير نشره فريق IBM Research عبر Hugging Face، أجرت المجموعة مقارنة مضبوطة بين ACE (Agentic Context Engineering) وALTK-Evolve على نفس بيئة الاختبار، وبنفس النماذج الأساسية، والفارق لم يكن هامشياً.

كلا النظامين يعملان على المبدأ ذاته: بدلاً من ضبط أوزان النموذج أو الاستعانة بتسميات بشرية، يستخلصان الدروس من مسارات الوكيل السابقة ويُعيدان حقنها في الاستدلال. وكلاهما يرفض ضغط هذه الدروس في ملخص مختصر — ACE يُنبّه صراحةً إلى ظاهرتين خطرتين: “brevity bias” (الانزياح نحو تعليمات قصيرة وعامة) و”context collapse” (فقدان التفاصيل عند إعادة كتابة السياق في كل خطوة). والحل الذي توصل إليه الفريقان مستقلَّين هو نفسه: احتفظ بالتفاصيل، وعدّها ولا تطوِها.

لكن نقطة الافتراق الحقيقية ليست في بناء الذاكرة، بل في كيفية تسليمها للنموذج وقت الاستدلال. ACE يحقن الـ playbook الكامل في كل خطوة بصرف النظر عن النموذج المستخدم أو طبيعة المهمة. ALTK-Evolve يعامل التسليم كمتغير قابل للضبط: جزء ثابت صغير من المبادئ عالية الدعم، مضافاً إليه عدد محدود مختار حسب المهمة الراهنة (عبر cosine similarity أو توجيه LLM)، أو المجموعة الكاملة عندما يكون النموذج قادراً على استيعابها.

مقارنة معدل إتمام المهام بين ALTK-Evolve وACE حسب مستوى الصعوبة
معدل إتمام المهام بعد تفعيل الذاكرة — ALTK-Evolve مقابل ACE — مقسّماً حسب درجة الصعوبة (سهل / متوسط / صعب)

النتائج على AppWorld benchmark (168 مهمة، نمط ReAct code agent) كانت كاشفة (وفقاً لـ IBM Research):

  1. مع نموذج DeepSeek-V3.2: حقق ALTK-Evolve معدل TGC بلغ 89.3% مقابل 80.4% لـ ACE، ومعدل SGC بلغ 80.4% مقابل 73.2% — بتكلفة 263 ألف توكن للمهمة الواحدة مقابل 634 ألفاً لـ ACE، أي بأقل من 42% من تكلفة المنافس.
  2. مع نموذج gpt-oss-120b: حافظ ALTK-Evolve على أفضلية طفيفة في الدقة (TGC: 56.0% مقابل 54.8%) — وهي فارق في حدود ضجيج التشغيل المتكرر — لكن الفارق في التكلفة كان صارخاً: 116 ألف توكن مقابل 777 ألفاً، أي سُبع التكلفة تقريباً.
  3. على المهام الصعبة تحديداً مع النموذج الأضعف (gpt-oss-120b): بلغ TGC في ALTK-Evolve 31.8% مقابل 23.8% لـ ACE، والفارق هنا مردّه الاسترجاع المُخصَّص — النموذج يحتاج إلى الدرس الصحيح لا إلى كل الدروس دفعةً واحدة.
  4. على المهام السهلة والمتوسطة مع النموذج الأضعف: ACE يتفوق (Easy: 84.2% مقابل 82.5%؛ Medium: 60.4% مقابل 56.2%) — وهو ما يُفسّره الفريق بأن هذه المهام يمكن حلها بتعليمات عامة، فيفيد الـ playbook الشامل أكثر مما يُربك.
  5. مع النموذج الأقوى DeepSeek-V3.2: ALTK-Evolve يتقدم في Easy وHard والإجمالي، بينما يتفوق ACE على Medium فحسب — ما يعني أن النموذج القوي يستفيد من مزيد من المبادئ المُسلَّمة بطريقة مُعايَرة، لا من ضخ الكل دفعةً.
جداول مقارنة تفصيلية بين ALTK-Evolve وACE على AppWorld
الجداول التفصيلية لأداء النظامين على AppWorld — يلاحظ القارئ كيف يتباين الأثر بين النموذجين القوي والأضعف

الفارق التقني بين النظامين يمتد إلى طريقة بناء الذاكرة أيضاً. ACE ينمو playbook واحداً شاملاً عبر حلقة Generator → Reflector → Curator مع de-duplication بالتضمين (embedding). ALTK-Evolve يجمّع المبادئ المتشابهة في clusters ويدمجها مع الحفاظ على عداد “الدعم” (support count) — فعندما تندمج ثلاثة مبادئ، يرث الناتجُ مجموعَ تكراراتها، فلا تضيع الذاكرة التجريبية. كما يستخرج مبادئ من ثلاثة أنواع: strategy وrecovery وoptimization، مع إسناد سببي وترابط بمسار التنفيذ الأصلي وعلى مستوى المهمة الفرعية — ما يُتيح نقل الدرس من تطبيق إلى آخر.

ما يكشفه هذا التحليل بالأرقام هو أن “مزيداً من السياق” ليس دائماً أفضل. النموذج الأضعف يتأثر سلباً بحقن Playbook كامل من 106 مبادئ (ACE) — بينما يعمل بكفاءة أكبر مع ~29 مبدأً مختاراً (ALTK-Evolve). النموذج الأقوى يستوعب 191 مبدأً كاملة ويُحوّلها إلى أداء أعلى. أي أن حجم السياق الأمثل تابعٌ لقدرة النموذج لا ثابتٌ تصميمياً، وهذا ما بناه ALTK-Evolve كميزة معمارية أصيلة لا تعديلاً طارئاً.

يُقرّ الفريق صراحةً بأن قصة الكفاءة في ACE تدور حول بناء السياق بتكلفة منخفضة، بينما قصة ALTK-Evolve تدور حول تقديم هذا السياق بكفاءة. محوران مختلفان، لكن في التطبيقات العملية حيث يُحسب فاتورة الاستدلال — خاصة مع نماذج أكبر وأطول مسارات — يصبح محور التسليم هو الذي يُترجَم مباشرةً إلى كلفة تشغيلية. يمكنك الاطلاع على التقرير التقني الكامل للتفاصيل والاختبارات البديلة (ablations).

IBM Research / Hugging Face Blog

مقالات ذات صلة

زر الذهاب إلى الأعلى