
بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري
الكود الحقيقي لا يعيش في ملف واحد — بل يتشابك عبر مكتبات ومستودعات وتبعيات متداخلة، وهذا بالضبط ما كانت نماذج اللغة تفشل في استيعابه. ورقة بحثية نُشرت في arXiv في 5 أغسطس 2026 تقدّم OctoLong، وهو pipeline لهندسة السياق يعيد صياغة كيفية تغذية النماذج بكود متشعب الاعتماديات — بدلاً من الاكتفاء بمستودع واحد مفرد.
المشكلة التي يعالجها الفريق — Indraneil Paul وFalko Helm وGoran Glavaš وIryna Gurevych — بسيطة في جوهرها لكنها عميقة في أثرها: الكوربورا التقليدية المستخدمة لتمديد السياق (كتب، مقالات أكاديمية، مستودعات كود منفصلة) تفتقر إلى الاعتماديات بعيدة المدى. نموذج يقرأ ملف Python لا يعرف أن الدالة التي يستدعيها مُعرَّفة في مكتبة خارجية أخرى، بشكل مختلف تماماً عمّا يتوقعه. OctoLong يحل هذا بتوصيل ثلاثة مكوّنات معاً: محلل AST يفهم بنية الكود، وخادم لغة backend يتتبع المراجع، ومدير حزم يسترجع التبعيات بشكل تعاودي — مما ينتج سياقات كود غنية بالاعتماديات يمكن أن تبلغ ملايين التوكنات.
ما ينتج عن هذه البنية هو مزيج تدريب مكوّن من ~50 مليار توكن، منها ~6.2 مليار توكن من سياقات كود OctoLong، يليها ~10 مليار توكن من ضبط دقيق للتعليمات. الفريق استخدم هذا المزيج لتدريب OctoLong-Instruct، وهو مجموعة من النماذج المفتوحة تتراوح في حجمها بين 600 مليون و14 مليار معامل، عبر تدريب متوسط لتمديد السياق.
الرقم الأكثر إثارة للاهتمام في نتائج التقييم: استبدال 12% فقط من كوربورا تمديد السياق التقليدية ببيانات OctoLong يُحقق مكاسب جوهرية عبر عدة محاور — الاسترجاع بعيد المدى، تتبع الحالة طويلة الأمد، فهم الكود على مستوى المستودع، والمهام الوكيلية downstream. والأهم من ذلك: تحسّن أداء استخدام API حتى في سيناريوهات الكود ذات السياق القصير، مما يعني أن الفائدة لا تقتصر على النوافذ الضخمة فحسب.
التقييم شمل المقارنة مع 18 نموذجاً مفتوح الأوزان طويل السياق في أحدث حالاته، وهو مرجع مقارنة غير عادي في اتساعه. ما يكشفه هذا: السوق الحالي لنماذج السياق الطويل يبني على نفس المواد الخام المتكررة (كتب ومقالات وكود مفرد)، ويفوّت تماماً بُعد الاعتماديات المتشابكة الذي يمثّل جوهر الكود في الإنتاج الحقيقي.
من الزاوية التطبيقية، هذا النهج مثير لأي فريق يبني نماذج مخصصة للبرمجة. الحاجة إلى بيانات تدريب باهظة الثمن أو نادرة لم تعد المشكلة الأساسية — OctoLong يُظهر أن هندسة كيفية تجميع الكود الموجود مسبقاً واسترجاعه قد تكون أكثر قيمة من زيادة الحجم الخام للبيانات. الـ pipeline نفسه — AST parser + language server + package manager — هو الفكرة القابلة للتطبيق، وليس فقط أوزان النماذج الناتجة.
ما لا تقوله الورقة بوضوح هو التكلفة الحسابية لبناء هذه السياقات بشكل تعاودي على نطاق واسع، ولا مدى قابلية الـ pipeline للتوسع لغات البرمجة الأقل شيوعاً خارج النظام البيئي الذي اختبروه. لكن إثبات أن 12% من البيانات المُهندَسة بذكاء يمكنها تحريك الإبرة بهذا الشكل هو نتيجة تستحق المتابعة من أي مختبر أو شركة تعمل على نماذج كود متخصصة.







