تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعي

The Stack v3: أضخم قاعدة بيانات مفتوحة لتدريب نماذج البرمجة

بقلم: ليلى | محررة أدوات المطورين · صوت تحريري بإشراف بشري

أطلق فريق Hugging Face النسخة الثالثة من مجموعة بيانات The Stack v3، في ما يُعدّ أضخم تحديث لمصادر تدريب نماذج البرمجة منذ سنوات. المجموعة الجديدة هي لقطة شاملة من الكود المفتوح على GitHub، مُصمَّمة خصيصاً لتدريب النماذج اللغوية الكبيرة — وتُمثّل، وفق الفريق، أكبر مجموعة بيانات مفتوحة لكود المصدر موجودة حتى الآن.

الإصدار الجديد من The Stack v3 من <a href=Hugging Face — أضخم مجموعة بيانات مفتوحة لكود المصدر”>
The Stack v3 — أكبر مجموعة بيانات مفتوحة لتدريب نماذج البرمجة

قاد المشروع أنطون لوجكوف وزملاؤه في Hugging Face، وجاء بعد سنوات من الجمود في النسخ السابقة. الجديد هذه المرة لا يقتصر على حجم أكبر من البيانات، بل يُقدّم تحولاً جوهرياً في طريقة تنظيم المحتوى، مع نمو ملحوظ في حجم الـ tokens لغتَي C++ وHTML ضمن لغات برمجية أخرى. والأهم أن النسخة الجديدة توفّر، لأول مرة في هذه السلسلة، كلاً من المستودعات الكاملة والملفات الفردية معاً — ما يمنح الباحثين وفرق التدريب مرونة أكبر في كيفية استهلاك البيانات.

النسخ السابقة من The Stack كانت تُشكّل مرجعاً رئيسياً لتدريب نماذج مثل StarCoder وغيرها من نماذج الكود المفتوحة، غير أنها ظلت فترة طويلة دون تحديث يُذكر — وهو إشكال حقيقي في مجال يتطور بوتيرة لا تتوقف. (وفقاً لـ The Batch / DeepLearning.AI). الآن مع v3، يُصبح لدى فرق تدريب النماذج المفتوحة مصدر بيانات محدَّث وشامل يمكن الاعتماد عليه بدلاً من اللجوء إلى زحف مستقل مكلف التنفيذ.

ما يجعل هذا الإصدار ذا قيمة عملية مباشرة لمن يبني نماذج برمجية هو الجمع بين السياق الكامل للمستودع — بمعنى أن النموذج يرى الكود ضمن بيئته الحقيقية مع ملفات الإعداد والتوثيق والاختبارات — وبين الملفات الفردية التي تُفيد في حالات التدريب الأكثر دقة. هذان المسلكان معاً يُعطيان المدرِّبين خيارات تلائم أغراضاً مختلفة بدلاً من الاضطرار إلى اختيار أحدهما.

السؤال المطروح الآن: هل حجم البيانات وحده يكفي، أم أن جودة التصفية والترشيح ستكون العامل الفاصل في أداء النماذج المبنية على هذه البيانات؟ التجربة مع نسخ سابقة أظهرت أن الكود المكرر أو المنخفض الجودة يُضر بأداء النموذج أكثر مما يُفيد الحجم الكبير. ما إذا كان الفريق قد تعامل مع هذه المعضلة بشكل أعمق في v3 — هذا ما ستكشفه النماذج المدرَّبة عليه في الأشهر القادمة.

The Batch / DeepLearning.AI

مقالات ذات صلة

زر الذهاب إلى الأعلى