
نسبة النص الآلي في بيانات الويب قفزت من 27.5% إلى 31.1% خلال شهرين، وقيمة رمزيته في التدريب قد تنقلب من فائدة إلى ضرر.
ضمن ملف: نماذج الذكاء الاصطناعي
بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري
المصدر الأساسي: ArXiv
لماذا يهم
فرق تدريب النماذج اللغوية التي تعتمد على بيانات الويب قد تحتاج إلى فلترة النص الآلي وفصل قياسات الخسارة، وإلى تكرار النص البشري بدل التوسع العشوائي في البيانات.
صنّف كاشف Pangram نحو 31.1% من رموز (tokens) بيانات الويب لشهر أغسطس 2026 على أنها مولّدة بالذكاء الاصطناعي (وفقاً لـ arXiv). وكانت النسبة 27.5% في يونيو من العام نفسه (وفقاً لـ arXiv)، وقيست النسبتان بعد تطبيق فلترة الجودة FineWeb، بحسب ورقة بحثية بعنوان How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text. الورقة لا تكتفي برصد النسبة، فهي تطرح سؤالاً يهم كل من يدرّب نموذجاً لغوياً: كم تساوي رمزية واحدة كتبتها آلة، حين تدخل بيانات التدريب دون أن يعرف أحد مصدرها؟
يميّز الباحثون بين هذا النص الذي يسمّونه “البري” (wild) وبين البيانات الاصطناعية المقصودة أو تجارب “انهيار النموذج” (model collapse). بحسب الورقة، يأتي النص البري من نماذج كثيرة لا من نموذج واحد، ويُكتب لقرّاء بشر، ويصل إلى مجموعات بيانات ما قبل التدريب بلا أي وسم. ولقياس أثره درّب الفريق 800 نموذج لغوي (وفقاً لـ arXiv)، مع تغيير نسبة رموز الذكاء الاصطناعي المضافة إلى الرموز البشرية، ثم طابقوا قوانين التحجيم (scaling laws) مع قيم الخسارة على بيانات اختبار محجوبة، بعضها نص بشري وبعضها نص مولّد آلياً.
قبل قراءة النتائج يلزم تحفظان. الأول أن الورقة نسخة أولية (preprint) قُدّمت في 30 سبتمبر 2026 ولم تخضع لمراجعة الأقران، والقصة هنا تستند إلى مصدر وحيد هو الورقة نفسها. والثاني أن نسب المحتوى الآلي تعتمد بالكامل على تصنيف أداة كشف واحدة هي Pangram، ولم يتسنَّ التحقق منها بشكل مستقل. أعدّ الورقة سبعة باحثين هم Jenna Russell وBen Glickenhaus وKatherine Thai وJohn Wieting وMohit Iyyer وMax Spero وBradley Emi.
هذه أبرز النتائج بحسب الورقة البحثية:
- النماذج الفقيرة بالبيانات تستفيد في البداية ثم تتضرر: إضافة رموز الذكاء الاصطناعي إلى نموذج يفتقر إلى البيانات تخفض الخسارة على النص البشري في المرحلة الأولى. لكن الفائدة تبلغ حد التشبع مع زيادة الكمية، ثم تنقلب سريعاً إلى ضرر.
- النماذج الغنية بالنص البشري تتضرر فوراً تقريباً: حين يُدرَّب النموذج على ميزانية كبيرة من النص البشري، ترفع رموز الذكاء الاصطناعي الخسارة على الفور تقريباً. أما العدد نفسه من الرموز البشرية الجديدة فيواصل خفضها.
- قوانين التحجيم الحالية لا تتنبأ بهذا السلوك: تفشل قوانين مثل قانون Hoffmann وزملائه (2022)، المعروف بقانون Chinchilla، في تفسير هذا الانقلاب من الفائدة إلى الضرر.
- قانون تحجيم جديد بحدّين منفصلين: يقترح الباحثون قانوناً يتضمن حداً للفائدة وآخر للضرر، فتستطيع قيمة رمزية الذكاء الاصطناعي أن تتحول من موجبة إلى سالبة، ويعود القانون إلى صيغة Chinchilla عند غياب النص الآلي. وعند مطابقته على نماذج صغيرة تنبأ بأثر النص الآلي على خسارة النص البشري لنماذج أكبر حتى 3.6 مرة، بخطأ أقل بنسبة 41% من أفضل قانون قائم عبر كل نسب النص الآلي (وفقاً لـ arXiv). هذه أرقام يعلنها الباحثون عن نموذجهم، ولم تُختبر بعد خارج الورقة.
- النص الآلي يبقى مفيداً إذا كان الهدف نصاً آلياً: تؤكد الورقة أن قيمة هذه البيانات لا تسقط كلياً، فهي تظل نافعة حين يكون المطلوب من النموذج أداءً جيداً على نص مولّد بالذكاء الاصطناعي.
من هذه النتائج يخرج الباحثون بثلاث توصيات عملية. الأولى فلترة النص الآلي إذا كان الهدف هو النص البشري. والثانية تكرار النص البشري المتوفر قبل توسيع بيانات التدريب بنصوص ويب مولّدة آلياً. والثالثة الإبلاغ عن خسارة التحقق (validation loss) على النص البشري والنص الآلي كلٌّ على حدة، بدلاً من رقم واحد يخلط بينهما. وأتاح الفريق مجموعة بيانات باسم WildAI تضم 83 مليار رمز (وفقاً لـ arXiv) موسومة بحسب كونها آلية أو بشرية، وبحسب الموضوع والشكل، ونشر معها النماذج الـ800 كاملة والشيفرة البرمجية.
التوصية الثانية في تقديرنا هي الأثقل وزناً. فهي تعني عملياً أن إعادة استخدام نص بشري سبق للنموذج أن رآه قد تكون أنفع من إضافة نص جديد كتبته آلة، وهذا يقلب افتراضاً شائعاً بأن “المزيد من البيانات أفضل دائماً”. وإذا كنت تبني نموذجاً للغة شحيحة المحتوى على الويب، فأنت أقرب إلى حالة “النموذج الفقير بالبيانات” التي وصفتها الورقة، حيث يبدو النص الآلي مغرياً في البداية قبل أن يبدأ ضرره. ويبقى السؤال المفتوح الذي لا تجيب عنه الورقة: إذا كانت النسبة قد قفزت من 27.5% إلى 31.1% خلال شهرين فقط، فكم سيبقى من النص البشري النظيف حين تُجمع بيانات الجيل القادم من النماذج؟







