
ثلث ما نُشر على الويب بعد نوفمبر 2022 يحمل بصمة آلية، مقابل 10% في العيّنة الكاملة، و1% فقط على نطاقات .gov و.edu.
ضمن ملف: OpenAI، نماذج الذكاء الاصطناعي
بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري
المصدر الأساسي: TechCrunch
لماذا يهم
من يبني نماذج أو خطوط بيانات على زحف ويب جديد صار يتغذى جزئياً على مخرجات نماذج أخرى، ومن يعتمد استراتيجية محتوى قائمة على الحجم فقد ميزته التنافسية.
ثلث ما نُشر على الويب الإنجليزي بعد إطلاق ChatGPT، وتحديداً 35%، يحمل علامات على أنه كُتب أو «حُرِّر جوهرياً» بالذكاء الاصطناعي، بحسب دراسة صادرة عن Pew Research يوم الخميس. الرقم ليس تقديراً، بل نتيجة قياس على عيّنة محددة، ويستحق أن تُقرأ طريقة الوصول إليه قبل أن تُقرأ نتيجته.
جمعت Pew نحو نصف مليون صفحة إنجليزية من أرشيف Common Crawl تغطي خمس سنوات تقريباً، بدءاً من سنتين قبل إطلاق ChatGPT في نوفمبر 2022، ثم مرّرتها على تقنية Open Pangram لكشف النص المولّد آلياً. في عيّنة عشوائية من 10 آلاف صفحة جُمعت في يوليو 2026، ظهرت «علامات واضحة» على التأليف الآلي في نحو 10% فقط (وفقاً لـ TechCrunch). لكن أي عيّنة عشوائية تسحب معها صفحات نُشرت قبل وجود أدوات الكتابة التوليدية أصلاً، وصفحة من 2021 لا يمكن أن تكون مكتوبة بأداة لم تُطلق بعد. حين استبعدت Pew ما نُشر قبل ChatGPT، قفزت النسبة من 10% إلى 35%. الفارق بين الرقمين هو الدراسة كلها.

التوزيع حسب نطاقات الإنترنت أوضح من الرقم الإجمالي: نطاقات .com سجّلت معدل تأليف آلي يقارب عشرة أضعاف معدل نطاقات .edu و.gov، وكلاهما توقّف عند 1% تقريباً، فيما جاءت .org عند 4.6% (وفقاً لـ TechCrunch). الجزء التجاري من الويب هو الذي يُغرَق بالمحتوى المولّد، لا الجامعي ولا الحكومي. ورصدت Pew إلى جانب ذلك ارتفاعاً في المؤشرات الأسلوبية التي تُعتبر عادة دلائل على الكتابة الآلية: الإفراط في الشرطة الطويلة، وفاصلة أوكسفورد، وصيغة «ليس X، بل Y». هذه ليست أدلة بذاتها، لكنها تراكمت بوضوح عبر السنوات.

وتقرّ الدراسة صراحةً بحدودها: أدوات الكشف، ومنها Pangram، قد تصنّف نصاً بشرياً على أنه آلي، لذا فالنتيجة صحيحة اتجاهياً على الأقل لا رقمياً بدقة. تكتسب هذه الأرقام معناها الكامل حين توضع بجانب ما أعلنته Cloudflare قبل فترة قصيرة من أن حركة البوتات تجاوزت حركة البشر على الويب، وقبل الموعد الذي قدّرته الشركة نفسها، وهو رقم معلن من الشركة ذاتها ولم يتسنَّ التحقق منه بشكل مستقل (وفقاً لـ TechCrunch). Cloudflare قاست من يتصفّح، وPew قاست ما يُتصفَّح. اجمع القياسين وستحصل على صورة واحدة: بوتات تقرأ صفحات كتبتها بوتات أخرى.
لهذا انعكاسان عمليان مباشران عليك إن كنت تعمل في هذا المجال. الأول أن أي خط بيانات يعتمد على زحف ويب جديد صار يتغذى جزئياً على مخرجات نماذج سابقة، وهي المشكلة التي يناقشها الباحثون تحت اسم model collapse، وهذا استنتاج تحريري لا نتيجة قاستها Pew. الثاني أن فارق العشرة أضعاف بين .com و.gov حوّل نطاق المصدر إلى إشارة تصفية حقيقية، سواء كنت تبني فهرساً لـ RAG أو تتحقق من معلومة يدوياً.
يبقى الخلط الأكثر شيوعاً في تفسير هذه الدراسة هو المساواة بين «مكتوب بالذكاء الاصطناعي» و«رديء». Pew لم تقس الجودة إطلاقاً، بل قاست بصمة أسلوبية بأداة اعترفت هي نفسها بقابليتها للخطأ؛ فالمقال المحرَّر بعناية بمساعدة نموذج قد يُصنَّف آلياً، والمحتوى الرديء الذي كتبه بشر لن يُصنَّف كذلك. الاستنتاج الأدق ليس أن الويب امتلأ بالقمامة، بل أن التكلفة الحدّية لإنتاج صفحة نصية هبطت إلى ما يقارب الصفر، وأن أي استراتيجية محتوى مبنية على الحجم فقدت قيمتها بالكامل خلال أقل من أربع سنوات. فما الذي يميّز صفحتك اليوم غير كونها موجودة؟
المصادر
- A third of web pages published since ChatGPT’s launch show signs of AI authorship, study finds techcrunch.com
- How Much of the Internet Is Written With AI? pewresearch.org
- Introducing Open Pangram pangram.com







