تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
اختيار المحررينتعلم و استخدام الذكاء الاصطناعي

OlmoEarth يُحوّل بيانات الأقمار الاصطناعية إلى متجهات قابلة للتحليل الفوري

بقلم: يوسف | محرر أدوات الذكاء الاصطناعي · صوت تحريري بإشراف بشري

معهد ألن للذكاء الاصطناعي يفتح أمام المطورين والباحثين طريقة جديدة للتعامل مع بيانات مراقبة الأرض: بدلاً من الاضطرار إلى تدريب نماذج من الصفر، يمكنهم الآن استخراج متجهات تضمين (embedding vectors) جاهزة من منصة OlmoEarth Studio وتشغيلها مباشرة في أي مهمة تحليلية، من البحث عن التشابه إلى رصد التغيرات الموسمية على سطح الأرض.

هذه المتجهات هي تمثيلات رقمية مضغوطة تنتجها نماذج OlmoEarth مفتوحة المصدر، وتعكس الخصائص السطحية لكل موقع جغرافي: المناطق المتشابهة تنتهي بمتجهات متقاربة، والمختلفة تتباعد في الفضاء الرياضي. المصدر الكامل وأوزان النماذج متاحة للعموم جنباً إلى جنب مع الورقة البحثية، ما يتيح للمجتمع التحقق من طريقة توليد هذه المتجهات بدقة.

خريطة عالمية تُلوّن كل بيكسل أرضي وفق مجموعته في تحليل k-means للمتجهات، كاشفةً بنية المناخات الحيوية وتغطية الأراضي
توزيع المتجهات على مستوى 1.1 مليون نقطة من بيانات Sentinel-2 الموسمية — الألوان تمثّل 15 مجموعة k-means بعد تقليص الأبعاد بـ PCA. لاحظ كيف تتجمع المناطق المناخية المتشابهة عالمياً في ألوان موحّدة

ما يميز هذا الإصدار عن الأنظمة التقليدية أن المتجهات تُحسب بناءً على الطلب لا تُسحب من أرشيف مسبق الحساب، ما يعني أن النتائج تعكس ظروف المنطقة الزمنية التي تحددها أنت بالضبط. يمكنك توليد متجهات شهرية لرصد الديناميكيات الموسمية، لا مجرد لقطات سنوية.

النتيجة تُصدَّر بصيغة Cloud-Optimized GeoTIFF (COG)، حيث يحتوي الملف على نطاق واحد لكل بُعد من أبعاد المتجه. القيم مخزّنة كأعداد صحيحة موقّعة بـ 8 بت (int8) في المدى -127 إلى +127، مع تخصيص -128 لبيانات nodata. لاسترداد متجهات النقطة العائمة، يمكن استخدام الدالة dequantize_embeddings في مكتبة olmoearth_pretrain.

المنصة تقدّم ثلاثة متغيرات للمشفّر يختار المستخدم بينها بحسب احتياجاته الحسابية: Nano بـ 128 بُعداً و1.4 مليون معامل، وTiny بـ 192 بُعداً و6.2 مليون معامل، وBase بـ 768 بُعداً و89 مليون معامل. أما الدقة المكانية فتتراوح بين 10 أمتار و20 و40 و80 متراً لكل بيكسل، وتشمل مصادر الصور Sentinel-2 L2A وSentinel-1 RTC أو كليهما معاً.

لاستخدام المنصة عملياً، إليك الخطوات الأساسية:

  1. ارسم أو ارفع المنطقة الجغرافية التي تهمّك عبر واجهة Studio أو API — المنصة تتولى اقتناء الصور وتقسيمها تلقائياً.
  2. حدّد النطاق الزمني بين شهر واحد واثني عشر شهراً للحصول على متجهات شهرية أو موسمية أو سنوية.
  3. اختر متغير المشفّر (Nano أو Tiny أو Base) والدقة المكانية المناسبة لمواردك الحسابية.
  4. حدّد مصدر الصور من Sentinel-2 L2A أو Sentinel-1 RTC أو كليهما للجمع بين البيانات البصرية والرادارية.
  5. نزّل ملف GeoTIFF الناتج وافتحه في أي أداة جيومكانية تدعمه: QGIS أو GDAL أو rasterio أو سكربتات Python المخصصة.
  6. طبّق عمليات التحليل — بحث التشابه أو التصنيف أو رصد التغيرات أو PCA — مباشرةً على المتجهات المُصدَّرة دون الحاجة إلى أي تدريب مسبق.
أربع طرق مختلفة لتصور نفس بيانات المتجه الجغرافي جنباً إلى جنب
الرسمة ذاتها بأربع خيارات تصور مختلفة — تُظهر مرونة ملفات COG في التعامل مع أبعاد المتجه المتعددة

الأمثلة التطبيقية التي نشرها المعهد تكشف عمق هذه المتجهات. في مثال البحث بالتشابه، اختاروا بيكسلاً واحداً قرب مركز Merced في كاليفورنيا وحسبوا تشابه جيب التمام مع كل بيكسل آخر — فأضاءت الأسطح الحضرية وممرات الطرق بتناسق واضح، بينما ظلّت قطع الأراضي الزراعية مظلمة. وحين نقلوا نقطة الاستعلام إلى حقل زراعي وعرّفوا متجه الاستعلام كمتوسط متجهات تلك النافذة، جاءت أعلى نتائج التشابه (0.89 وما فوق) كلها حقولاً زراعية مرويّة، بينما استقرّت الأقل تشابهاً (حول الصفر) على مطار مع أرض جرداء، وخزّان مائي بمحيطه الجاف، وأراضٍ رعوية قاحلة.

في مثال التصنيف قليل التسميات (few-shot segmentation) على منطقة كا-ماو الساحلية في فيتنام — المعروفة بغابات المانغروف — عمل الفريق بـ 60 بيكسلاً تسمية فقط: 20 لكل صنف من ثلاثة (مانغروف، ماء، أخرى) مستخدمين ESA WorldCover 2021 مرجعاً. انتج نموذج الانحدار اللوجستي المدرَّب على هذه البيانات الضئيلة خريطة تغطية كاملة للمنطقة بـ F1 موزون = 0.84. الأمر اللافت أن زيادة بيانات التدريب من 30 إلى 300 تسمية كاد لا يُحدث فارقاً في الدقة، مما يعني أن المتجهات نفسها تحمل معظم الثقل التمييزي.

شفرة Python الجوهرية لهذه العملية لا تتجاوز بضعة أسطر:

import rasterio
import numpy as np
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression

with rasterio.open("embeddings.tif") as ds:
    emb = ds.read().astype(np.float32)  # (192, H, W)
C, H, W = emb.shape
X = emb.reshape(C, -1).T  # (H*W, 192)

clf = make_pipeline(StandardScaler(), LogisticRegression(max_iter=2000))
clf.fit(X[train_idx], labels[train_idx])
prediction = clf.predict(X).reshape(H, W)

أما رصد التغيير فيعتمد على مقارنة متجهات شهرين مختلفين لنفس المنطقة وقياس مسافة جيب التمام بين كل بيكسل. طبّق الفريق هذا النهج على منطقة في مقاطعة Butte بكاليفورنيا بين سبتمبر 2023 وسبتمبر 2024، فأضاء أثر حريق Park Fire (يوليو-سبتمبر 2024) فوراً دون أي تسميات أو تدريب — مجرد ملفَّي COG وبضعة أسطر كود. أما الاستكشاف غير الخاضع للإشراف فيعتمد PCA لتقليص المتجهات إلى ثلاثة أبعاد تُرسم كألوان RGB في صورة كاذبة الألوان؛ وحين طُبّق على Flevoland في هولندا — المنطقة الزراعية المستصلحة ذات الشبكة المنتظمة — أعادت الصورة رسم حدود القطع بدقة عالية مع تمييز أصناف المحاصيل والمسطحات المائية والمناطق الحضرية بألوان مستقلة.

تجدر الإشارة إلى حدود هذه الأداة: الأداء يتأثر بجودة صور المدخلات — الغطاء السحابي المستمر أو التشوهات الجوية أو فقدان المشاهدات خلال الفترة المركّبة يمكن أن تؤثر على دقة المتجهات الناتجة. كذلك، إن كان تطبيقك يتطلب أداءً أعلى مما تتيحه المتجهات المجمّدة، تدعم المنصة الضبط الدقيق الخاضع للإشراف (SFT) لتدريب رأس نموذجي مخصص على تسمياتك، وهو عادةً يتفوق على مسبار خطي مطبّق على ميزات مجمّدة.

الوصول إلى ميزة تصدير المتجهات المخصصة متاح الآن لمستخدمي OlmoEarth Studio. تعليمات استخدام النماذج المفتوحة المصدر لحساب متجهاتك محلياً متوفرة في الوثائق الرسمية، وثمة notebook على Colab للبدء الفوري دون إعداد محلي.

Allen Institute for AI (Ai2) via Hugging Face Blog

مقالات ذات صلة

زر الذهاب إلى الأعلى