
بقلم: ليلى | محررة أدوات المطورين · صوت تحريري بإشراف بشري
أطلقت مايكروسوفت نموذجَي Mage-Flow للتوليد والتحرير بحجم 4 مليار معامل، مع نسخ Turbo رباعية الخطوات قادرة على توليد صورة بدقة 1024×1024 بكسل في 0.59 ثانية على معالج A100 واحد — وهو رقم يُعيد طرح السؤال الأساسي في هندسة نماذج الصور: هل المسار الصحيح هو ضخ المزيد من المعاملات، أم إعادة تصميم المكدّس من الأساس؟
Hugging Face“>الإجابة التي يقدّمها Mage-Flow واضحة: الكفاءة ليست ميزة واحدة تُضاف فوق النموذج، بل هي نتيجة ثلاث طبقات متكاملة تعمل معاً. (وفقاً لـ Hugging Face microsoft/Mage-Flow)
- VAE محسّن للضغط — تعتمد البنية على مشفّر تلقائي متغيّر (VAE) أكثر كفاءةً في تمثيل الصور داخل الفضاء الكامن، ما يُقلّص الحمل الحسابي قبل أن تبدأ عملية الانتشار أصلاً. التحسين هنا ليس في جودة المخرجات النهائية فحسب، بل في تقليص عدد التوكنز التي يعالجها النموذج في كل خطوة.
- تعبئة بالدقة الأصلية (Native-resolution packing) — بدلاً من تغيير حجم كل الصور إلى أبعاد ثابتة قبل التدريب، يحتفظ Mage-Flow بالنسب الأصلية ويُعبّئ الصور في دفعات متغيّرة الأبعاد. هذا يعني أن النموذج لا يُهدر قدرة حسابية على منطقة الحشو (padding)، وأنه يتعلّم تمثيلات أكثر طبيعيةً لأبعاد الصور المختلفة.
- نوى مندمجة (Fused kernels) — على مستوى العمليات الحسابية المنخفضة، يستخدم النموذج نوى مندمجة تُقلّص حركة البيانات بين الذاكرة والمعالج، وهي واحدة من أكثر تقنيات التسريع فاعليةً في الاستدلال على وحدات GPU الحديثة.
- نموذج التوليد بأربع خطوات (Turbo) — نسخة Turbo المخصصة للسرعة تُقلّص خطوات التخلص من الضوضاء إلى أربع فقط بدلاً من العشرين أو الخمسين المعتادة في نماذج الانتشار التقليدية، مع الحفاظ على دقة 1024 بكسل. النتيجة: 0.59 ثانية لكل صورة على A100 واحد.
- نموذج تحرير مستقل — إلى جانب نموذج التوليد، تُطلق مايكروسوفت نموذجاً منفصلاً للتحرير بالحجم ذاته (4 مليار معامل)، يتيح تعديل الصور الموجودة بدلاً من توليدها من الصفر، مما يُوسّع نطاق التطبيقات العملية في سير عمل الإنتاج الإبداعي.

ما يجعل هذا الإطار جديراً بالاهتمام ليس رقم 0.59 ثانية تحديداً — بل ما يعنيه على مستوى قرارات التصميم. السباق في نماذج الصور كان لسنوات مدفوعاً بمنطق بسيط: زد المعاملات، زد بيانات التدريب، احصل على جودة أعلى. Mage-Flow يضع رهاناً مختلفاً: يمكنك الوصول إلى أداء تنافسي بـ4 مليار معامل إذا أحكمت تصميم كل طبقة في المكدّس — من الـVAE إلى النوى الحسابية.
بالنسبة للمطوّرين الذين يبنون تطبيقات توليد الصور، هذا يُترجَم عملياً إلى تكاليف استدلال أقل وإمكانية نشر النموذج على بنية تحتية أخف. القيد الواضح أن الأرقام المُعلنة مُقاسة على A100 — وهو معالج متاح في بيئات السحابة الاحترافية لكنه ليس في متناول الجميع. كيف يتصرف النموذج على معالجات أقل قدرةً، أو في سيناريوهات الاستدلال المجمّع؟ هذا ما ستُجيب عنه التجارب الميدانية بعد إتاحة النموذج.
النماذج متاحة الآن على Hugging Face مع ورقة بحثية مرافقة على arXiv توثّق البنية التقنية الكاملة.
Hugging Face / High Learning Rate Newsletter







