تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
أخبار الذكاء الاصطناعي

MiniMax Music 3 يُنتج أغاني كاملة حتى خمس دقائق بالذكاء الاصطناعي

بقلم: ليلى | محررة أدوات المطورين · صوت تحريري بإشراف بشري

أطلقت MiniMax نموذجها الجديد MiniMax Music 3 على منصة Hugging Face، وهو نموذج توليد موسيقى مصمم لإنتاج أغانٍ كاملة تصل مدتها إلى خمس دقائق، بصوت بشري معبّر وتوزيع موسيقي متطور يحافظ على تماسكه طوال المقطع. النموذج مفتوح المصدر، ويقبل مدخلَين متكاملَين: كلمات الأغنية مع علامات هيكلية كـ [Verse] و[Chorus]، وتوصيفاً موسيقياً تفصيلياً يشمل الأسلوب والإيقاع والأدوات والأداء الصوتي.

ما يميّز هذا النموذج معمارياً هو الفصل الصريح بين النمذجة الموسيقية بعيدة المدى والتفاصيل الصوتية الدقيقة. يعتمد النموذج على LLM عالمي بحجم 8 مليارات معامل مُهيَّأ من Qwen3-8B للتنبؤ بالإطار الأول من شبكة RVQ وبناء البنية الموسيقية الكلية للأغنية، بينما يتولى LLM محلي بحجم 600 مليون معامل استعادة التفاصيل الصوتية الدقيقة داخل كل إطار. النتيجة: أغنية تحافظ على هويتها الصوتية وتطور توزيعها من المقدمة إلى الخاتمة دون أن تتفكك صوتياً مع الوقت، وهو الإشكال الشائع في نماذج التوليد الصوتي الطويل.

مسار التوليد لا يعتمد فقط على الرموز المتقطعة. النموذج يدمج الحالات المخفية النهائية للـ LLM العالمي والمحلي معاً، ثم يمررها عبر وحدة Flow Matching بحجم 2.4 مليار معامل، ومن ثم عبر Flow-VAE Decoder بحجم 123 مليون معامل، لينتج صوتاً بجودة 32 kHz ستيريو بعمق 16-bit. هذا الدمج للحالات المخفية المستمرة يحفظ معلومات صوتية أثرى مما تُتيحه الرموز المتقطعة وحدها، خصوصاً في نطاق التعبير الصوتي والقوام الزمني للأدوات الموسيقية.

للتحكم الدقيق في مخرجات النموذج، تنصح MiniMax باستخدام ما تسميه Structured Caption مقسمة إلى ثلاثة أقسام: البيانات الوصفية العامة كالنوع الموسيقي والـ BPM والسلّم والمسار العاطفي وبيئة الاستماع وأسلوب الإنتاج، ثم تفاصيل الصوت من جنس المؤدي وجرس الصوت وأسلوب الأداء والتناغمات والمؤثرات الصوتية، وأخيراً التوزيع الموسيقي بتفصيل الأدوات الأساسية والثانوية وتطورها عبر مقاطع الأغنية والإيقاع والباص والإيحاءات المكانية. يمكن تطوير هذه التوصيفات تلقائياً عبر أداة music-caption-rewriter المتاحة من خلال npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter.

المُرمِّز الموسيقي يعتمد على ثماني طبقات من RVQ: الطبقة الأولى دلالية تحتوي على 16,384 إدخالاً وتلتقط البنية الموسيقية الجوهرية، بينما تضم الطبقات السبع الأكوستيكية الباقية 1,024 إدخالاً لكل منها لتمثيل التفاصيل المتبقية. التدريب يبدأ بتحسين الطبقة الدلالية أولاً، ثم يُدرَّب النموذج الكامل على جميع الطبقات معاً. لكن الجدير بالذكر أن وقت الاستنتاج لا يستخدم المُرمِّز المتقطع أصلاً، بل يعتمد كلياً على الحالات المخفية المدمجة.

من الناحية العملية، يدعم النموذج ثلاث بيئات تشغيل رئيسية هي SGLang-Omni وDiffusers وComfyUI. بالنسبة لمتطلبات VRAM، يعمل النموذج بكفاءة على بطاقات بـ 24 جيجابايت أو أكثر، غير أنه يمكن تشغيله على بطاقات بـ 8 جيجابايت فقط عبر آلية apply_group_offloading مع نقل طبقات الـ LLM تلقائياً إلى المعالج المركزي. هذا التوافق مع بطاقات الذاكرة المحدودة يفتح الباب أمام طيف أوسع من المطورين. الاستنتاج يتطلب CUDA ولا يدعم التوليد المتدفق حالياً، فضلاً عن حد أقصى للنص بـ 5,000 رمز وللصوت بـ 9,000 إطار صوتي.

التجربة بسيطة عبر API يشترك في شكله مع واجهة التحويل النصي إلى كلام. يمكنك تشغيل الخادم بأمر sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000، ثم إرسال طلب يضع كلمات الأغنية في حقل input والتوصيف الموسيقي في instructions، محدداً max_new_tokens الذي يتحكم في عدد الإطارات الصوتية بمعدل 25 إطاراً في الثانية. قد تنتهي عملية التوليد قبل بلوغ الحد الأقصى متى أصدر النموذج رمز “نهاية الصوت”. وقد أضافت ComfyUI v0.33.1 دعمها لهذا النموذج مؤخراً.

القيد الحقيقي الذي لا تقوله الوثائق بصراحة كافية: النموذج يوفر تحكماً توليدياً لا رمزياً صارماً، ما يعني أن BPM وسلّم الأغنية والتوزيع الموسيقي الذي تحدده قد لا ينعكس بدقة حرفية في المخرج النهائي. بعبارة أخرى، أنت توجّه النموذج ولا تُبرمجه. لمن يعمل في الإنتاج الموسيقي الاحترافي ويحتاج إلى تزامن دقيق مع سياق فيديو أو ضبط إيقاعي صارم، هذه نقطة تستحق أخذها بعين الاعتبار قبل الاعتماد على النموذج في بيئة الإنتاج.

Hugging Face Model Card

مقالات ذات صلة

زر الذهاب إلى الأعلى