تُحدَّث يومياً

مصدرُك العربي
لمستقبل الذكاء الاصطناعي

أخبار، تقارير، أدوات وتحليلات يومية — كل ما تحتاجه لمتابعة ثورة الذكاء الاصطناعي باللغة العربية

✅ تم الاشتراك!
اختيار المحررينالإحصائيات والتقارير

Ironwood يتفوق على B200 بـ50% أداءً لكل دولار في أول قياس مستقل

عند تفاعلية 20 رمزاً/ثانية/مستخدم تنتج Ironwood 9,364 رمزاً لكل شريحة بتكلفة أقل، أي 50.4% رموزاً أكثر لكل دولار من B200 و96% من B300.

ضمن ملف: نماذج الذكاء الاصطناعي، جوجل والذكاء الاصطناعي

بقلم: نور | محررة الأبحاث والدراسات · صوت تحريري بإشراف بشري

المصدر الأساسي: SemiAnalysis

لماذا يهم

فرق تشغيل النماذج المفتوحة والشركات التي تشتري أو تستأجر عتاد استدلال باتت أمام بديل مُقاس لأول مرة خارج غوغل، مع شرط واضح: الأفضلية تصح في FP8 والخدمة المجمّعة فقط، لا في FP4 أو الكمون المنخفض.

شريحة Ironwood (TPUv7) من غوغل تُخرج 50.4% رموزاً أكثر لكل دولار من B200 و96.0% أكثر من B300 عند تفاعلية 20 رمزاً في الثانية لكل مستخدم، (وفقاً لـ SemiAnalysis) في أول نتائج استدلال طرف ثالث تُنشر لهذه الشريحة. هذه ليست أرقاماً من غوغل عن نفسها، وهي في الوقت ذاته مبنية على نموذج تكلفة ملكية (TCO) تقديري من SemiAnalysis نفسها، أي أنها لم يتسنَّ التحقق منها بشكل مستقل خارج هذا المصدر الوحيد.

ما جرى قياسه تحديداً: خدمة مجمّعة (aggregated serving) بتنسيق FP8 مع تنبؤ برمز واحد، على نموذج Qwen3.5 397B كنموذج تشغيل أولي، ضمن نطاق 8k1k فقط لتضييق نطاق العمل. المقارنة تمت مقابل B200 وB300 بنفس التنسيق، عبر مكدّس TorchTPU vLLM الأصلي القادم. بحسب SemiAnalysis، تخطط غوغل لاحقاً لتوسيع الدعم إلى نماذج مفتوحة الأوزان أخرى مثل Kimi K3 وGLM5.3، ولم تُنشر بعد نتائج أحمال العمل الوكيلية (agentic) رغم وعد بنشرها لاحقاً هذا العام.

منحنى باريتو يقارن التكلفة لكل مليون رمز بين TPUv7 Ironwood وB200 وB300
منحنيات باريتو من معاينة InferenceX: انتبه إلى أن أفضلية TPU ليست ثابتة عبر المنحنى كله، بل تتركز في مناطق تفاعلية وزمن استجابة محددة.

الأرقام التفصيلية تروي قصة أدق من العنوان. عند تفاعلية 100 رمز/ثانية/مستخدم، تبلغ تكلفة Ironwood نحو 0.181 دولار لكل مليون رمز، مقابل 0.222 دولار على B200 و0.276 دولار على B300، أي أقل بنحو 19% و34% على التوالي عند سرعة توليد متطابقة لكل مستخدم (وفقاً لـ SemiAnalysis). وعند تفاعلية 20 رمزاً/ثانية/مستخدم، تتقدم Ironwood حتى في الإنتاجية الخام: 9,364 رمزاً في الثانية لكل شريحة مقابل 8,903 على B200 و8,925 على B300، بفارق نحو 5%.

لكن على معظم منحنى الأداء الخام، لا تتفوق TPU على وحدات NVIDIA. الأفضلية تأتي من التكلفة الساعية الأدنى التي تعوّض الإنتاجية الأقل. وهنا يظهر تمييز مهم يستحق الانتباه: عند احتساب تكلفة TPU الداخلية لغوغل عند 1.03 دولار/شريحة/ساعة، تقفز أفضلية الأداء لكل دولار عند تزامن 256 إلى 76.7% فوق B200 و130.2% فوق B300، بحسب SemiAnalysis. ثمن هذا القفز هو زمن الاستجابة الأول: متوسط TTFT عند هذا التزامن يبلغ 5.41 ثانية على TPU مقابل 3.75 ثانية على B200 و2.40 ثانية على B300. إن كان منتجك حساساً لزمن أول رمز، فهذه النقطة تحديداً ليست لك.

عند زمن استجابة وسيط قدره 20 ثانية من طرف إلى طرف، تستقر TPU عند نحو 0.098 دولار لكل مليون رمز مقابل 0.106 على B200 و0.132 على B300، أي أرخص بـ8% و25%. ومع ذلك، تحتفظ B200 بتفوق في جزء صغير من المنحنى، تحديداً حول زمن استجابة وسيط قدره 30 ثانية، قبل أن تستعيد TPU أفضليتها عند أزمنة أطول. الأمانة في عرض هذه النقطة هي ما يجعل بقية الأرقام قابلة للتصديق.

فجوتان واضحتان تبقيان لصالح NVIDIA. الأولى أن TPUv7 لا تملك حساباً أصلياً بتنسيق FP4، ورغم أن FP4 على وحدات NVIDIA يأتي بخسارة جودة مقارنة بـFP8، تظل NVIDIA متقدمة في هذا المسار. تتوقع SemiAnalysis أن يتغير ذلك مع TPUv8i التي تدعم FP4 أصلياً، وأن تكون منافسة لـRubin NVL72. الثانية أن الخدمة المفصولة (disaggregated serving) على المكدّس الخارجي لـTPU ليست محسّنة بعد، رغم أن غوغل تشغّلها داخلياً منذ سنوات. في مقارنة غير متكافئة بين GB300 NVL72 بخدمة مفصولة وTPUv7 بخدمة مجمّعة، تتقدم GB300 بنحو 30% في الأداء لكل دولار في منتصف منحنى زمن الاستجابة، بينما تبقى TPU منافسة عند الأطراف المنخفضة والمرتفعة. الرهان المعلن هو إغلاق هذه الفجوة خلال أشهر، مع ميزة بنيوية لصالح TPU: قدرة الحاويات (pods) على التوسع إلى أكثر من ألف شريحة عبر نسيج ICI منخفض الكمون، وهو ما يتيح توازي خبراء فائق الاتساع لا يستطيع NVL72 تنفيذه.

الجزء الأقل بريقاً والأهم عملياً هو البرمجيات. كان المسار السابق يعتمد على TorchAX لترجمة تعريفات PyTorch داخل vLLM وSGLang إلى JAX، وهو مسار أثار مشكلات كافية لدفع غوغل ومجتمعات PyTorch وvLLM وSGLang إلى بناء بديل. مرّ دعم vLLM لـTPU بثلاث مراحل: نموذج أولي عبر PyTorch/XLA بتنفيذ كسول يجمّع العمليات في رسوم حسابية ليصرّفها XLA، ثم الخلفية العامة الحالية tpu-inference التي تستخدم تنفيذ JAX المحسّن حين يتوفر وتلجأ إلى TorchAX خلاف ذلك، وأخيراً TorchTPU الذي يتعامل مع TPU كجهاز PyTorch أصلي بينما تتولى StableHLO وXLA ونوى Pallas المحسّنة التنفيذ منخفض المستوى. التحسينات التي دخلت النوى تشمل تحسين انتباه DP، وتوجيه ونوى MoE، وتقليل الحشو (padding) في نوى GDN. من المتوقع أن يخرج المكدّس من البيتا المغلقة ويصبح مفتوح المصدر حول أكتوبر، بحسب المصدر ذاته.

لماذا يهم هذا التفصيل البرمجي أكثر من أي رقم في الجدول؟ لأن vLLM وSGLang يركزان دعم اليوم صفر على NVIDIA، مع تغطية مقبولة لـAMD. إن نضج TorchTPU بما يكفي ليضيف مشرفو المشروعين TPU إلى قائمة اليوم صفر، فإن ما يتآكل ليس أداء NVIDIA بل خندق CUDA نفسه.

ثلاث خلاصات عملية من هذه النتائج:

  1. الأفضلية مشروطة بنقطة التشغيل، لا مطلقة. إن كنت تخدم نموذجاً مفتوح الأوزان بـFP8 وخدمة مجمّعة وتقيس نجاحك بالإيراد لكل دولار وليس بأقل كمون ممكن، فحالة TPU قوية. إن كنت تعتمد على FP4 أو على خدمة مفصولة محسّنة أو على TTFT منخفض، فوحدات NVIDIA ما تزال الخيار الأسلم اليوم.
  2. فارق التكلفة الداخلية والخارجية ليس تفصيلاً محاسبياً. الفارق بين 50% أفضلية بتكلفة خارجية و76.7% بتكلفة غوغل الداخلية عند 1.03 دولار/شريحة/ساعة يعني أن غوغل تحتفظ بهامش هيكلي على كل من يشتري أو يستأجر منها. أي حساب جدوى يجب أن يستخدم الرقم الخارجي.
  3. قاعدة العملاء تسبق نضج المكدّس. بحسب SemiAnalysis، التزمت Anthropic بأكثر من مليون شريحة TPU (نحو 400 ألف شراءً مباشراً وأكثر من 600 ألف استئجاراً عبر Google Cloud)، تُستخدم أساساً للتدريب وأيضاً للاستدلال، ويُتوقع أن تتجاوز استخدام DeepMind نفسها بحلول 2029. عندما يلتزم أكبر عميل خارجي بهذا الحجم، فإن تحسين المكدّس مسألة وقت لا مسألة نية.

تقييمنا أن الأرقام المنشورة أضعف مما يوحي به العنوان وأقوى مما يوحي به السياق. أضعف لأن التفوق بـ50% يخص نقطة قياس واحدة ضمن نطاق 8k1k وتنسيق واحد وخدمة مجمّعة، وأقوى لأن هذه أول مرة يقيس فيها طرف ثالث شريحة يمكن شراؤها أو استئجارها فعلياً، لا شريحة داخلية مغلقة. الملاحظة الأصدق في التقرير هي المقارنة الثقافية: غوغل تملك عقوداً من هندسة برمجيات منضبطة، وهذا ما يجعل توقّع نضج سريع للمكدّس الخارجي معقولاً بشكل لم يكن معقولاً مع منافسين آخرين. تبقى التحسينات الموعودة، وهي فك التشفير التخميني والملء المفصول وتفريغ KV-cache وأحمال العمل الوكيلية متعددة الأدوار، غير مُقاسة حتى الآن. راقب أكتوبر: فتح المصدر هو الاختبار الحقيقي، لأن الأرقام التي لا يستطيع أحد إعادة إنتاجها تبقى ادعاءً مهما كان مصدرها موثوقاً. ويمكنك الاطلاع على تفاصيل الشريحة الرسمية عبر إعلان غوغل عن Ironwood.

مقالات ذات صلة

زر الذهاب إلى الأعلى