نکات برجسته بنچمارک
کنفرانس Hot Chips اعدادی را فاش کرد که توسط یک شرکت مستقل با استفاده از مجموعه InferenceX تأیید شدهاند. OpenAI از Jalapeño به عنوان یک شتابدهنده استنتاج همهمنظوره یاد میکند؛ این تراشه مدلها را اجرا میکند اما آنها را آموزش نمیدهد. در آزمایشها، این تراشه:
- ۱.۵ تا ۱.۹ برابر کار بیشتر به ازای هر وات در حداکثر توان عملیاتی نسبت به پیشروهای فعلی ارائه داد.
- تأخیر را ۱.۷ تا ۳.۶ برابر کاهش داد، که در بخشهای تعاملی به میزان ۲.۱ تا ۴.۱ برابر بهبود یافت.
نتایج اختصاصی برای هر مدل:
- GPT-OSS 120B: حدود ۱۴۰۰ توکن در ثانیه برای هر کاربر.
- Deepseek R1 670B: حدود ۷۰۰ توکن در ثانیه در یک درخواست همزمان واحد.
- Kimi K2.5 1T: در مجموعه با عملکرد بالا آزمایش شده است (اعداد دقیق منتشر نشده است).
OpenAI تأکید کرد که این ارقام بدون استفاده از رمزگشایی حدسی (speculative decoding) یا پیشبینی چندتوکنی (multi-token prediction) بهدست آمدهاند؛ ترفندهایی که بسیاری از رقبا برای بالا بردن اعداد و ارقام تبلیغاتی خود از آنها استفاده میکنند.
نحوه ساخت Jalapeño
OpenAI طراحی این تراشه را در نُه ماه با همکاری Broadcom به پایان رساند. این شرکت مدلهای خود را در چرخه طراحی وارد کرد تا فرآیند نقشهکشی، برنامهنویسی و بهینهسازی را تسریع کند؛ روشی که «طراحی سیلیکون به کمک هوش مصنوعی» نامیده میشود. این سرعت عمل، نشاندهنده تغییری نسبت به چرخههای چندساله است که زمانی مشخصه تولید سیلیکونهای با عملکرد بالا بود.
پیامدها برای پیشتازی Nvidia
Nvidia بر عملکرد خام و اکوسیستم CUDA تکیه دارد. دادههای جدید، برتری عملکردی این شرکت را به چالشی جدی تبدیل میکند. تحلیلگران هشدار میدهند که اگر شرکتهای هوش مصنوعی بیشتری سیلیکونهای استنتاج سفارشی با کارایی مشابه عرضه کنند، ممکن است توسعهدهندگان از CUDA فاصله بگیرند و این امر فضا را برای پشتههای (stacks) جایگزین و یک بازار پراکنده باز کند.
استراتژی سیگنال ترکیبی OpenAI
کلی هوانگ (Kelly Huang)، مدیر مالی شرکت، Jalapeño را به عنوان بخشی از یک برنامه محاسباتی گستردهتر معرفی کرد، نه جایگزینی کامل برای شرکای فعلی. OpenAI همچنان در حجمهای کاری مختلف با Nvidia، AMD، AWS و Cerebras همکاری میکند. Jalapeño فعلاً یک نمونه مهندسی است و هنوز با بزرگترین مدلهای آینده مانند Deepseek V4 Pro روبرو نشده است. اظهارات هوانگ نشان میدهد که OpenAI سیلیکونهای خود را با شتابدهندههای شخص ثالث ترکیب خواهد کرد تا بهترین ترکیب هزینه-عملکرد را برای هر وظیفه دنبال کند.
نکات متقابل
نمونههای مراحل اولیه، تولید انبوه، بازدهی (yields) یا قابلیت اطمینان طولانیمدت را تضمین نمیکنند، بنابراین باید در برخورد با این هیجانات احتیاط کرد.
آنچه باید در آینده زیر نظر داشت
- عرضه تولیدی: آیا OpenAI میتواند Jalapeño را به یک قطعه تولید انبوه تبدیل کند، و با چه قیمتی؟
- پشته نرمافزاری: مدل برنامهنویسی و زنجیره ابزار (toolchain) برای توسعهدهندگان تا چه حد بالغ خواهد بود؟
- پاسخ رقبا: Nvidia و سایر فروشندگان چگونه نقشهراهها یا قیمتگذاری خود را برای محافظت از سهم بازار تغییر خواهند داد؟
- مقیاسپذیری مدل: آیا Jalapeño برتری خود را در برابر موج بعدی مدلهای تریلیون پارامتری حفظ خواهد کرد؟
نتیجهگیری: سیلیکون استنتاج سفارشی از یک آزمایش محدود در حال تبدیل شدن به یک چالش جدی برای سلطه سختافزاری Nvidia است.
