Sorotan Penanda Aras
Persidangan Hot Chips mendedahkan angka-angka yang telah disahkan oleh sebuah firma bebas menggunakan suite InferenceX. OpenAI menyifatkan Jalapeño sebagai pemecut inferens tujuan umum—ia menjalankan model tetapi tidak melatihnya. Dalam ujian tersebut, cip ini:
- Memberikan 1.5 × hingga 1.9 × lebih banyak kerja bagi setiap watt pada daya pemprosesan puncak berbanding peneraju masa kini.
- Mengurangkan kependaman (latency) sebanyak 1.7 × hingga 3.6 ×, dengan peningkatan interaktif sebanyak 2.1 × hingga 4.1 ×.
Keputusan khusus model:
- GPT-OSS 120B: ~1,400 token / saat / pengguna.
- Deepseek R1 670B: ~700 token / saat bagi satu permintaan serentak.
- Kimi K2.5 1T: diuji dalam suite berprestasi tinggi (angka tepat tidak didedahkan).
OpenAI menegaskan bahawa angka-angka ini diperoleh tanpa penyahkodan spekulatif (speculative decoding) atau ramalan berbilang token (multi-token prediction)—helah yang digunakan oleh ramai pesaing untuk meningkatkan angka utama.
Bagaimana Jalapeño Dibina
OpenAI menyiapkan reka bentuk cip tersebut dalam masa sembilan bulan, dengan bekerjasama dengan Broadcom. Firma tersebut memasukkan modelnya sendiri ke dalam kitaran reka bentuk, sekali gus mempercepatkan proses pelan biru, pengaturcaraan dan pengoptimuman—satu kaedah yang digelar sebagai “reka bentuk silikon berbantu AI.” Pecutan ini menonjolkan peralihan daripada kitaran pelbagai tahun yang dahulunya mendefinisikan silikon berprestasi tinggi.
Implikasi terhadap Kepimpinan Nvidia
Nvidia bergantung kepada prestasi mentah dan ekosistem CUDA. Data baharu ini menjadikan kelebihan prestasi tersebut boleh dicabar. Penganalisis memberi amaran bahawa jika lebih banyak firma AI melancarkan silikon inferens tersuai dengan kecekapan yang serupa, pembangun mungkin akan beralih daripada CUDA, sekali gus membuka ruang kepada timbunan (stack) alternatif dan pasaran yang terfragmentasi.
Strategi Isyarat Bercampur OpenAI
Ketua Pegawai Kewangan, Kelly Huang, menyifatkan Jalapeño sebagai salah satu bahagian daripada pelan pengkomputeran yang lebih luas, dan bukannya penggantian menyeluruh bagi rakan kongsi sedia ada. OpenAI masih bekerjasama dengan Nvidia, AMD, AWS dan Cerebras merentasi pelbagai beban kerja. Jalapeño masih merupakan sampel kejuruteraan; ia belum lagi berhadapan dengan model-model besar yang akan datang seperti Deepseek V4 Pro. Komen Huang menunjukkan bahawa OpenAI akan mencampurkan silikonnya sendiri dengan pemecut pihak ketiga, demi mengejar gabungan kos-prestasi terbaik bagi setiap tugasan.
Hujah Balas
Sampel peringkat awal tidak menjamin pengeluaran besar-besaran, hasil (yield), atau kebolehpercayaan jangka panjang, jadi keterujaan harus dikawal.
Apa yang Perlu Diperhatikan Seterusnya
- Pelancaran pengeluaran: Bolehkah OpenAI menukarkan Jalapeño kepada komponen pengeluaran besar-besaran, dan pada harga berapakah?
- Timbunan perisian (software stack): Sejauh manakah kematangan model pengaturcaraan dan rantaian alatan (toolchain) untuk pembangun?
- Tindak balas pesaing: Bagaimanakah Nvidia dan vendor lain akan mengubah suai pelan hala tuju atau harga untuk melindungi syer pasaran?
- Penskalaan model: Adakah Jalapeño akan mengekalkan kelebihannya terhadap gelombang model berbilion parameter yang seterusnya?
Kesimpulan: Silikon inferens tersuai sedang beralih daripada eksperimen khusus (niche) kepada cabaran yang kredibel terhadap dominasi perkakasan Nvidia.
