Najważniejsze wyniki benchmarków
Konferencja Hot Chips ujawniła dane, które niezależna firma zweryfikowała za pomocą zestawu InferenceX. OpenAI określa Jalapeño mianem uniwersalnego akceleratora wnioskowania — uruchamia on modele, ale ich nie trenuje. W testach chip:
- Dostarczył 1,5x do 1,9x więcej pracy na wat przy szczytowej przepustowości niż obecni liderzy.
- Zredukował opóźnienia 1,7x do 3,6x, przy czym zyski w interakcji wyniosły 2,1x do 4,1x.
Wyniki dla konkretnych modeli:
- GPT-OSS 120B: ~1 400 tokenów/sekundę/użytkownika.
- Deepseek R1 670B: ~700 tokenów/sekundę przy pojedynczym jednoczesnym żądaniu.
- Kimi K2.5 1T: testowany w zestawie wysokowydajnym (dokładne liczby nie zostały podane).
OpenAI podkreśliło, że liczby te nie uwzględniają dekodowania spekulatywnego ani wielotokenowej predykcji — sztuczek, których wielu konkurentów używa do podbicia wyników w nagłówkach.
Jak zbudowano Jalapeño
OpenAI ukończyło projekt chipu w dziewięć miesięcy, współpracując z Broadcom. Firma wykorzystała własne modele w pętli projektowej, co przyspieszyło tworzenie planów, programowanie i optymalizację — metodę nazwaną „projektowaniem krzemu wspomaganym przez AI”. Ten intensywny proces podkreśla odejście od wieloletnich cykli, które niegdyś definiowały wysokowydajny krzem.
Implikacje dla pozycji lidera Nvidii
Nvidia opiera się na surowej wydajności i ekosystemie CUDA. Nowe dane sprawiają, że przewaga wydajnościowa może zostać podważona. Analitycy ostrzegają, że jeśli więcej firm AI wprowadzi własny krzem do wnioskowania o podobnej wydajności, programiści mogą odejść od CUDA, co otworzy przestrzeń dla alternatywnych stosów technologicznych i doprowadzi do rozdrobnienia rynku.
Strategia mieszanych sygnałów OpenAI
Dyrektor finansowa Kelly Huang przedstawiła Jalapeño jako jeden element szerszego planu obliczeniowego, a nie całkowite zastąpienie obecnych partnerów. OpenAI nadal współpracuje z Nvidia, AMD, AWS i Cerebras w ramach różnych obciążeń roboczych. Jalapeño pozostaje próbką inżynieryjną; musi jeszcze zmierzyć się z największymi nadchodzącymi modelami, takimi jak Deepseek V4 Pro. Komentarze Huang sugerują, że OpenAI będzie łączyć własny krzem z akceleratorami zewnętrznych dostawców, dążąc do uzyskania najlepszego stosunku kosztów do wydajności dla każdego zadania.
Kontrargumenty
Wczesne próbki nie gwarantują produkcji masowej, wysokiego uzysku czy długoterminowej niezawodności, więc entuzjazm należy tonować.
Na co zwrócić uwagę w przyszłości
- Wdrożenie produkcyjne: Czy OpenAI zdoła przekształcić Jalapeño w masowo produkowany komponent i po jakiej cenie?
- Stos oprogramowania: Jak dojrzały będzie model programowania i zestaw narzędzi dla programistów?
- Reakcja konkurencji: Jak Nvidia i inni dostawcy zmodyfikują swoje mapy drogowe lub politykę cenową, aby chronić udział w rynku?
- Skalowanie modeli: Czy Jalapeño utrzyma swoją przewagę w starciu z kolejną falą modeli o bilionach parametrów?
Podsumowanie: Dedykowany krzem do wnioskowania przechodzi z fazy niszowego eksperymentu do roli realnego wyzwania dla dominacji sprzętowej Nvidii.
