Điểm nhấn về Hiệu năng

Hội nghị Hot Chips đã công bố các con số đã được một công ty độc lập xác minh bằng bộ công cụ InferenceX. OpenAI gọi Jalapeño là một bộ tăng tốc suy luận đa năng—nó chạy các mô hình nhưng không dùng để huấn luyện chúng. Trong các bài kiểm tra, con chip này:

  • Mang lại hiệu suất công việc trên mỗi watt cao hơn từ 1,5 × đến 1,9 × ở mức thông lượng tối đa so với các sản phẩm dẫn đầu hiện nay.
  • Giảm độ trễ từ 1,7 × đến 3,6 ×, với mức cải thiện tương tác đạt từ 2,1 × đến 4,1 ×.

Kết quả cụ thể cho từng mô hình:

  • GPT-OSS 120B: ~1.400 token/giây/người dùng.
  • Deepseek R1 670B: ~700 token/giây trên một yêu cầu đồng thời duy nhất.
  • Kimi K2.5 1T: được thử nghiệm trong bộ công cụ hiệu năng cao (các con số chính xác không được tiết lộ).

OpenAI nhấn mạnh rằng những con số này có được mà không cần sử dụng giải mã suy đoán (speculative decoding) hay dự đoán đa token (multi-token prediction)—những thủ thuật mà nhiều đối thủ thường dùng để làm đẹp các con số tiêu đề.

Jalapeño được chế tạo như thế nào

OpenAI đã hoàn tất thiết kế của con chip trong vòng chín tháng thông qua việc hợp tác với Broadcom. Công ty đã đưa các mô hình của chính mình vào quy trình thiết kế, giúp đẩy nhanh việc lập bản thiết kế, lập trình và tối ưu hóa—một phương pháp được gọi là “thiết kế silicon hỗ trợ bởi AI” (AI-assisted silicon design). Quá trình phát triển thần tốc này làm nổi bật sự chuyển dịch từ các chu kỳ kéo dài nhiều năm vốn từng định hình ngành silicon hiệu năng cao.

Hệ lụy đối với vị thế dẫn đầu của Nvidia

Nvidia dựa vào hiệu năng thuần túy và hệ sinh thái CUDA. Dữ liệu mới này khiến lợi thế về hiệu năng có thể bị thách thức. Các nhà phân tích cảnh báo rằng nếu có thêm nhiều công ty AI tung ra các dòng silicon suy luận tùy chỉnh với hiệu suất tương tự, các nhà phát triển có thể rời xa CUDA, mở ra không gian cho các nền tảng thay thế và một thị trường phân mảnh.

Chiến lược kết hợp đa dạng của OpenAI

Giám đốc tài chính Kelly Huang coi Jalapeño là một phần trong kế hoạch tính toán rộng lớn hơn, chứ không phải là sự thay thế hoàn toàn cho các đối tác hiện tại. OpenAI vẫn hợp tác với Nvidia, AMD, AWS và Cerebras trên nhiều khối lượng công việc khác nhau. Jalapeño hiện vẫn là một mẫu kỹ thuật; nó vẫn chưa phải đối mặt với các mô hình lớn sắp tới như Deepseek V4 Pro. Những bình luận của Huang cho thấy OpenAI sẽ kết hợp silicon của riêng mình với các bộ tăng tốc của bên thứ ba, nhằm theo đuổi sự kết hợp tối ưu nhất giữa chi phí và hiệu năng cho mỗi tác vụ.

Các quan điểm trái chiều

Các mẫu ở giai đoạn đầu không đảm bảo được việc sản xuất hàng loạt, tỷ lệ thành phẩm (yield) hay độ tin cậy lâu dài, vì vậy sự phấn khích cần được giữ ở mức chừng mực.

Những điều cần theo dõi tiếp theo

  • Triển khai sản xuất: Liệu OpenAI có thể biến Jalapeño thành một linh kiện sản xuất hàng loạt hay không, và với mức giá nào?
  • Nền tảng phần mềm: Mô hình lập trình và bộ công cụ dành cho các nhà phát triển sẽ đạt mức độ trưởng thành đến đâu?
  • Phản ứng của đối thủ: Nvidia và các nhà cung cấp khác sẽ điều chỉnh lộ trình hoặc giá cả như thế nào để bảo vệ thị phần?
  • Quy mô mô hình: Liệu Jalapeño có giữ vững lợi thế trước làn sóng các mô hình hàng nghìn tỷ tham số tiếp theo không?

Điểm mấu chốt: Silicon suy luận tùy chỉnh đang chuyển mình từ một thử nghiệm ngách thành một thách thức đáng gờm đối với sự thống trị phần cứng của Nvidia.