OpenAI đã thông báo vào ngày 30 tháng 7 năm 2026 rằng API GPT-5.6 sẽ có chi phí thấp hơn đáng kể so với phiên bản tiền nhiệm, triển khai ba mô hình phân tầng—Sol, Terra và Luna—cùng với các mức giảm giá sâu cho các lượt đọc được lưu trong bộ nhớ đệm (cached reads).
Tại sao mức giá mới này lại quan trọng
Kể từ khi GPT-5 ra mắt, chi phí API đã là một khoản mục lớn đối với bất kỳ ai đang xây dựng các tác nhân hội thoại (conversational agents), quy trình tạo phản hồi tăng cường truy xuất (RAG) hoặc các công cụ trích xuất dữ liệu quy mô lớn. Bằng cách cắt giảm phí đầu vào xuống còn 5 USD, 2 USD và 0,20 USD cho mỗi triệu token tương ứng với Sol, Terra và Luna, OpenAI mang đến cho các nhà phát triển một cách rẻ hơn để lựa chọn mức độ suy luận cần thiết mà không cần phải thiết kế lại toàn bộ hệ thống của họ. Khoản tiết kiệm lớn nhất thuộc về Terra, hiện chỉ chạy với mức giá bằng 40% so với mức giá flagship cũ, và Luna, chỉ bằng 4% so với mức chuẩn đó.
Chi tiết về ba mô hình
| Mô hình | Giá đầu vào (mỗi 1 triệu token) | Giá đầu ra (mỗi 1 triệu token) | Mục đích sử dụng điển hình |
|---|---|---|---|
| Sol | $5 | $30 | Suy luận sâu, các tác vụ chuỗi suy nghĩ (chain-of-thought) |
| Terra | $2 | $12 | Khối lượng công việc vận hành (production), hiệu suất cân bằng |
| Luna | $0.20 | $1.20 | Khối lượng lớn, trích xuất hoặc phân loại đơn giản |
Sol vẫn là mô hình đắt nhất nhưng cung cấp khả năng suy luận sâu sắc nhất. Terra được định vị là lựa chọn mặc định cho hầu hết các ứng dụng, trong khi Luna là một tùy chọn "quy mô cao" nơi chiều sâu có thể được đánh đổi để lấy chi phí thấp.
Lưu trữ bộ nhớ đệm giúp giảm hóa đơn hơn nữa
OpenAI đã giới thiệu một lớp bộ nhớ đệm giúp giảm 90% chi phí cho các hoạt động đọc. Tỷ lệ cho đầu vào được lưu trong bộ nhớ đệm là:
- Sol: $0.50 / triệu token
- Terra: $0.20 / triệu token
- Luna: $0.02 / triệu token
Việc ghi vào bộ nhớ đệm có chi phí bằng 1,25 lần tỷ lệ đầu vào tương ứng, và một mục trong bộ nhớ đệm phải tồn tại ít nhất 30 phút trước khi có thể bị xóa.
Phụ phí độ dài ngữ cảnh để đảm bảo tính minh bạch
API hiện áp dụng phụ phí khi một yêu cầu vượt quá 272K token đầu vào. Giá cơ bản sẽ tăng gấp đôi đối với đầu vào và tăng 1,5 lần đối với đầu ra. Tỷ lệ vượt mức của Sol được niêm yết ở mức 10 USD đầu vào và 45 USD đầu ra cho mỗi triệu token, giúp dễ dàng tính toán mức phạt cho các ngữ cảnh dài bất thường.
Những gì nhà phát triển sẽ mất đi
Việc cắt giảm giá đi kèm với hai thiếu sót đáng chú ý. Thứ nhất, không có gói miễn phí vĩnh viễn, nghĩa là mọi yêu cầu đều phát sinh chi phí bất kể nhỏ đến đâu. Thứ hai, OpenAI vẫn chưa giới thiệu các mức giảm giá cho endpoint xử lý theo lô (batch-endpoint) cho GPT-5.6, một tính năng đã giúp người dùng quy mô lớn giảm chi phí trên mỗi lần gọi ở các phiên bản trước.
Cách để giữ chi phí thấp
- Chọn đúng mô hình: Chỉ sử dụng Sol cho các tác vụ thực sự cần suy luận sâu; mặc định dùng Terra cho hầu hết các công việc vận hành; dành riêng Luna cho các công việc có thông lượng cao nhưng độ phức tạp thấp.
- Sử dụng bộ nhớ đệm: Lưu trữ các câu lệnh (prompts) và kết quả trung gian được tái sử dụng qua các lần gọi; mức giảm giá 90% cho lượt đọc có thể làm giảm đáng kể so với giá cơ bản.
- Lưu ý độ dài ngữ cảnh: Chia nhỏ các đầu vào rất dài thành các đoạn nhỏ hơn hoặc cắt bỏ các phần không thiết yếu để tránh phụ phí đầu vào gấp 2 lần.
- Theo dõi thời gian tồn tại của bộ nhớ đệm: Thời gian lưu trữ bộ nhớ đệm tối thiểu là 30 phút.
Điều gì tiếp theo
Các nhà phát triển nên theo dõi trang giá chính thức để cập nhật bất kỳ thay đổi nào, đặc biệt là xung quanh phí ghi bộ nhớ đệm hoặc các ngưỡng độ dài ngữ cảnh.
Tóm tắt: Mức giá phân tầng và các khoản giảm giá bộ nhớ đệm mạnh mẽ của GPT-5.6 giúp nó trở thành một mô hình OpenAI có giá cả phải chăng, nhưng việc thiếu gói miễn phí và giảm giá theo lô có nghĩa là việc quản lý chi phí thông minh vẫn sẽ là yếu tố thiết yếu cho bất kỳ triển khai quy mô lớn nào.
