GPT-5.6-SOL đã hoàn thành ba tác vụ toán học, vật lý và lập trình gồm nhiều bước, trong khi Kimi K3 bị hết ngân sách token và hết thời gian chờ (timeout) với cùng các câu lệnh đó, bộc lộ một hạn chế thực tế đối với các nhà phát triển cần các câu trả lời đầu-cuối đáng tin cậy.

Tại sao bài kiểm tra này lại quan trọng

Cả hai mô hình đều nhận được các câu lệnh giống hệt nhau dưới cùng một mức trần token, mà không được bật các công cụ tìm kiếm internet. Bài kiểm tra này tập trung vào khả năng suy luận đa bước—một nhu cầu phổ biến trong tính toán khoa học và tạo mã nguồn. Trong môi trường vận hành thực tế, một mô hình tiêu hết định mức token trước khi đưa ra kết quả cuối cùng có thể làm đình trệ các quy trình và làm tăng thêm khối lượng công việc gỡ lỗi.

Điều gì đã xảy ra trong cuộc đối đầu trực tiếp

GPT-5.6-SOL

  • Đã đưa ra câu trả lời hoàn chỉnh cho mỗi thử thách trong số ba thử thách.
  • Cung cấp các phép dẫn giải toán học và vật lý chính xác.
  • Tạo ra một mã nguồn Python có thể biên dịch và chạy trên trình thông dịch cục bộ.
  • Bỏ lỡ một trường hợp kiểm thử trong kết quả mẫu, nhưng logic cốt lõi vẫn đảm bảo tính chính xác.

Kimi K3

  • Không thể đưa ra giải pháp hiển thị được cho các bài toán toán học và vật lý.
  • Liên tục chạm giới hạn token, làm cắt ngắn quá trình suy luận trước khi có thể đưa ra kết luận.
  • Dừng lại sau 245 giây ở tác vụ lập trình, không đưa ra được mã nguồn có thể chạy được.

Những bài học chính cho những người thực hành

  • Token suy luận so với kết quả đầu ra cuối cùng – Kimi K3 tiêu tốn một phần lớn ngân sách token vào các chuỗi tư duy nội bộ. Khi ngân sách bị cố định, mô hình thường hết dung lượng trước khi có thể đưa ra câu trả lời, khiến nó không phù hợp cho các quy trình làm việc cần kết quả tức thì.
  • Logic so với kiểm thử – Ngay cả một mô hình suy luận đúng cũng có thể mắc lỗi ở các chi tiết phụ trợ. Trường hợp kiểm thử không chính xác của GPT-5.6-SOL nhắc nhở chúng ta phải kiểm tra thủ công mã xác thực được tạo ra.
  • Độ trễ và lý do dừng lại là quan trọng – Các quy trình vận hành thực tế nên ghi lại không chỉ câu trả lời cuối cùng mà còn cả lý do tại sao mô hình dừng lại (giới hạn token, hết thời gian chờ, v.v.) và mô hình đã tiêu tốn bao nhiêu token để suy luận.

Điều cần theo dõi tiếp theo

Cho đến khi những thay đổi như vậy xuất hiện, các nhà phát triển cần kết quả đầu-cuối đáng tin cậy có khả năng sẽ ưu tiên các mô hình như GPT-5.6-SOL cho các tác vụ liên quan đến tính toán chuỗi hoặc tổng hợp mã nguồn.

Đối với các đội ngũ đang xây dựng các hệ thống tự động, bài kiểm tra này nhấn mạnh một quy tắc đơn giản: hãy kiểm tra cả tính chính xác của câu trả lời lẫn khả năng đạt được câu trả lời đó của mô hình trong phạm vi các ràng buộc vận hành mà bạn đặt ra. Một mô hình "suy nghĩ" nhưng không bao giờ hoàn thành thì chẳng khác gì một ngõ cụt.