GPT-5.6-SOL berjaya menyelesaikan tiga tugasan matematik, fizik dan pengekodan berbilang langkah, manakala Kimi K3 kehabisan bajet token dan mengalami masa tamat (timeout) pada prom yang sama, mendedahkan had praktikal bagi pembangun yang memerlukan jawapan hujung-ke-hujung yang boleh dipercayai.

Mengapa ujian ini penting

Kedua-dua model menerima prom yang serupa di bawah had token yang sama, tanpa sebarang alat carian internet diaktifkan. Penanda aras ini memfokuskan kepada penaakulan berbilang langkah—satu keperluan biasa dalam pengiraan saintifik dan penjanaan kod. Dalam persekitaran produksi, model yang menghabiskan peruntukan tokennya sebelum memberikan hasil akhir boleh melambatkan saluran paip (pipeline) dan menambah beban kerja penyahpepijatan (debugging).

Apa yang berlaku dalam pertembungan ini

GPT-5.6-SOL

  • Menghasilkan jawapan lengkap bagi setiap satu daripada tiga cabaran tersebut.
  • Memberikan derivasi matematik dan fizik yang betul.
  • Menjana skrip Python yang berjaya dikompil dan dijalankan pada penterjemah (interpreter) tempatan.
  • Terlepas satu kes ujian dalam output contoh, tetapi logik terasnya tetap kukuh.

Kimi K3

  • Gagal memberikan penyelesaian yang nyata bagi masalah matematik dan fizik.
  • Mencapai had token berulang kali, menyebabkan penaakulannya terpotong sebelum kesimpulan dapat dihasilkan.
  • Berhenti selepas 245 saat pada tugasan pengaturcaraan, tanpa memberikan sebarang kod yang boleh dijalankan.

Pengajaran utama untuk pengamal

  • Token penaakulan lawan output akhir – Kimi K3 menghabiskan sebahagian besar bajet tokennya pada rantaian pemikiran dalaman. Apabila bajet adalah tetap, model tersebut sering kehabisan ruang sebelum dapat mengeluarkan jawapan, menjadikannya tidak sesuai untuk aliran kerja yang memerlukan hasil segera.
  • Logik lawan pengujian – Walaupun model yang melakukan penaakulan dengan betul boleh terlepas butiran sampingan. Kes ujian GPT-5.6-SOL yang salah mengingatkan kita supaya memeriksa kod pengesahan yang dijana secara manual.
  • Latensi dan sebab penamatan adalah penting – Saluran paip produksi harus merekodkan bukan sahaja jawapan akhir tetapi juga sebab model berhenti (had token, masa tamat, dll.) dan berapa banyak token yang digunakan untuk penaakulan.

Apa yang perlu diperhatikan seterusnya

Sehingga perubahan sedemikian muncul, pembangun yang memerlukan hasil hujung-ke-hujung yang boleh diharap berkemungkinan besar akan memilih model seperti GPT-5.6-SOL untuk tugasan yang melibatkan pengiraan berantai atau sintesis kod.

Bagi pasukan yang membina sistem automatik, penanda aras ini menekankan satu peraturan mudah: uji kedua-dua ketepatan jawapan dan keupayaan model untuk mencapai jawapan tersebut dalam kekangan operasi yang anda tetapkan. Model yang "berfikir" tetapi tidak pernah selesai hanyalah sebuah jalan buntu.