Kimi K3 kehabisan tenaga manakala GPT-5.6-SOL melintasi garisan penamat dalam tiga arahan (prompt) berat—masalah kebarangkalian, senario inersia takal, dan skrip beg galas Python yang rumit. Jurang ini menunjukkan mengapa belanjawan token dan kependaman (latency) adalah penting apabila anda memerlukan model yang boleh menaakul melalui matematik, fizik, dan kod berbilang langkah tanpa terhenti.

Mengapa penanda aras ini penting

Pembangun dan penyelidik sering memilih LLM berdasarkan skor utama, bukan berdasarkan cara ia bertindak di bawah tekanan dunia sebenar. Dalam ujian sebelah-menyebelah ini, setiap model menangani masalah yang memerlukan rantaian penaakulan yang panjang. GPT-5.6-SOL memberikan jawapan yang lengkap dan betul dalam ketiga-tiga domain; Kimi K3 menghabiskan belanjawan tokennya atau mengalami masa tamat sebelum menghasilkan apa-apa yang boleh digunakan.

Persediaan ujian

  • Matematik – soalan kebarangkalian yang memerlukan pengiraan kebarangkalian pertindihan corak serta jangkaan dan varians (momen kedua).
  • Fizik – pemodelan inersia takal dan kehilangan tenaga apabila kabel bertegang spring menjadi kendur.
  • Pengaturcaraan – menulis penyelesaian Python untuk masalah pembungkusan beg galas dengan kebergantungan yang kompleks dan peraturan pemutus seri, kemudian menyemak output terhadap enam kes ujian bebas.

Apa yang angka-angka ini katakan

GPT-5.6-SOL

  • Matematik – menghasilkan penyelesaian lengkap dan betul dengan nilai jangkaan dan varians yang disusun dengan jelas.
  • Fizik – membina model inersia dengan betul dan mengambil kira kehilangan tenaga, sepadan dengan jawapan analitikal.
  • Pengaturcaraan – menjana kod yang berjaya dikompil, dijalankan, dan melepasi kesemua enam semakan luaran. Satu pengisytiharan (assertion) ujian dalaman adalah salah, mengingatkan kita bahawa ujian yang dijana oleh model tidaklah kalis ralat.

Kimi K3

  • Matematik – mencapai siling tokennya (pertama pada 6,500 token, kemudian pada 10,000 token) dan berhenti tanpa menunjukkan sebarang jawapan.
  • Fizik – kehabisan token sebelum sebarang output kelihatan.
  • Pengaturcaraan – mengalami masa tamat selepas 245 saat, tanpa memberikan apa-apa untuk dinilai.

Kecekapan penaakulan lawan kuasa mentah

Implikasinya jelas bagi sesiapa yang membina saluran paip pengeluaran (production pipelines): model yang membakar token tanpa memberikan output boleh menghentikan proses hiliran, meningkatkan kos, dan mengecewakan pengguna.

Kebolehpercayaan dan kos tersembunyi kod “sempurna”

Malah model yang menang pun tersilap: kes ujian yang dijana sendiri oleh GPT-5.6-SOL mengandungi pengisytiharan (assertion) yang cacat. Ini menunjukkan bahawa pengesahan yang dihasilkan oleh model bukanlah pengganti kepada semakan manusia. Apabila model menulis kod, anda masih perlu menjalankan semakan bebas.

Apa yang perlu diperhatikan seterusnya

  • Penjejakan sebab penamatan – log sama ada respons berakhir kerana mencapai had token, masa tamat, atau pemberhentian semula jadi.
  • Bilangan token penaakulan – bandingkan berapa banyak token yang dibelanjakan oleh setiap model untuk pertimbangan dalaman berbanding output akhir.
  • Pemantauan kependaman (latency) – ukur masa waktu sebenar (wall-clock time) untuk setiap langkah; model yang mengambil masa beberapa minit bagi setiap pertanyaan mungkin tidak sesuai untuk aplikasi interaktif.

Pembangun harus menganggap metrik ini sebagai isyarat utama, bukan sekadar jawapan akhir.

Kesimpulan

GPT-5.6-SOL mengatasi Kimi K3 dari segi kelengkapan. Ujian ini juga mengingatkan kita bahawa walaupun model yang “memberikan jawapan betul” masih boleh menghasilkan semakan dalaman yang cacat, jadi pengawasan manusia tetap penting. Menjejaki sebab penamatan, penggunaan token, dan kependaman akan membantu anda memilih alat yang betul untuk tugasan tersebut tanpa terperangkap dalam masa tamat yang senyap.