GPT-5.6-SOL สามารถทำภารกิจคณิตศาสตร์ ฟิสิกส์ และการเขียนโค้ดแบบหลายขั้นตอนได้สำเร็จถึงสามภารกิจ ในขณะที่ Kimi K3 ใช้โควตาโทเคนจนหมดและหมดเวลา (timed out) เมื่อเจอคำสั่งเดียวกัน ซึ่งเผยให้เห็นข้อจำกัดในการใช้งานจริงสำหรับนักพัฒนาที่ต้องการคำตอบที่เชื่อถือได้และครบถ้วนตั้งแต่ต้นจนจบ

ทำไมการทดสอบนี้จึงสำคัญ

โมเดลทั้งสองได้รับคำสั่ง (prompts) ที่เหมือนกันภายใต้เพดานโทเคนเดียวกัน โดยไม่มีการเปิดใช้งานเครื่องมือค้นหาทางอินเทอร์เน็ต การทดสอบนี้มุ่งเน้นไปที่การใช้เหตุผลแบบหลายขั้นตอน (multi-step reasoning) ซึ่งเป็นความต้องการทั่วไปในการคำนวณทางวิทยาศาสตร์และการสร้างโค้ด ในการใช้งานจริง โมเดลที่ใช้โควตาโทเคนจนหมดก่อนที่จะให้ผลลัพธ์สุดท้ายสามารถทำให้กระบวนการทำงาน (pipelines) หยุดชะงักและเพิ่มภาระในการแก้บั๊ก (debugging)

เกิดอะไรขึ้นในการประชันหน้ากัน

GPT-5.6-SOL

  • ให้คำตอบที่สมบูรณ์สำหรับทั้งสามความท้าทาย
  • ให้การพิสูจน์สูตรทางคณิตศาสตร์และฟิสิกส์ที่ถูกต้อง
  • สร้างสคริปต์ Python ที่สามารถคอมไพล์และรันบนอินเทอร์พรีเตอร์ (interpreter) ในเครื่องได้
  • พลาดกรณีทดสอบ (test case) หนึ่งในตัวอย่างผลลัพธ์ แต่ตรรกะหลักยังคงถูกต้อง

Kimi K3

  • ไม่สามารถแสดงคำตอบที่มองเห็นได้สำหรับปัญหาคณิตศาสตร์และฟิสิกส์
  • ติดขีดจำกัดโทเคนซ้ำแล้วซ้ำเล่า ทำให้การใช้เหตุผลถูกตัดตอนก่อนที่จะได้ข้อสรุป
  • หยุดทำงานหลังจากผ่านไป 245 วินาทีในภารกิจการเขียนโปรแกรม โดยไม่มีโค้ดที่สามารถรันได้ส่งมาให้

บทเรียนสำคัญสำหรับผู้ปฏิบัติงาน

  • โทเคนในการใช้เหตุผล เทียบกับ ผลลัพธ์สุดท้าย – Kimi K3 ใช้โควตาโทเคนส่วนใหญ่ไปกับกระบวนการคิดภายใน (internal thought chains) เมื่อโควตาถูกจำกัด โมเดลจึงมักจะใช้พื้นที่จนหมดก่อนที่จะสามารถแสดงคำตอบออกมาได้ ทำให้ไม่เหมาะกับเวิร์กโฟลว์ที่ต้องการผลลัพธ์ในทันที
  • ตรรกะ เทียบกับการทดสอบ – แม้แต่โมเดลที่ใช้เหตุผลได้ถูกต้องก็อาจพลาดรายละเอียดปลีกย่อยได้ กรณีที่ GPT-5.6-SOL ให้กรณีทดสอบที่ไม่ถูกต้องช่วยเตือนให้เราตรวจสอบโค้ดสำหรับตรวจสอบความถูกต้อง (validation code) ที่สร้างขึ้นด้วยตนเองเสมอ
  • ความหน่วง (Latency) และเหตุผลในการหยุดทำงานเป็นเรื่องสำคัญ – ในกระบวนการทำงานจริง (production pipelines) ควรบันทึก (log) ไม่เพียงแค่คำตอบสุดท้ายเท่านั้น แต่ยังรวมถึงเหตุผลที่โมเดลหยุดทำงาน (เช่น ขีดจำกัดโทเคน, การหมดเวลา เป็นต้น) และจำนวนโทเคนที่ใช้ไปกับการใช้เหตุผลด้วย

สิ่งที่ควรจับตามองต่อไป

จนกว่าจะมีการเปลี่ยนแปลงดังกล่าว นักพัฒนาที่ต้องการผลลัพธ์แบบ end-to-end ที่เชื่อถือได้ มีแนวโน้มที่จะเลือกใช้โมเดลอย่าง GPT-5.6-SOL สำหรับงานที่เกี่ยวข้องกับการคำนวณแบบต่อเนื่องหรือการสังเคราะห์โค้ด (code synthesis)

สำหรับทีมที่สร้างระบบอัตโนมัติ การทดสอบนี้เน้นย้ำถึงกฎง่ายๆ คือ: ให้ทดสอบทั้งความถูกต้องของคำตอบและความสามารถของโมเดลในการไปถึงคำตอบนั้นภายใต้ข้อจำกัดในการทำงานที่คุณกำหนดไว้ โมเดลที่ "คิด" แต่ไม่เคยทำงานให้เสร็จสิ้น ก็ไม่ต่างอะไรกับทางตัน