Kimi K3, üç zorlu istemde —bir olasılık problemi, bir makara-atalet senaryosu ve karmaşık bir Python sırt çantası betiği— enerjisini tüketirken, GPT-5.6-SOL bitiş çizgisini geçti. Bu fark; çok adımlı matematik, fizik ve kodlama süreçlerinde takılmadan akıl yürütebilen bir modele ihtiyaç duyduğunuzda, token bütçesinin ve gecikmenin (latency) neden önemli olduğunu gösteriyor.

Benchmark neden önemlidir

Geliştiriciler ve araştırmacılar genellikle bir LLM'i gerçek dünya baskısı altındaki davranışına göre değil, manşetlerdeki puanlara göre seçerler. Bu yan yana testte, her model uzun bir akıl yürütme zincirine zorlayan bir problemi ele aldı. GPT-5.6-SOL her üç alanda da eksiksiz ve doğru yanıtlar sunarken; Kimi K3, kullanılabilir bir sonuç üretmeden önce token bütçesini tüketti veya zaman aşımına uğradı.

Test kurulumu

  • Matematik – bir örüntü çakışması olasılığını, beklenen değeri ve varyansı (ikinci momentleri) hesaplamayı gerektiren bir olasılık sorusu.
  • Fizik – bir makaranın ataletini ve yay gerilimli bir kablonun gevşemesi durumundaki enerji kaybını modelleme.
  • Programlama – karmaşık bağımlılıkları ve eşitlik bozma (tie-break) kuralları olan bir sırt çantası paketleme problemine Python çözümü yazmak ve ardından çıktıyı altı bağımsız test vakasına göre kontrol etmek.

Rakamlar ne söylüyor

GPT-5.6-SOL

  • Matematik – beklenen değer ve varyansın net bir şekilde sunulduğu tam ve doğru bir çözüm üretti.
  • Fizik – atalet modelini doğru bir şekilde oluşturdu ve enerji kaybını hesaba katarak analitik yanıtla eşleşti.
  • Programlama – derlenen, çalışan ve altı harici kontrolün tamamından geçen bir kod oluşturdu. Dahili bir test doğrulaması (assertion) hatalıydı; bu da bize model tarafından oluşturulan testlerin kusursuz olmadığını hatırlattı.

Kimi K3

  • Matematik – token sınırına takıldı (önce 6.500, sonra 10.000 tokende) ve herhangi bir yanıt göstermeden durdu.
  • Fizik – görünür bir çıktı oluşmadan önce tokenları tükendi.
  • Programlama – 245 saniye sonra zaman aşımına uğradı ve değerlendirilecek hiçbir şey sunamadı.

Akıl yürütme verimliliği vs. ham güç

Üretim hatları (production pipelines) inşa eden herkes için sonuç açıktır: Çıktı vermeden token tüketen bir model, sonraki süreçleri durdurabilir, maliyetleri artırabilir ve kullanıcıları hayal kırıklığına uğratabilir.

Güvenilirlik ve "mükemmel" kodun gizli maliyeti

Kazanan model bile hata yaptı: GPT-5.6-SOL'un kendi oluşturduğu test vakası hatalı bir doğrulama (assertion) içeriyordu. Bu, model tarafından üretilen doğrulamaların insan incelemesinin yerini tutamayacağını gösteriyor. Bir model kod yazdığında, yine de bağımsız kontroller yapmanız gerekir.

Bundan sonra nelere dikkat edilmeli

  • Bitiş nedeni takibi – bir yanıtın token sınırına ulaştığı, zaman aşımına uğradığı veya doğal bir duruşla sona erdiği kaydedilmeli.
  • Akıl yürütme token sayısı – her modelin dahili düşünme süreci ile nihai çıktı için ne kadar token harcadığını karşılaştırın.
  • Gecikme (latency) izleme – her adım için gerçek zamanı ölçün; sorgu başına dakikalarca süren bir model, etkileşimli uygulamalar için uygun olmayabilir.

Geliştiriciler bu metrikleri sadece nihai yanıt olarak değil, birinci sınıf sinyaller olarak değerlendirmelidir.

Özetle

GPT-5.6-SOL, eksiksizlik konusunda Kimi K3'ten daha iyi performans gösteriyor. Test ayrıca, "doğru yapan" bir modelin bile hatalı dahili kontroller üretebileceğini hatırlatıyor, bu nedenle insan denetimi vazgeçilmez olmaya devam ediyor. Bitiş nedenlerini, token kullanımını ve gecikmeyi takip etmek, sessiz bir zaman aşımına yakalanmadan iş için doğru aracı seçmenize yardımcı olacaktır.