OpenAI menyatakan bahwa model GPT-5.6 Sol miliknya mencapai tingkat keberhasilan 38,3% pada tolok ukur penalaran logis ARC-AGI-3, melampaui Claude Opus 5 milik Anthropic yang berada di angka 30,2%. Keunggulan ini hanya muncul ketika model dijalankan di balik Responses API khusus milik OpenAI, yang menambahkan dua trik waktu inferensi yang tidak diizinkan oleh perangkat pengujian resmi.

Latar belakang: perlombaan senjata tolok ukur

ARC-AGI-3 menguji kemampuan model untuk memecahkan masalah baru yang terdiri dari banyak langkah tanpa bergantung pada fakta yang telah dihafal. Awal tahun ini, Anthropic mengumumkan lonjakan empat kali lipat pada tolok ukur tersebut, menempatkan Opus 5 di puncak papan peringkat publik. Hasil tersebut menetapkan titik acuan baru untuk kapabilitas model "mentah" karena perangkat pengujian resmi membuang semua penalaran perantara setelah setiap langkah, sehingga memaksa model untuk memulai kembali dari awal setiap saat.

Klaim OpenAI muncul dalam iklim kompetitif yang sama. Dengan memublikasikan skor yang lebih tinggi, perusahaan tersebut memberi sinyal bahwa generasi terbarunya tidak hanya dapat menandingi tetapi juga melampaui performa logis rival utamanya. Namun, tajuk berita tersebut menutupi nuansa teknis yang sedang mengubah cara komunitas membaca tabel tolok ukur.

Apa arti sebenarnya dari angka-angka tersebut

Ketika GPT-5.6 Sol dievaluasi di bawah perangkat ARC-AGI-3 resmi yang sama yang memberikan hasil 30,2% pada Opus 5, tingkat keberhasilan model tersebut merosot menjadi 7,8%. Perubahan drastis ini bukanlah sebuah gangguan; melainkan hasil dari dua fitur rekayasa yang dibundel OpenAI dengan model tersebut:

  • Retained Reasoning – alih-alih menghapus rantai pemikiran (chain-of-thought) setelah setiap sub-tugas, sistem menjaga teks perantara tetap ada, memungkinkan model untuk merujuk kembali ke deduksi sebelumnya dan membangun argumen kumulatif.
  • Compaction – alih-alih memotong konteks lama agar tetap berada dalam batas token, wrapper tersebut mengompresi langkah-langkah sebelumnya menjadi ringkasan singkat, menjaga alur logika sambil tetap menjaga ukuran prompt agar tetap terkendali.

Kedua mekanisme tersebut terdapat dalam Responses API yang bersifat kepemilikan (proprietary). Dengan memberi model konteks yang lebih kaya dan berkelanjutan, OpenAI secara efektif meningkatkan "memori" model dan memungkinkannya menggunakan kembali penalaran itu sendiri. Sebaliknya, perangkat pengujian resmi menerapkan mode "stateless" yang ketat yang menghilangkan keuntungan-keuntungan tersebut.

Mengapa metodologi ini penting

Peristiwa ini menyoroti perpecahan yang berkembang dalam evaluasi AI: skor model mentah versus performa tingkat sistem. OpenAI berpendapat bahwa sebuah tolok ukur harus mencerminkan seluruh tumpukan (stack) yang akan benar-benar diterapkan oleh pengembang – model, alur kerja (pipeline) inferensi, dan manajemen memori. Dari sudut pandang tersebut, skor 38,3% memberi tahu tim produk bahwa penawaran gabungan tersebut dapat menyelesaikan lebih banyak tugas dunia nyata daripada model yang dievaluasi secara terisolasi.

Para kritikus mengatakan hal ini mengaburkan kemajuan ilmiah. Jika setiap laboratorium menambahkan wrapper khusus, papan peringkat akan menjadi kumpulan trik rekayasa alih-alih perbandingan kecerdasan model yang bersih. Perangkat ARC-AGI-3 resmi ada untuk menciptakan arena bermain yang setara, memastikan angka yang lebih tinggi menandakan model dasar yang benar-benar lebih kuat, bukan wrapper yang lebih cerdas.

Taruhan bagi pengembang dan investor

Bagi startup yang membangun produk berbasis AI, perbedaannya bersifat praktis. Model yang dapat mempertahankan penalaran dan mengompresi konteks mungkin membutuhkan lebih sedikit rekayasa prompt (prompt engineering), latensi inferensi yang lebih rendah, dan lebih sedikit panggilan API untuk mencapai solusi. Hal ini diterjemahkan menjadi biaya komputasi yang lebih murah dan pengalaman pengguna yang lebih lancar. Perusahaan yang meluncurkan sistem siap pakai (turnkey system) – model ditambah lapisan inferensi yang dioptimalkan – memperoleh keunggulan kompetitif di mana kecepatan dan biaya menjadi faktor penting.

Investor mengamati kenaikan tolok ukur sebagai proksi untuk pendapatan masa depan. Keunggulan yang menarik perhatian media dapat meningkatkan valuasi sebuah perusahaan, meskipun kapabilitas mentah model dasarnya setara dengan rival. Oleh karena itu, perdebatan tentang apa yang diwakili oleh angka-angka tersebut memengaruhi bagaimana modal mengalir di seluruh sektor AI.

Apa yang perlu diperhatikan selanjutnya

  • Respons pembuat standar – penyelenggara tolok ukur mungkin akan memperketat aturan seputar trik inferensi "eksternal" atau menambahkan jalur "sistem" terpisah yang secara eksplisit mengizinkannya. Respons mereka akan membentuk gelombang papan peringkat publik berikutnya.
  • Open-source wrappers – jika komunitas merilis implementasi mereka sendiri untuk retained reasoning dan compaction, keunggulan tersebut dapat menjadi fitur dasar alih-alih keunggulan eksklusif.
  • Tempat pengujian dunia nyata – perusahaan semakin banyak mengunggah performa pada set masalah milik sendiri (misalnya, rangkaian pembuatan kode internal). Hasil-hasil tersebut, meskipun kurang dapat dibandingkan, akan mulai menjadi lebih penting daripada satu tolok ukur publik tunggal.

Argumen tandingan: apakah ini "memanipulasi" tolok ukur?

Beberapa peneliti melabeli penggunaan API khusus sebagai “benchmark gaming,” dengan argumen bahwa hal tersebut menggelembungkan skor tanpa memajukan pemahaman inti model. Mereka menunjukkan bahwa model yang performanya anjlok ke angka satu digit di bawah batasan yang ketat masih jauh dari tujuan AGI. Kekhawatirannya adalah bidang ini mungkin mulai menghargai jalan pintas rekayasa dibandingkan lompatan nyata dalam kemampuan penalaran.

Pihak OpenAI menekankan bahwa batasan antara model dan sistem menjadi semakin artifisial. Aplikasi AI modern jarang menjalankan model dalam ruang hampa; mereka selalu berada di balik lapisan penyajian yang menangani caching, penyambungan konteks, dan pasca-pemrosesan output. Dari sudut pandang tersebut, mengukur seluruh alur kerja memberikan gambaran yang lebih jujur tentang apa yang sebenarnya dialami pengguna.

Kesimpulan

Kisah GPT-5.6 Sol menunjukkan bahwa kemenangan benchmark saat ini sangat bergantung pada rekayasa inferensi sebagaimana halnya pada ukuran model. Apakah komunitas akan menerima skor tingkat sistem atau membatasi penggunaan wrapper khusus akan menentukan bagaimana kita membaca tajuk berita “leaderboard” berikutnya. Bagi siapa pun yang membangun atau mendanai produk AI, pelajarannya jelas: angka mentah itu penting, tetapi perangkat lunak di sekitarnya dapat menjadi faktor penentu dalam performa dunia nyata.