OpenAI mengumumkan bahawa model GPT-5.6 Sol miliknya mencapai skor 38.3 peratus dalam penanda aras logik ARC-AGI-3, mengatasi Claude Opus 5 milik Anthropic yang mencatatkan 30.2 peratus. Dakwaan tersebut mencetuskan pertikaian teknikal serta-merta kerana model yang sama hanya mencatatkan skor 7.8 peratus apabila dijalankan melalui kerangka ujian (test harness) rasmi penanda aras tersebut.
Mengapa skor ARC-AGI-3 penting
ARC-AGI-3 menguji keupayaan model untuk menyelesaikan masalah baharu yang memerlukan penaakulan tinggi, dan bukannya bergantung kepada corak yang telah dihafal. Penyelidik menyifatkan skor tersebut sebagai proksi bagi kemajuan "kecerdasan am" (general-intelligence), jadi kelebihan sepuluh mata kelihatan seperti satu langkah besar ke arah penyelesaian masalah seperti manusia. Hal itu sahaja sudah cukup menjelaskan mengapa berita tersebut tular dalam komuniti AI.
Tuas tersembunyi: Retained Reasoning dan Compaction
OpenAI tidak menilai GPT-5.6 Sol dengan kerangka ujian awam. Sebaliknya, ia menggunakan Responses API miliknya sendiri dengan dua pilihan proprietari:
- Retained Reasoning – mengekalkan rantaian pemikiran (chain of thought) model merentasi pelbagai langkah, bagi mengelakkan kehilangan logik perantaraan yang berlaku apabila setiap langkah dikendalikan secara berasingan.
- Compaction – memampatkan konteks terdahulu dan bukannya memotongnya, membolehkan model merujuk kepada sejarah yang lebih panjang dan diringkaskan.
Apabila tetapan tersebut aktif, model itu menyatukan hujah yang lebih panjang dan menggunakan semula deduksi terdahulu, sekali gus meningkatkan prestasi dalam tugasan pelbagai langkah. Dalam kerangka rasmi, yang membuang penaakulan selepas setiap tindakan, skor model yang sama merosot kepada 7.8 peratus, meletakkannya jauh di bawah Claude Opus 5.
OpenAI berhujah bahawa sesuatu penanda aras sepatutnya mengukur keseluruhan saluran inferens (inference pipeline), bukan sekadar pemberat neural (neural weights) mentah. Dari perspektif itu, "pembungkus" (wrapper) – iaitu logik API yang mengekalkan dan memampatkan konteks – adalah sebahagian daripada sistem yang sedang dinilai.
Debat keadilan
François Chollet, pengasas bersama ARC Prize yang menaja penanda aras tersebut, turut memberikan pandangan. Beliau membezakan antara kerangka tersuai yang dibina untuk "menyelesaikan" penanda aras dengan tetapan API tujuan am yang boleh diaktifkan oleh mana-mana pengguna. Chollet menyatakan bahawa persekitaran ujian ARC Prize yang asal menggunakan API completions gaya OpenAI yang lebih lama, yang tidak mempunyai ciri-ciri canggih yang kini tersedia dalam Claude API milik Anthropic. Ketidakpadanan itu mungkin telah merugikan OpenAI dalam pusingan terdahulu.
Beliau tidak menyatakan bahawa perbandingan itu tidak sah. Chollet berkata tuntutan secara langsung (head-to-head) tetap boleh diterima jika tetapan tepat dan sebarang kos berkaitan didedahkan. Ketelusan, hujah beliau, membolehkan komuniti menilai sama ada jurang tersebut berpunca daripada seni bina model, helah kejuruteraan, atau kedua-duanya sekali.
Siapa menang, siapa kalah
Jika skor yang lebih tinggi itu diterima bulat-bulat, OpenAI akan mendapat lonjakan persepsi awam dan kedudukan tawar-menawar yang lebih kuat dalam perbincangan pelesenan perusahaan. Pasukan Claude pula boleh merujuk kepada prestasi model mentah pada kerangka piawai sebagai bukti bahawa seni bina mereka lebih cekap apabila lapisan kejuruteraan tambahan dibuang.
Penyelidik dan pembangun yang bergantung kepada kedudukan penanda aras untuk memandu pelaburan mungkin mendapati episod ini meresahkan. Kes ini menunjukkan bahawa apabila model menjadi lebih besar, perisian yang menguruskan inferens mereka boleh menjadi penentu. Syarikat yang menawarkan timbunan inferens (inference stacks) yang canggih pada kos marginal yang rendah boleh mendominasi skor utama tanpa model asas yang lebih unggul.
Apa yang seterusnya untuk ARC-AGI-3 dan penanda aras lain
Pertikaian ini berkemungkinan akan mendorong penganjur ARC Prize ke arah peraturan yang lebih ketat mengenai konfigurasi inferens yang dibenarkan. Respons yang mungkin termasuk:
- Menerbitkan skor "tanda aras" (baseline) yang mencerminkan prestasi dengan kerangka rasmi sahaja.
- Mewajibkan peserta menyerahkan analisis kos bagi sebarang tetapan tambahan, supaya skor yang tinggi dapat dinilai berbanding kos pengkomputeran atau kos overhed kejuruteraan tambahan.
- Menambah trek "peringkat sistem" (system-level) berasingan yang memberi ganjaran kepada penggunaan ciri pengurusan konteks yang bijak.
Langkah sedemikian akan memaksa pengasingan yang lebih jelas antara keupayaan model mentah dan pengoptimuman kejuruteraan, menjadikan tuntutan masa hadapan lebih mudah untuk dibandingkan.
Hujah balas: Penanda aras harus mencerminkan penggunaan dunia nyata
Satu pihak berhujah bahawa pandangan "hanya-model-mentah" yang ketat adalah tidak realistik. Dalam pengeluaran (production), pembangun secara rutin menambah lapisan caching, ringkasan konteks, dan helah lain pada model bahasa. Jika sesuatu penanda aras bertujuan untuk meramalkan kegunaan praktikal, ia sepatutnya membenarkan – atau malah menggalakkan – pengoptimuman tersebut. Dari sudut itu, Retained Reasoning dan Compaction milik OpenAI adalah alat yang sah yang boleh diguna pakai oleh mana-mana pesaing, asalkan ia didokumentasikan secara awam.
Pengkritik berhujah bahawa tanpa garis dasar yang sama, skor akan menjadi sasaran yang sentiasa berubah, sekali gus menghakis peranan penanda aras sebagai kayu ukur yang objektif. Ketegangan antara kesahan ekologi (mencerminkan penggunaan sebenar) dan ketulenan metodologi (mengasingkan model) menyemarakkan kontroversi semasa.
Rumusan
Dakwaan GPT-5.6 Sol menonjolkan perpecahan yang semakin membesar dalam penilaian AI: bakat mentah model berbanding ekosistem kejuruteraan yang mengekstraknya. Selagi komuniti menuntut pendedahan penuh mengenai tetapan inferens dan kosnya, perdebatan ini akan menjadi lebih tajam dan bukannya mengaburkan pandangan kita terhadap kemajuan ke arah kecerdasan am.
