DeepSeek telah merilis model V4 Pro general-availability (GA). Pengukuran awal menunjukkan bahwa model ini memangkas penggunaan token penalaran (reasoning token) sebesar 18% hingga 62% dibandingkan dengan versi preview. Hal ini sangat penting bagi siapa pun yang membayar per token: prompt yang sama kini biayanya jauh lebih murah namun tetap menghasilkan output yang sebanding.
Apa yang memicu perbandingan ini
Rilis GA hadir tanpa postingan blog atau changelog, sehingga para pengembang harus menemukan perbedaannya sendiri. Sebuah pengujian komunitas menjalankan tugas yang identik pada kedua versi dan menemukan perubahan terbesar—penurunan drastis pada jumlah token yang dihabiskan model untuk “berpikir” sebelum menjawab. Pada pencarian sederhana, model GA menggunakan 62% lebih sedikit token penalaran; pada kueri yang lebih kompleks, pengurangannya adalah 18%.
Efisiensi token dan dampaknya
Dalam alur kerja ekstraksi tipikal, versi preview menghabiskan 159 token penalaran untuk mengambil beberapa field dari sebuah prompt. Beralih ke versi GA dengan fitur “thinking” dinonaktifkan memangkas angka tersebut menjadi hanya 40 token. Bagi pengguna dengan paket berbasis penggunaan (metered plans), penghematan ini langsung berdampak pada tagihan yang lebih rendah, terutama dalam skala besar.
Ekstraksi JSON: kendala tersembunyi
Kedua versi mengalami kendala saat mode “thinking” aktif: mereka lolos pemeriksaan skema JSON tetapi memasukkan nilai numerik yang salah. Hanya versi GA yang mengembalikan JSON yang benar saat “thinking” dimatikan. Tim yang membutuhkan output terstruktur harus menonaktifkan flag thinking untuk tugas ekstraksi, jika tidak, mereka akan menerima data yang valid secara sintaksis tetapi salah secara numerik.
Penanganan penolakan (refusal) berubah drastis
Model preview dapat menolak pertanyaan yang dianggap tidak dapat dijawab dengan membalas “I do not know.” Model GA tidak lagi melakukan hal ini. Sebaliknya, model tersebut akan kehabisan anggaran token tanpa menjawab atau malah mengarang jawaban. Perubahan ini meningkatkan efisiensi token tetapi menghilangkan jaring pengaman yang mencegah model berhalusinasi pada topik yang tidak diketahui.
Peningkatan keandalan
Sebuah loop berbahaya pada versi preview—yang dipicu oleh anggaran “thinking” yang terbatas—dapat membuat model mengulang teks yang sama hingga jendela 8.192 token penuh. Rilis GA memperbaiki bug ini, menghentikan pengulangan tak terkendali yang sebelumnya berisiko menghabiskan jendela permintaan dan membengkakkan biaya.
Apa yang harus diperhatikan pengguna
- Gunakan versi GA untuk jumlah token yang lebih rendah. Pengurangan yang terukur tetap konsisten di berbagai tingkat kompleksitas tugas.
- Matikan fitur “thinking” untuk ekstraksi JSON atau data terstruktur apa pun. Ini akan menghasilkan nilai yang benar dan menjaga penggunaan token tetap minimal.
- Jangan mengandalkan penolakan bawaan (built-in refusals). Jika sebuah prompt meminta data yang tidak dapat diverifikasi, model GA mungkin tetap memberikan jawaban, sehingga validasi lanjutan tetap sangat penting.
- Perhatikan penagihan pada jam sibuk. Aturan harga baru membuat konsumsi token selama periode trafik tinggi memengaruhi pengeluaran secara keseluruhan lebih tajam daripada sebelumnya.
Kesimpulan
Model V4 Pro GA dari DeepSeek memberikan kemenangan efisiensi yang nyata—pengurangan token penalaran hingga 62%—dan memperbaiki bug pengulangan yang kritis. Namun, hilangnya respons penolakan eksplisit dan kebutuhan untuk menonaktifkan fitur thinking demi output JSON yang akurat menambah pertimbangan baru. Tim yang menyesuaikan pipeline mereka dapat menurunkan biaya tanpa mengorbankan fungsionalitas.
Sumber: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l
