DeepSeek telah melancarkan model ketersediaan umum (GA) V4 Pro. Pengukuran awal menunjukkan ia mengurangkan penggunaan token penaakulan sebanyak 18% hingga 62% berbanding binaan pratonton. Ini penting bagi sesiapa yang membayar mengikut token: prom yang sama kini menelan kos yang jauh lebih rendah sambil masih menghasilkan output yang setanding.
Apa yang mendorong perbandingan ini
Pelancaran GA tiba tanpa catatan blog atau log perubahan, jadi pembangun terpaksa mencari perbezaan tersebut sendiri. Satu ujian komuniti menjalankan tugasan yang serupa pada kedua-dua versi dan mendapati perubahan terbesar—penurunan mendadak dalam jumlah token yang digunakan model untuk "berfikir" sebelum menjawab. Untuk carian ringkas, model GA menggunakan 62% kurang token penaakulan; untuk pertanyaan yang lebih kompleks, pengurangannya adalah sebanyak 18%.
Kecekapan token dan impaknya
Dalam aliran kerja pengekstrakan tipikal, binaan pratonton menggunakan 159 token penaakulan untuk menarik beberapa medan daripada satu prom. Beralih ke binaan GA dengan ciri "berfikir" (thinking) dinyahaktifkan telah mengurangkan jumlah tersebut kepada 40 token sahaja. Bagi pengguna dengan pelan bermeter, penjimatan ini diterjemahkan secara langsung kepada bil yang lebih rendah, terutamanya pada skala besar.
Pengekstrakan JSON: rintangan tersembunyi
Kedua-dua binaan mengalami masalah apabila mod "berfikir" diaktifkan: ia melepasi semakan skema JSON tetapi memasukkan nilai numerik yang salah. Hanya versi GA yang mengembalikan JSON yang betul apabila fungsi "berfikir" dimatikan. Pasukan yang memerlukan output berstruktur harus menyahaktifkan flag thinking untuk tugasan pengekstrakan, jika tidak mereka akan menerima data yang sah dari segi sintaks tetapi salah dari segi numerik.
Pengendalian penolakan mengubah keadaan
Model pratonton boleh menolak soalan yang dianggap tidak boleh dijawab dengan membalas "Saya tidak tahu." Model GA tidak lagi berbuat demikian. Sebaliknya, ia sama ada kehabisan bajet token tanpa menjawab atau mereka-reka jawapan. Perubahan ini meningkatkan kecekapan token tetapi menghapuskan jaring keselamatan yang menghalang model daripada berhalusinasi tentang topik yang tidak diketahui.
Peningkatan kebolehpercayaan
Satu gelung berbahaya dalam binaan pratonton—yang dicetuskan oleh bajet "berfikir" yang sederhana—boleh menyebabkan model mengulang teks yang sama sehingga tetingkap 8,192-token penuh. Pelancaran GA membaiki pepijat ini, menamatkan pengulangan tanpa kawalan yang sebelum ini berisiko menghabiskan tetingkap permintaan dan melambungkan kos.
Perkara yang perlu diperhatikan oleh pengguna
- Gunakan binaan GA untuk jumlah token yang lebih rendah. Pengurangan yang diukur kekal konsisten merentasi kompleksitas tugasan.
- Matikan fungsi "thinking" untuk sebarang pengekstrakan JSON atau data berstruktur. Ini akan menghasilkan nilai yang betul dan mengekalkan penggunaan token pada tahap minimum.
- Jangan bergantung pada penolakan terbina dalam. Jika prom meminta data yang tidak dapat disahkan, model GA mungkin masih memberikan jawapan, jadi pengesahan hiliran (downstream validation) tetap penting.
- Perhatikan pengebilan waktu puncak. Peraturan harga baharu menyebabkan penggunaan token semasa tempoh trafik tinggi memberi kesan kepada perbelanjaan keseluruhan dengan lebih ketara berbanding sebelum ini.
Kesimpulan
Model GA V4 Pro DeepSeek memberikan kemenangan kecekapan yang jelas—sehingga 62% kurang token penaakulan—dan membaiki pepijat pengulangan yang kritikal. Walau bagaimanapun, kehilangan respons penolakan yang eksplisit dan keperluan untuk menyahaktifkan fungsi "thinking" bagi output JSON yang tepat menambah pertimbangan baharu. Pasukan yang menyesuaikan saluran paip (pipelines) mereka boleh mengurangkan kos tanpa mengorbankan kefungsian.
Sumber: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l
