DeepSeek meluncurkan V4-Flash-Vision-Exp, sebuah model multimodal eksperimental yang menurutnya memiliki performa pada benchmark agen internal yang hampir setara dengan Anthropic Opus 4.8, sambil tetap menjaga biaya token setiap gambar dibatasi pada 384. Peluncuran ini memberikan alternatif fast-flash bagi pengembang untuk tugas AI visual yang menjanjikan kecepatan lini V4-Flash DeepSeek dengan kemampuan untuk melakukan penalaran terhadap gambar.
Mengapa pengumuman ini penting
Agen multimodal—sistem yang dapat melihat, membaca, dan bertindak—kini berada di pusat pengembangan alat otonom. Tim menggunakannya untuk bot dukungan pelanggan yang membaca tangkapan layar dan asisten riset yang mengurai diagram. Opus 4.8 dari Anthropic menetapkan standar yang tinggi, tetapi harga dan latensinya membuat banyak pihak menahan diri untuk menggunakannya. Klaim DeepSeek mengenai performa yang hampir setara dengan biaya token yang jauh lebih kecil dapat mengubah kalkulasi biaya-manfaat bagi siapa pun yang mempertimbangkan fitur visi dalam alur kerja mereka.
Bagaimana DeepSeek membangun model ini
Model baru ini memperluas arsitektur V4-Flash milik DeepSeek yang sudah ada, yang telah dioptimalkan untuk penalaran teks cepat dan konsumsi token yang rendah. Dengan menyambungkan front-end pemrosesan gambar ke inti tersebut, DeepSeek mempertahankan kekuatan pengetahuan dunia dan penalaran model dasar sambil menambahkan pemahaman visual.
Pilihan teknis utama meliputi:
- Deteksi format otomatis – model membaca konten biner gambar untuk memutuskan apakah itu JPEG, PNG, GIF, atau WebP, guna menghindari kesalahan akibat nama file yang salah label.
- Pengubahan ukuran adaptif – gambar yang masuk dinormalisasi menjadi sekitar 800 × 800 piksel. Pengembang dapat meminta mode detail rendah yang memaksakan ukuran 512 × 512, guna memangkas penggunaan token lebih lanjut.
- Batas atas token – terlepas dari resolusi aslinya, model tidak pernah mengenakan biaya lebih dari 384 token per gambar, sehingga penganggaran menjadi lebih terprediksi.
DeepSeek juga merilis versi 0.1.1 dari framework Harness miliknya, yang membundel model baru tersebut dan menawarkan adapter siap pakai untuk OpenAI Chat Completions dan Responses API serta endpoint Messages milik Anthropic. Tim dapat memasukkan model ini ke dalam basis kode yang sudah ada hanya dengan beberapa perubahan konfigurasi.
Apa yang didapatkan pengembang
- Dukungan gambar yang luas – JPEG, PNG, GIF, dan WebP diterima, dan model dapat menyerap data melalui string Base64, URL publik (hingga 32 MiB), atau Files API gratis dari DeepSeek. Files API menyimpan satu unggahan hingga 64 MiB dan memungkinkan Anda merujuknya berdasarkan ID di berbagai giliran (turns), sehingga mengurangi pengunggahan berulang dalam percakapan panjang.
- Konteks volume tinggi – satu permintaan dapat membawa hingga 600 gambar. Panjang sisi maksimum per gambar adalah 8.192 piksel, turun menjadi 4.096 piksel ketika sebuah permintaan berisi 15 gambar atau lebih, yang membantu menjaga waktu pemrosesan tetap terkendali.
- Tugas yang siap untuk agen – model ini dioptimalkan untuk beban kerja "agentic": mendeskripsikan pemandangan kompleks, mengekstrak teks dari tangkapan layar, dan menganalisis diagram yang rumit. Karena tetap mempertahankan kecepatan penalaran V4-Flash, model ini dapat merajut petunjuk visual ke dalam rantai pemikiran (chains of thought) yang lebih luas tanpa menjadi hambatan (bottleneck).
Fitur-fitur ini menjawab kendala umum pengembang: menangani banyak gambar dalam satu sesi, menghindari pembengkakan token, dan mengintegrasikan visi tanpa harus menulis ulang panggilan API.
Potensi batasan
Klaim performa DeepSeek didasarkan pada benchmark agen multimodal internal. Pengujian tersebut mungkin melewatkan variabilitas dunia nyata—foto yang penuh gangguan (noisy), kondisi cahaya rendah, atau format file yang tidak biasa. Label "eksperimental" juga mengisyaratkan bahwa model ini mungkin masih dalam tahap memperbaiki masalah stabilitas dan penskalaan.
Desain yang mengutamakan kecepatan seperti V4-Flash biasanya mengorbankan kedalaman representasi yang dicapai oleh model yang lebih besar dan lebih lambat. Batas atas token menjaga biaya tetap rendah tetapi membatasi detail visual, yang dapat menghambat tugas-tugas yang membutuhkan analisis mendalam (misalnya, membaca font kecil atau mengenali perbedaan tekstur yang halus).
Terakhir, keterikatan ekosistem (ecosystem lock-in) tetap menjadi pertimbangan. Meskipun DeepSeek meniru struktur API OpenAI dan Anthropic, pengembang tetap harus mengelola penyedia terpisah, autentikasinya, dan kemungkinan perubahan harga di masa mendatang. Tim yang sudah sangat bergantung pada satu vendor mungkin akan menimbang upaya integrasi terhadap proyeksi penghematan.
Apa yang perlu diperhatikan
- Evaluasi independen – tolok ukur pihak ketiga akan menjadi pengujian nyata pertama terhadap klaim “mendekati Opus 4.8”. Perhatikan hasil pada dataset publik seperti VQAv2 atau CLEVR yang menekankan pada penalaran dan fidelitas visual.
- Pembaruan harga – DeepSeek menonjolkan efisiensi token, tetapi biaya aktual per gambar 384-token akan menentukan apakah model ini benar-benar lebih murah dibandingkan kompetitor.
- Peluncuran fitur – rilis Harness di masa mendatang dapat menambahkan pemrosesan batch, output streaming, atau integrasi yang lebih erat dengan alat orkestrasi agen yang populer, sehingga memperluas kegunaan model tersebut.
- Adopsi komunitas – kecepatan pengembang dalam merilis plugin, wrapper, atau studi kasus akan menunjukkan apakah kompatibilitas API model tersebut dapat diterjemahkan ke dalam penggunaan praktis.
Kesimpulan
V4-Flash-Vision-Exp milik DeepSeek menghadirkan agen multimodal yang cepat dan hemat token ke pasar dengan klaim performa yang mendekati Opus 4.8 milik Anthropic. Jika tolok ukur internalnya terbukti akurat, model ini bisa menjadi pilihan utama bagi pengembang yang membutuhkan kemampuan visi tanpa biaya tinggi dari model skala frontier, sembari tetap menghadapi kompromi biasa dari AI eksperimental yang berfokus pada kecepatan.
