Google Gemini mengenakan biaya 258 token untuk gambar apa pun hingga ukuran 384 × 384 px. Jika gambar melebihi ukuran tersebut, Gemini menambahkan biaya 258 token lainnya untuk setiap ubin berukuran 768 × 768 px. Oleh karena itu, gambar berukuran 500 × 500 px memiliki biaya yang sama dengan gambar 384 × 384 px, sementara bingkai 1920 × 1080 px mencakup enam ubin dan menggunakan 1.548 token. Bagi pengembang yang membayar per token, melewati batas 768 piksel dapat mengubah biaya sebesar 75 %.
Cara Gemini menetapkan harga gambar
Gemini memperlakukan gambar sebagai kisi-kisi patch visual. Sebuah persegi 384 piksel terbagi menjadi 256 patch; dua token tambahan menandai awal dan akhir urutan visual, sehingga menghasilkan harga tetap 258 token. Apa pun yang lebih besar akan memicu langkah pembagian ubin: sistem memotong gambar menjadi ubin berukuran 768 piksel, mengevaluasi setiap ubin secara independen, dan menagih masing-masing sebesar 258 token.
Jumlah token berskala sesuai dengan jumlah ubin, bukan piksel mentah. Foto berukuran 1280 × 720 px menempati dua ubin (258 × 2 = 516 token). Bingkai 4K berukuran 3840 × 2160 px mencakup lima belas ubin, dengan biaya 3.870 token. Aturannya sederhana—hitung jumlah kotak 768 piksel yang ditempati gambar, kalikan dengan 258, dan Anda akan mendapatkan tagihan tokennya.
Mengapa aturan ini penting
Model token Gemini berdampak langsung pada biaya API.
Cara praktis untuk mengurangi tagihan
- Tetap di bawah batas ubin. Gambar berukuran 800 × 800 px terbagi menjadi empat ubin 768 piksel, dengan biaya 1.032 token—empat kali lipat harga gambar 768 × 768 px. Ubah ukuran ke batas ubin yang tepat dan hemat 75 %.
- Potong ruang kosong. Margin putih yang besar tetap menghasilkan patch yang dihitung ke dalam total token. Memotong margin tersebut dapat memangkas biaya hingga dua pertiga.
- Perhatikan keterbacaan OCR. Gemini hanya membaca teks jika karakter memiliki tinggi sekitar 15–20 px. Jika Anda memperkecil ukuran dokumen di bawah ambang batas tersebut, model akan melewatkan kata-kata, sehingga memaksa penggunaan input teks yang mungkin lebih mahal.
- Terapkan aturan tinggi-per-baris. Untuk dokumen teks biasa, targetkan tinggi gambar total yang sama dengan jumlah baris dikalikan 25 px. "Formula emas" ini menjaga jarak baris tetap terbaca sambil tetap berada dalam satu ubin tunggal.
- Gunakan gambar untuk data padat. Tangkapan layar spreadsheet besar atau persamaan LaTeX sering kali memuat lebih banyak informasi per token daripada mengetik data yang sama. Saat kepadatan tinggi, biaya 258 token untuk gambar bisa lebih murah daripada beban teks yang setara.
Kapan gambar lebih unggul daripada teks
Ekonomi token berbalik menguntungkan gambar untuk beberapa jenis konten:
- Skrip non-Latin. Aksara Hindi, Mandarin, Arab, dan sejenisnya memerlukan banyak karakter untuk menyampaikan ide singkat; setiap karakter tetap menjadi satu token dalam mode teks, sementara visual yang sama dapat masuk dalam satu ubin gambar.
- Notasi matematika yang kompleks. Formula LaTeX membengkak dalam jumlah token. Gambar formula yang telah dirender tetap berada dalam satu ubin, sering kali biayanya lebih murah daripada string LaTeX mentah.
- Tata letak UI atau tabel yang besar. Merender mockup UI layar penuh atau tabel multi-halaman sebagai gambar menghindari kebutuhan untuk mendeskripsikan setiap elemen dalam bentuk prosa, sehingga mengompres informasi ke dalam beberapa ubin saja.
Kompromi
Mengurangi ukuran gambar secara sembarangan dapat berdampak buruk. Jika karakter mengecil di bawah minimum 15 piksel, OCR Gemini akan gagal dan pengembang harus beralih ke pengiriman teks mentah—yang berpotensi membengkakkan tagihan token. Pemotongan yang terlalu agresif juga dapat memotong konteks yang dibutuhkan model untuk menjawab dengan benar. Titik idealnya adalah perubahan ukuran moderat yang menghormati batas ubin sambil tetap menjaga keterbacaan.
Kesimpulan
Memahami aritmetika token gambar Gemini mengubah biaya tersembunyi menjadi variabel yang dapat dikendalikan. Jaga gambar pada atau di bawah 768 px, potong spasi putih yang tidak perlu, dan pastikan teks tetap terbaca untuk menghemat puluhan atau ratusan token dari setiap permintaan. Untuk konten padat data—skrip non-Latin, matematika, tabel—gambar sering kali memberikan wawasan yang sama dengan harga token yang jauh lebih murah. Pra-pemrosesan yang cerdas, bukan sekadar memperkecil ukuran secara buta, adalah kunci untuk integrasi Gemini yang efisien.
Sumber: dev.to/kushaagr
