Google meluncurkan Gemini 3.5 Transcribe pada hari Selasa. Model speech-to-text ini menghilangkan kata pengisi (filler words), menghormati kosakata yang diberikan pengguna, dan menandai hingga tiga pembicara dalam satu rekaman. Dengan mengubah audio mentah menjadi teks terstruktur yang rapi tanpa editor manusia, layanan ini memangkas waktu yang dihabiskan pengembang untuk membersihkan transkrip untuk catatan rapat, dokumen hukum, dan lainnya.

Mengapa Google meluncurkannya sekarang

Tumpukan pemrosesan audio Google telah berkembang selama bertahun-tahun, tetapi penawaran sebelumnya, Chirp 3, masih sering kesulitan dengan jeda, istilah teknis, dan pergantian pembicara. Kerja jarak jauh dan podcast telah memperbesar pasar transkripsi, namun banyak perusahaan masih mengandalkan pemrosesan pasca-manual atau vendor khusus yang mahal. Gemini 3.5 Transcribe menjawab titik hambatan tersebut: sebuah model yang tidak hanya mengenali ucapan tetapi juga menyuntingnya secara langsung.

Apa yang sebenarnya dilakukan model baru ini

  • Penghapusan kata pengisi otomatis – “um”, “uh” dan ketidakteraturan serupa menghilang saat transkrip dibuat, menghasilkan hasil bacaan yang lebih bersih.
  • Kosakata khusus – Pengguna mengunggah daftar kata spesifik domain, mencegah model untuk “mengoreksi” kata-kata tersebut menjadi istilah umum. Hal ini penting untuk bidang yang penuh dengan akronim, nama produk, atau ejaan asing.
  • Atribusi pembicara – Sistem mengidentifikasi hingga tiga suara yang berbeda, memberikan label pembicara pada setiap ucapan, dan menambahkan stempel waktu (timestamp) tingkat kata. Tim hukum, penulis medis, dan jurnalis dapat menghasilkan catatan berkode waktu langsung dari file sumber.
  • Jangkauan multibahasa – Google mengklaim peningkatan akurasi di lebih dari 85 bahasa, sebuah peningkatan dari set bahasa pendahulunya yang lebih terbatas.

Semua kemampuan ini tersedia di balik API yang berfokus pada pengembang. Aplikasi meminta transkrip dan menerima payload JSON yang sudah berisi teks yang telah dibersihkan, tag pembicara, dan stempel waktu.

Peluncuran audio Gemini yang lebih luas

Gemini 3.5 Transcribe merupakan bagian dari keluarga model audio yang lebih luas:

  • Gemini 3.5 Live – Dioptimalkan untuk interaksi waktu nyata, model ini menangani interupsi di tengah kalimat dengan lebih baik daripada model live sebelumnya.
  • Gemini 3.5 Live Experimental – Varian penalaran tingkat tinggi yang menarasikan pemikiran langkah demi langkahnya sendiri saat menyelesaikan tugas-tugas kompleks.

Kedua model live tersebut saat ini tersedia dalam bahasa Inggris di aplikasi macOS Gemini dan melalui fitur dikte Rambler di Android di beberapa wilayah.

Siapa yang akan diuntungkan

Pengembang dapat menyematkan alur kerja “clean-as-you-speak” ke dalam alat kolaborasi, platform pembuatan konten, dan asisten berbasis suara. Perusahaan dapat menghasilkan transkrip yang siap diterbitkan, mengurangi ketergantungan pada layanan pihak ketiga yang mengenakan biaya per menit dan menerapkan klausul penanganan data yang ketat. Kreator konten dapat menerbitkan takarir (caption) yang rapi tanpa proses penyuntingan terpisah, sehingga mempercepat proses pembuatan video dan podcast.

Siapa yang mungkin terdampak

Vendor transkripsi spesialis yang mengenakan tarif premium untuk diarization pembicara dan penanganan jargon mungkin akan melihat penurunan permintaan, terutama di kalangan startup yang sensitif terhadap biaya. Batasan tiga pembicara pada model ini juga dapat mendorong organisasi yang lebih besar untuk beralih ke solusi khusus yang mendukung lebih banyak peserta dalam satu panggilan.

Batasan dan pertanyaan terbuka

  • Jumlah pembicara – Hanya tiga pembicara yang dapat dibedakan per file; rapat dengan panel yang lebih besar masih akan membutuhkan alat eksternal.
  • Peluncuran bahasa – Dukungan multibahasa telah diumumkan, tetapi model live tetap hanya tersedia dalam bahasa Inggris, membuat pengguna non-Inggris menunggu fungsionalitas penuh.
  • Privasi – Seperti layanan ucapan berbasis cloud lainnya, perusahaan harus menimbang kenyamanan infrastruktur Google dengan kebutuhan untuk menjaga audio sensitif agar tidak berada di server eksternal. Ketentuan Google memungkinkan penerapan on-premise untuk pelanggan tertentu, tetapi opsi tersebut belum tersedia untuk umum.

Apa yang perlu diperhatikan selanjutnya

Google telah mengisyaratkan pembaruan di masa mendatang yang akan meningkatkan batas jumlah pembicara dan memperluas cakupan model live ke bahasa tambahan. Memantau tingkatan harga API juga akan menjadi hal yang penting; biaya per menit yang tinggi dapat mengikis keuntungan produktivitas bagi pengguna bervolume tinggi. Terakhir, kurva adopsi di kalangan pengembang akan mengungkapkan apakah kemudahan penghapusan kata pengisi otomatis lebih berharga daripada kesalahan sisa dalam kosakata khusus.

Intisari: Gemini 3.5 Transcribe mengubah tugas membosankan dalam memoles rekaman suara menjadi satu panggilan API saja, memberikan pengembang alat siap pakai untuk teks yang bersih dan berlabel pembicara. Keberhasilannya bergantung pada seberapa cepat Google memperluas dukungan bahasa, meningkatkan batas jumlah pembicara, dan menangani kekhawatiran privasi perusahaan.