Gemini 3.5 Transcribe Resmi Rilis, Ubah Suara Jadi Teks dengan Akurasi 2,6% WER

Penulis: Vikri Alfandi  •  Kamis, 27 Agustus 2026 | 02:26:02 WIB
Google resmi merilis Gemini 3.5 Transcribe, model pengubah suara menjadi teks dengan tingkat akurasi Word Error Rate (WER) sebesar 2,6 persen untuk mode non-streaming.

SULAWESI UTARA — Google memperkenalkan Gemini 3.5 Transcribe sebagai model pengubah suara menjadi teks (speech-to-text) paling akurat yang pernah mereka buat. Model ini dirancang untuk mengatasi kelemahan sistem pengenalan suara konvensional yang sering gagal di tengah kebisingan, istilah teknis yang rumit, atau ucapan yang tidak lancar.

Alih-alih sekadar menyalin kata per kata, Gemini 3.5 Transcribe langsung mengubah audio mentah menjadi teks yang rapi dan terformat. Model ini bahkan bisa memahami koreksi spontan seperti "rapat hari Selasa—eh, Rabu" dan otomatis membuang kata pengisi seperti "anu", "eee", atau "hmm" dari hasil akhir.

Akurasi dan Dukungan Bahasa

Berdasarkan pengukuran Artificial Analysis, model ini mencatatkan Word Error Rate (WER) rata-rata 4,0 persen untuk transkripsi streaming dan 2,6 persen untuk non-streaming. WER adalah persentase kesalahan dalam menyalin kata—semakin rendah angkanya, semakin akurat hasilnya.

Google menyebut model ini menunjukkan performa kuat di lingkungan bising dunia nyata, termasuk saat menangkap elemen alfanumerik seperti kode pos dan nomor order. Model ini juga mampu mendeteksi dan mentranskripsikan lebih dari 85 bahasa secara otomatis, lengkap dengan aksen regional dan dialek yang beragam.

Untuk kebutuhan transkripsi audio rekaman, Gemini 3.5 Transcribe bisa mengidentifikasi hingga tiga pembicara berbeda dengan timestamp. Dukungan untuk lebih dari tiga pembicara masih dalam tahap eksperimental.

Kustomisasi Kosakata dan Eksekusi Perintah

Salah satu keunggulan utama model ini adalah kemampuan mengenali kosakata khusus. Pengguna bisa memberikan daftar istilah atau jargon spesifik, dan model akan menyesuaikan transkripsinya secara otomatis. Ini sangat berguna untuk bidang medis, hukum, atau teknologi yang penuh dengan istilah unik dan ejaan khusus.

Gemini 3.5 Transcribe juga mendukung function calling, yang memungkinkan model "menjalankan tugas kompleks" seperti pembuatan gambar atau analisis file dengan mendelegasikannya ke model Gemini lain. Kemampuan ini terlihat pada fitur Speak to Window di aplikasi Gemini untuk macOS.

Peningkatan Signifikan dari Pendahulu

Dibandingkan model Chirp 3 yang dirilis 2025, Google menyebut Gemini 3.5 Transcribe menghadirkan lompatan besar di berbagai aspek. Waktu hingga transkripsi final membaik 70 persen. Pada benchmark FLEURS, model ini mencapai WER 5,50 persen untuk mode streaming dan 5,04 persen untuk non-streaming—angka yang lebih baik dari Chirp 3.

Selain di aplikasi Gemini macOS dan Gboard Rambler di Android, model ini juga tersedia di kotak mikrofon Google Antigravity. Di sana, Gemini 3.5 Transcribe "memasangkan konteks layar dan riwayat chat, dengan izin pengguna, untuk memastikan akurasi transkripsi yang presisi" pada nama file, pemikiran agen, dan dokumen aktif.

Ketersediaan untuk Pengembang dan Enterprise

Langkah berikutnya, model ini akan hadir di browser Chrome sehingga pengguna bisa "mengetik dengan suara di kolom web mana pun"—memudahkan menulis balasan, menyusun draf postingan, atau memberi perintah ke Gemini secara lebih natural.

Bagi pengembang, Gemini 3.5 Transcribe sudah tersedia dalam public preview di Gemini API melalui Google AI Studio dan Google Antigravity. Untuk kebutuhan enterprise, model ini bisa diakses lewat Gemini Enterprise Agent Platform dan akan segera hadir di Gemini Enterprise for Customer Experience.

Kehadiran model ini menandai perubahan cara kita berinteraksi dengan perangkat—tidak lagi sekadar perintah suara sederhana, tetapi percakapan natural yang langsung dieksekusi menjadi tindakan. Bagi pengguna yang sering mengetik dokumen panjang atau merekam notulen rapat, fitur transkripsi otomatis yang rapi ini bisa menghemat waktu secara signifikan.

Reporter: Vikri Alfandi
Sumber: 9to5google.com This article was automatically rewritten by AI based on the source above without altering the facts of the original article.
Back to top