Google Melancarkan Gemini 3.5 Transcribe Versi Pratonton, Suara ke Teks Menyokong Lebih 85 Bahasa

Google mengeluarkan model suara ke teks khusus Gemini 3.5 Transcribe pada Ogos 2026, dalam pratonton awam, terbahagi kepada dua titik akhir iaitu pemprosesan fail dan penstriman masa nyata, menyokong pengasingan penutur, cap masa peringkat perkataan dan perbendaharaan kata tersuai. Bagi pembangun yang membuat minit mesyuarat, sari kata dan aplikasi suara, ini pilihan baharu yang berbaloi dinilai.

Pukul tiga petang Rabu, seorang jurutera sebuah syarikat baharu baru sahaja selesai mesyuarat merentas negara, dan perkara pertama sekembalinya ke tempat duduk ialah memasukkan fail rakaman ke perkhidmatan transkripsi. Mesyuarat dua jam yang bercampur bahasa, transkrip yang keluar menukar frasa "blocker sprint ini" menjadi rentetan perkataan yang pelik, dan para penutur juga bercampur aduk sehingga tidak dapat dibezakan siapa itu siapa. Dia mengeluh, lalu mula membetulkannya secara manual.

Senario ini mungkin ingatan bersama semua pasukan teknologi tempatan. Dan model baharu yang dikeluarkan Google pada Ogos, kebetulan menuju tepat titik kesakitan ini.

Latar Belakang Peristiwa

Google melancarkan model suara ke teks khusus Gemini 3.5 Transcribe pada Gemini API pada Ogos 2026, dan kini berstatus pratonton awam (public preview).

Yang patut diberi perhatian ialah reka bentuk produknya: ini bukan menambah input suara pada model Gemini umum, tetapi dipecahkan kepada dua titik akhir khusus. gemini-3.5-transcribe bertanggungjawab memproses fail audio yang telah dirakam, menggunakan Interactions API; gemini-3.5-transcribe-live bertanggungjawab untuk penstriman masa nyata dua hala, menggunakan Live API. Yang pertama sesuai untuk kerja berkelompok seperti rakaman mesyuarat, Podcast, sari kata video, manakala yang kedua sesuai untuk sari kata masa nyata, pembantu suara, sistem khidmat pelanggan.

Menurut dokumen rasmi, model menyokong lebih 85 bahasa, dan disertakan jadual perbandingan kod bahasa BCP-47.

Tumpuan Kali Ini

  • Pengasingan penutur (speaker diarization): Menyokong sehingga 8 penutur, tetapi pihak rasmi mencatatkan bahawa penentuan pemilikan bagi 3 penutur ke atas masih bersifat eksperimen.
  • Cap masa peringkat perkataan: Hanya disokong oleh titik akhir pemprosesan fail, dan pihak rasmi menyatakan dengan jelas mengaktifkannya akan menurunkan ketepatan. Mereka yang menyelaraskan sari kata perlu memberi perhatian pada tukar ganti ini.
  • Pengesanan bahasa automatik dan penukaran kod bahasa: Mengesan bahasa berdasarkan ayat, menyokong pertukaran berbilang bahasa dalam segmen audio yang sama — ini amat kritikal bagi senario mesyuarat tempatan yang bercampur bahasa.
  • Bias perbendaharaan kata tersuai (custom vocabulary biasing): Boleh menyediakan sehingga 1,000 perkataan, tetapi pihak rasmi mengesyorkan kira-kira 100 memberi kesan terbaik. Di sinilah anda memberi makan istilah dalaman syarikat, nama produk, nama orang.
  • Transkripsi pintar: Boleh membuang perkataan sisipan dan pengisi (seperti eh, kemudian, itu).
  • Had panjang audio: Pemprosesan fail satu kali maksimum 1 jam; jika pengasingan penutur atau cap masa turut diaktifkan, hadnya turun kepada 30 minit; penstriman masa nyata 10 minit bagi setiap sesi kerja.

Bagi ketepatan dan harga, halaman dokumen rasmi itu sendiri tidak menyenaraikan nombor kadar ralat perkataan (WER) dan butiran harga. Laporan pihak ketiga (MarkTechPost) memetik pengukuran Artificial Analysis, menunjukkan purata kadar ralat perkataan bukan penstriman kira-kira 2.6% dan penstriman kira-kira 4.0%; pelbagai artikel susunan memberikan anggaran harga kira-kira AS$0.005 seminit untuk berkelompok dan AS$0.009 seminit untuk masa nyata. Nombor-nombor ini bukan diumumkan secara rasmi oleh Google, dan kadar sebenar sila rujuk halaman harga Gemini API.

Analisis Kesan Pasaran

Bagi pengguna tempatan: Sokongan penukaran kod bahasa ialah fungsi yang paling patut diberi perhatian kali ini. Realiti bahasa mesyuarat di tempat kerja tempatan memang bercampur Melayu-Inggeris — ayat seperti "timeline feature ini kena push sikit" hampir pasti disalah transkripsi oleh model transkripsi sebelum ini. Jika pengesanan bahasa berdasarkan ayat benar-benar dapat mengendalikan campuran ini secara stabil, maka kebergunaannya untuk minit mesyuarat dan transkrip temu bual akan meningkat dengan ketara. Tetapi perlu diingatkan: pihak rasmi tidak mengumumkan nombor ketepatan berasingan bagi Bahasa Melayu dan loghat tempatan, dan perkara ini hanya boleh diuji sendiri.

Bagi aplikasi korporat: Bias perbendaharaan kata tersuai ialah fungsi paling praktikal semasa perniagaan memperkenalkannya. Kod produk dalaman syarikat, nama projek, nama rakan sekerja — model umum pasti akan mentranskripsinya salah, tetapi ia boleh dimasukkan melalui senarai perbendaharaan kata. Pihak rasmi mengesyorkan kira-kira 100 perkataan memberi kesan terbaik, dan nombor ini sangat praktikal — jangan sumbat 1,000 sekali gus, pilih dahulu yang paling kerap muncul dan paling kerap salah.

Namun, had audio 30 minit dan 1 jam memerlukan pemprosesan pemecahan fail tambahan bagi rakaman panjang seperti sesi taklimat kewangan dan latihan pendidikan. Sebelum memperkenalkannya, kos kejuruteraan bahagian ini perlu diambil kira.

Bagi pembangun: Reka bentuk dua titik akhir yang berasingan bermakna anda perlu memilih API mengikut senario, dan bukan satu set untuk menakluk segalanya. Yang membuat sari kata masa nyata gunakan Live API, tetapi had 10 minit bagi setiap sesi kerja bermakna siaran langsung yang panjang perlu mengendalikan penyambungan. Yang membuat transkripsi berkelompok gunakan Interactions API, dan perlu memberi perhatian bahawa mengaktifkan cap masa akan mengorbankan ketepatan — jika aplikasi anda tidak memerlukan penyelarasan masa yang tepat, jangan aktifkan.

Persaingan dalam pasaran juga perlu diambil kira. ElevenLabs mempunyai ekosistem sedia ada dalam bidang suara, Otter.ai mempunyai pengalaman produk yang matang dalam senario mesyuarat, manakala Descript mengintegrasikan transkripsi ke dalam aliran penyuntingan. Pilihan di lapisan API tulen semakin banyak, dan ini perkara baik bagi pembangun.

Trend Perkembangan Masa Depan

Kategori suara ke teks ini sedang berpecah kepada dua lapisan: satu lapisan ialah API model (bersaing ketepatan, bilangan bahasa, harga seunit), satu lapisan lagi ialah produk aplikasi (bersaing integrasi aliran kerja dan pengalaman). Google kali ini dengan jelas berdiri di lapisan pertama, menjual keupayaan model kepada pembangun, tidak membuat aplikasi hujung.

Saya rasa fokus persaingan setahun akan datang akan beralih daripada "ketepatan" kepada "output berstruktur". Sekadar menukar bunyi menjadi teks sudah hampir menjadi komoditi; yang benar-benar bernilai ialah siapa yang bercakap, bila dicakapkan, ayat mana keputusan, ayat mana perkara perlu dibuat — pengasingan penutur dan cap masa kedua-duanya ialah infrastruktur yang menuju ke arah ini.

Satu lagi yang patut dijejaki ialah bila versi pratonton bertukar kepada versi rasmi. Semasa tempoh pratonton awam, tingkah laku model, harga dan tahap perkhidmatan semuanya mungkin dilaraskan, dan risiko ini perlu dinilai sebelum meletakkannya ke dalam persekitaran pengeluaran.

Rumusan dan Ulasan TheAI Academy

Sejujurnya, kemajuan suara ke teks beberapa tahun ini sudah sampai ke tahap "cukup baik untuk kegunaan umum", dan bersaing beberapa peratus ketepatan lagi ke atas tidak akan terasa kuat. Yang benar-benar belum diselesaikan ialah kes-kes tepi itu: campuran berbilang bahasa, banyak orang berebut bercakap, istilah profesional, loghat. Fungsi yang diketengahkan Gemini 3.5 Transcribe kali ini kebetulan semuanya pada titik-titik ini.

Cadangan konkrit untuk pasukan tempatan: cari satu rakaman mesyuarat sebenar yang paling menyakitkan kepala anda — sebaik-baiknya yang bercampur Melayu-Inggeris, lebih tiga orang, dan bercakap sangat laju — kemudian masukkan serentak ke perkhidmatan yang digunakan sekarang dan model baharu ini, dan bandingkan hasilnya. Jangan lihat demo rasmi, jangan lihat nombor purata penilaian pihak ketiga, uji dengan data sendiri. Selain itu, ingat untuk menyusun 100 istilah lazim syarikat menjadi senarai perbendaharaan kata dan masukkannya sekali, kerana itulah keadaan penggunaan yang sebenar.

Ulasan: Suara ke teks sudah tidak kekurangan pilihan yang "boleh guna", yang kurang ialah model yang mampu mengendalikan keadaan huru-hara seperti campuran bahasa tempatan. Spesifikasi Gemini 3.5 Transcribe kelihatan menuju tepat masalahnya, tetapi sama ada ia benar-benar boleh dalam Bahasa Melayu dan loghat tempatan, pihak rasmi tidak memberikan nombor, dan hanya boleh diuji sendiri. Meluangkan setengah hari membuat ujian ini lebih berguna daripada membaca sepuluh penilaian.

Sumber Rujukan

Artikel ini disusun berdasarkan maklumat awam; spesifikasi fungsi dan harga adalah tertakluk pada pihak rasmi. Kadar ralat perkataan dan anggaran harga yang disebut dalam teks dipetik daripada sumber pihak ketiga, bukan nombor yang diumumkan secara rasmi oleh Google.

Soalan Lazim

Adakah Gemini 3.5 Transcribe menyokong Bahasa Melayu?

Dokumen rasmi menyatakan sokongan lebih 85 bahasa dan disertakan jadual perbandingan kod BCP-47, dan Bahasa Melayu berada dalam skop. Tetapi pihak rasmi tidak mengumumkan nombor ketepatan berasingan bagi Bahasa Melayu dan loghat tempatan, jadi disyorkan menggunakan rakaman sebenar sendiri untuk ujian, terutamanya senario mesyuarat yang bercampur bahasa.

Titik akhir mana yang patut digunakan?

Untuk memproses fail audio yang telah dirakam (rakaman mesyuarat, Podcast, video) gunakan gemini-3.5-transcribe, dengan Interactions API; untuk penstriman dua hala masa nyata (sari kata langsung, pembantu suara, khidmat pelanggan) gunakan gemini-3.5-transcribe-live, dengan Live API. Had kedua-duanya berbeza, dan penstriman masa nyata terhad kepada 10 minit bagi setiap sesi kerja.

Mengapa mengaktifkan cap masa menjejaskan ketepatan?

Ini ialah tukar ganti yang dicatat dengan jelas dalam dokumen rasmi: cap masa peringkat perkataan hanya disokong oleh titik akhir pemprosesan fail, dan mengaktifkannya akan menurunkan ketepatan transkripsi. Jika aplikasi anda tidak memerlukan penyelarasan masa yang tepat (contohnya hanya mahukan transkrip dan bukan sari kata), disyorkan jangan mengaktifkannya.

Berapa banyak perkataan patut dimasukkan untuk perbendaharaan kata tersuai?

Had rasmi ialah 1,000 perkataan, tetapi disyorkan kira-kira 100 memberi kesan terbaik. Dalam praktik anda sepatutnya memilih istilah, nama produk dan nama orang yang paling kerap muncul dan paling kerap disalah transkripsi, dan bukan menuang keseluruhan buku istilah masuk.

繁體中文版 →