Google ra mắt bản xem trước Gemini 3.5 Transcribe, chuyển giọng nói thành văn bản hỗ trợ hơn 85 ngôn ngữ

Tháng 8 năm 2026 Google phát hành mô hình chuyển giọng nói thành văn bản chuyên biệt Gemini 3.5 Transcribe, đang ở bản xem trước công khai, chia thành hai điểm cuối xử lý file và stream trực tiếp, hỗ trợ tách người nói, dấu thời gian cấp từ và từ vựng tùy chỉnh. Với lập trình viên làm biên bản họp, phụ đề và ứng dụng giọng nói, đây là lựa chọn mới đáng đánh giá.

Ba giờ chiều thứ Tư, một kỹ sư ở một startup vừa họp xuyên quốc gia xong, về chỗ việc đầu tiên là ném file ghi âm vào dịch vụ chuyển văn bản. Cuộc họp hai tiếng nói lẫn tiếng Anh, bản gỡ băng ra biến "blocker của sprint này" thành một chuỗi từ khó hiểu, người nói cũng lẫn hết vào nhau không phân biệt được ai là ai. Anh thở dài, bắt đầu sửa thủ công.

Cảnh này chắc là ký ức chung của mọi đội công nghệ. Và mô hình mới Google phát hành trong tháng 8 vừa hay nhắm thẳng vào mấy điểm đau này.

Bối cảnh sự kiện

Tháng 8 năm 2026, Google ra mắt mô hình chuyển giọng nói thành văn bản chuyên biệt Gemini 3.5 Transcribe trên Gemini API, hiện đang ở trạng thái xem trước công khai (public preview).

Đáng chú ý là thiết kế sản phẩm: đây không phải là lấy mô hình Gemini thông dụng thêm đầu vào giọng nói, mà tách thành hai điểm cuối chuyên biệt. gemini-3.5-transcribe phụ trách xử lý file âm thanh đã ghi sẵn, đi qua Interactions API; gemini-3.5-transcribe-live phụ trách stream hai chiều tức thời, đi qua Live API. Cái trước phù hợp cho các công việc theo lô như ghi âm cuộc họp, Podcast, phụ đề video; cái sau phù hợp cho phụ đề tức thời, trợ lý giọng nói, hệ thống chăm sóc khách hàng.

Theo tài liệu chính thức, mô hình hỗ trợ hơn 85 ngôn ngữ, kèm bảng đối chiếu mã ngôn ngữ BCP-47.

Trọng điểm

  • Tách người nói (speaker diarization): hỗ trợ tối đa 8 người nói, nhưng bên chính thức ghi chú việc phán định quy thuộc từ 3 người trở lên vẫn mang tính thử nghiệm.
  • Dấu thời gian cấp từ: chỉ điểm cuối xử lý file hỗ trợ, và bên chính thức nói rõ bật lên sẽ làm độ chính xác giảm. Người làm khớp thời gian phụ đề cần lưu ý sự đánh đổi này.
  • Tự động nhận diện ngôn ngữ và chuyển mã ngôn ngữ: nhận diện ngôn ngữ theo đơn vị câu, hỗ trợ chuyển đổi đa ngôn ngữ trong cùng một đoạn âm thanh — điều này rất then chốt với tình huống họp lẫn tiếng Anh.
  • Điều chỉnh thiên lệch từ vựng tùy chỉnh (custom vocabulary biasing): cung cấp tối đa 1.000 từ, nhưng bên chính thức khuyến nghị khoảng 100 từ là hiệu quả nhất. Đây là chỗ để nạp thuật ngữ nội bộ công ty, tên sản phẩm, tên người.
  • Chuyển văn bản thông minh: có thể loại bỏ từ đệm và từ lấp (à, rồi thì, cái kiểu như...).
  • Giới hạn độ dài âm thanh: xử lý file mỗi lần dài nhất 1 giờ; nếu đồng thời bật tách người nói hoặc dấu thời gian, trần giảm còn 30 phút; stream trực tiếp mỗi phiên làm việc 10 phút.

Về độ chính xác và giá, trang tài liệu chính thức không liệt kê con số tỷ lệ lỗi từ (WER) và chi tiết định giá. Báo cáo bên thứ ba (MarkTechPost) dẫn số đo của Artificial Analysis, cho biết tỷ lệ lỗi từ trung bình không stream khoảng 2,6%, stream khoảng 4,0%; nhiều bài tổng hợp đưa ước tính giá khoảng theo lô 0,005 USD mỗi phút, tức thời 0,009 USD mỗi phút. Những con số này đều không phải do Google công bố chính thức, mức phí thực tế xin căn cứ theo trang định giá Gemini API.

Phân tích tác động thị trường

Với người dùng: Hỗ trợ chuyển mã ngôn ngữ là chức năng đáng quan tâm nhất lần này. Thực tế ngôn ngữ họp trong công sở là lẫn tiếng Anh — những câu như "cái timeline của feature này phải push một chút", các mô hình chuyển văn bản trước đây gần như chắc chắn sai. Nếu việc nhận diện ngôn ngữ theo đơn vị câu thật sự xử lý ổn định kiểu lẫn lộn này thì độ hữu dụng cho biên bản họp, gỡ băng phỏng vấn sẽ tăng rõ. Nhưng xin nhắc: bên chính thức không công bố con số độ chính xác riêng cho tiếng Trung phồn thể và giọng địa phương, chuyện này chỉ có thể tự kiểm.

Với ứng dụng doanh nghiệp: Điều chỉnh thiên lệch từ vựng tùy chỉnh là chức năng thực dụng nhất khi doanh nghiệp đưa vào. Mã sản phẩm nội bộ, tên dự án, tên đồng nghiệp, những thứ này mô hình thông dụng chắc chắn chuyển sai, nhưng có thể nạp vào qua danh sách từ vựng. Bên chính thức khuyến nghị khoảng 100 từ là hiệu quả nhất, con số này rất thực tế — đừng nhồi 1.000 từ một lúc, hãy chọn trước những từ hay xuất hiện và hay sai nhất.

Tuy nhiên trần âm thanh 30 phút và 1 giờ, với ghi âm dài như họp cổ đông, đào tạo, cần thêm xử lý cắt file. Trước khi đưa vào phải tính chi phí kỹ thuật của khâu này.

Với lập trình viên: Thiết kế tách riêng hai điểm cuối nghĩa là bạn phải chọn API theo tình huống, không phải một bộ dùng cho tất cả. Làm phụ đề tức thời thì đi Live API, nhưng giới hạn mỗi phiên làm việc 10 phút nghĩa là livestream dài cần xử lý nối tiếp. Làm chuyển văn bản theo lô thì đi Interactions API, lưu ý việc bật dấu thời gian sẽ hy sinh độ chính xác — nếu ứng dụng của bạn không cần khớp thời gian chính xác thì đừng bật.

Cạnh tranh trên thị trường cũng phải tính vào. ElevenLabs có hệ sinh thái sẵn trong lĩnh vực giọng nói, Otter.ai có trải nghiệm sản phẩm trưởng thành trong tình huống họp, Descript thì tích hợp chuyển văn bản vào luồng dựng video. Lựa chọn ở tầng API thuần túy nhiều lên, với lập trình viên là chuyện tốt.

Xu hướng phát triển tương lai

Danh mục chuyển giọng nói thành văn bản đang phân hóa thành hai tầng: một tầng là API mô hình (đua độ chính xác, số ngôn ngữ, đơn giá), một tầng là sản phẩm ứng dụng (đua tích hợp luồng công việc và trải nghiệm). Lần này Google rất rõ ràng đứng ở tầng một, bán năng lực mô hình cho lập trình viên, không làm ứng dụng cuối.

Tôi cho rằng trọng tâm cạnh tranh năm tới sẽ chuyển từ "độ chính xác" sang "đầu ra có cấu trúc". Đơn thuần biến giọng thành chữ đã gần như hàng hóa hóa, thứ thật sự có giá trị là ai nói, nói lúc nào, câu nào là quyết nghị, câu nào là việc cần làm — tách người nói và dấu thời gian đều là hạ tầng đi theo hướng này.

Một điều đáng theo dõi khác là bao giờ bản xem trước chuyển thành bản chính thức. Trong giai đoạn xem trước công khai, hành vi mô hình, giá và cấp độ dịch vụ đều có thể điều chỉnh, phải đánh giá rủi ro này trước khi đưa vào môi trường sản xuất.

Học viện TheAI tổng kết và nhận định

Nói thật, tiến bộ của chuyển giọng nói thành văn bản mấy năm nay đã đến giai đoạn "dùng cho mục đích thông thường là đủ tốt", đua thêm vài phần trăm độ chính xác thì cảm nhận không rõ. Thứ thật sự chưa giải quyết được là các tình huống biên: lẫn nhiều ngôn ngữ, nhiều người tranh nói, thuật ngữ chuyên môn, giọng vùng miền. Các chức năng chủ đạo của Gemini 3.5 Transcribe lần này vừa hay đều nằm ở mấy điểm này.

Gợi ý cụ thể cho các đội: tìm một đoạn ghi âm cuộc họp thật đau đầu nhất của bạn — tốt nhất là loại lẫn tiếng Anh, ba người trở lên, nói rất nhanh — ném đồng thời cho dịch vụ đang dùng và mô hình mới này, đối chiếu kết quả. Đừng xem demo chính thức, đừng xem con số trung bình của đánh giá bên thứ ba, dùng dữ liệu của chính bạn để thử. Ngoài ra nhớ tổng hợp 100 thuật ngữ hay dùng của công ty thành danh sách từ vựng nạp vào cùng, đó mới là điều kiện sử dụng thật.

Nhận định: chuyển giọng nói thành văn bản không còn thiếu lựa chọn "tạm dùng", cái thiếu là mô hình xử lý được hiện trường hỗn loạn kiểu lẫn tiếng Anh. Thông số của Gemini 3.5 Transcribe trông có vẻ đúng bệnh, nhưng nó trên tiếng Trung phồn thể và giọng địa phương rốt cuộc ổn không thì bên chính thức không cho số, chỉ có thể tự thử. Bỏ nửa ngày làm phép thử này hữu ích hơn đọc mười bài đánh giá.

Nguồn tham khảo

Bài viết được tổng hợp theo thông tin công khai; thông số chức năng và định giá căn cứ theo bên chính thức. Tỷ lệ lỗi từ và ước tính giá được đề cập trích từ nguồn bên thứ ba, không phải con số Google công bố chính thức.

Câu hỏi thường gặp

Gemini 3.5 Transcribe có hỗ trợ tiếng Trung phồn thể không?

Tài liệu chính thức nói hỗ trợ hơn 85 ngôn ngữ và kèm bảng đối chiếu mã BCP-47, tiếng Trung nằm trong phạm vi. Nhưng bên chính thức không công bố con số độ chính xác riêng cho tiếng Trung phồn thể và giọng địa phương, nên kiểm thử bằng ghi âm thực tế của mình, đặc biệt là tình huống họp lẫn tiếng Anh.

Nên dùng điểm cuối nào?

Xử lý file đã ghi sẵn (ghi âm họp, Podcast, video) dùng gemini-3.5-transcribe, đi qua Interactions API; cần stream hai chiều tức thời (phụ đề tại chỗ, trợ lý giọng nói, chăm sóc khách hàng) dùng gemini-3.5-transcribe-live, đi qua Live API. Giới hạn của hai loại khác nhau, stream trực tiếp trần mỗi phiên làm việc 10 phút.

Vì sao bật dấu thời gian lại ảnh hưởng độ chính xác?

Đây là sự đánh đổi tài liệu chính thức ghi rõ: dấu thời gian cấp từ chỉ điểm cuối xử lý file hỗ trợ, và bật lên sẽ làm độ chính xác chuyển văn bản giảm. Nếu ứng dụng của bạn không cần khớp thời gian chính xác (ví dụ chỉ cần bản gỡ băng chứ không phải phụ đề), nên không bật.

Từ vựng tùy chỉnh nên đặt bao nhiêu từ?

Trần chính thức là 1.000 từ, nhưng khuyến nghị khoảng 100 từ là hiệu quả nhất. Trên thực tế nên chọn ra những thuật ngữ, tên sản phẩm và tên người hay xuất hiện nhất và hay bị chuyển sai nhất, chứ không phải đổ cả cuốn thuật ngữ vào.

繁體中文版 →