Hướng dẫn Rask AI: Quy trình thực tế lồng tiếng Nhật cho video tiếng Trung và những điểm cần tránh

Thuê diễn viên lồng tiếng thu âm lại ba mươi video khiến sếp tá hỏa vì báo giá quá đắt. Tôi đã thử nghiệm toàn bộ quy trình chuyển đổi từ tiếng Trung sang tiếng Nhật bằng Rask AI, chia sẻ chi tiết về các bẫy tính phí theo phút, ranh giới bản quyền giọng nói và những bước tuyệt đối không thể bỏ qua.

Hướng dẫn Rask AI: Quy trình thực tế và những cạm bẫy khi tôi dịch một video tiếng Trung sang lồng tiếng Nhật

Tháng trước, tôi đã hỗ trợ một thương hiệu xà phòng thủ công tại Đài Bắc sắp xếp lại kênh YouTube của họ. Có hơn 30 video tiếng Trung, và ông chủ muốn thâm nhập thị trường Nhật Bản, nên đã hỏi tôi chi phí thuê diễn viên lồng tiếng để thu âm lại là bao nhiêu. Sau khi hỏi hai đơn vị hậu kỳ, chi phí dao động từ 2.500 đến 4.000 Đài tệ cho mỗi phút thành phẩm. Với 30 video, trung bình mỗi video dài sáu phút, tổng chi phí tính ra đủ mua một chiếc xe máy. Biểu cảm của ông chủ lúc đó khiến tôi nhớ đến tận bây giờ.

Chiều hôm đó, tôi mở Rask AI lên dùng thử. Kết quả không phải kiểu thần thoại "thay thế hoàn toàn diễn viên lồng tiếng", nhưng ngân sách đã bị ép xuống dưới một phần mười. Đối tác bên Nhật sau khi xem video mẫu đã nói rằng: "Vẫn nghe ra là AI, nhưng hoàn toàn xem được". Bài viết này sẽ chia sẻ chi tiết quy trình tôi đã thực hiện, các cài đặt và một số cạm bẫy tốn kém.

Công cụ này là gì?

Rask AI là một nền tảng "bản địa hóa video" có trụ sở tại Châu Âu, với cốt lõi là thay thế lồng tiếng trong video hiện có của bạn sang một ngôn ngữ khác. Điểm khác biệt của nó so với phần mềm dịch thuật thông thường là không chỉ cung cấp phụ đề, mà xử lý trọn gói từ A đến Z: tự động chuyển giọng nói thành văn bản (transcription), dịch thuật, sử dụng âm sắc của diễn viên gốc để tạo giọng nói bằng ngôn ngữ đích, và đồng bộ hóa chuyển động môi (lip-sync).

Trang chủ chính thức hiện hỗ trợ dịch trên 130 ngôn ngữ (một số trang con ghi 135) và sao chép giọng nói (voice cloning) cho 32 ngôn ngữ. Các ngôn ngữ mà các thương hiệu Đài Loan thường dùng để vươn ra toàn cầu như tiếng Trung, tiếng Nhật, tiếng Hàn và tiếng Anh đều có đủ. Các con số này đôi khi được chính thức điều chỉnh, vì vậy hãy lấy trang web rask.ai làm chuẩn tại thời điểm bạn truy cập.

Nói một cách thẳng thắn, đối tượng phục vụ của nó rất rõ ràng: những ai đã có sẵn kho video và muốn mở rộng sang thị trường ngôn ngữ mới với chi phí thấp. YouTuber, giảng viên khóa học trực tuyến, và các nhà tiếp thị làm video hướng dẫn sản phẩm là ba nhóm người dùng sẽ thấy rõ hiệu quả nhất.

Nó có thể làm gì (và không thể làm gì)

Những việc làm được: Lồng tiếng đa ngôn ngữ là cốt lõi, một video có thể chạy song song nhiều ngôn ngữ cùng lúc. Tính năng sao chép giọng nói sẽ nắm bắt âm sắc của người nói gốc; giọng của chính tôi khi dịch sang tiếng Nhật đạt độ giống khoảng 75%, ngữ điệu hơi phẳng nhưng chưa đến mức robot. Khả năng nhận diện đa người nói có thể phân biệt 2-3 người trong video trò chuyện và gán giọng cho từng người. Đồng bộ môi là một lớp xử lý riêng, hiệu quả nhất với các góc quay cận mặt chính diện. Phụ đề có thể tải xuống dưới dạng SRT, VTT, hoặc bạn có thể tải lên file SRT đã chỉnh sửa của mình để ghi đè lên bản dịch của nó. Ngoài ra còn có từ điển dịch (translation glossary) và câu lệnh dịch (translation prompts), đây là ranh giới phân định giữa người dùng chuyên nghiệp. Nếu khối lượng lớn, có thể dùng API để chạy hàng loạt.

Những việc không làm được cần phải nói rõ, đây là nơi dễ thất vọng nhất: Nó không phải là phần mềm biên tập video; các hiệu ứng chuyển cảnh, thẻ chữ (text card), B-roll, hình thu nhỏ (thumbnail) đều không làm được. Tôi thường xuất file lồng tiếng rồi đưa sang VEED.IO để hoàn thiện. Nó không cứu được âm thanh kém chất lượng; nếu file âm thanh gốc có tiếng vang hoặc tiếng ồn xung quanh lấn át giọng nói, quá trình nhận diện chữ sẽ bị sai, và bản phiên âm sai dịch ra sẽ là thảm họa. Nó không đảm bảo các thuật ngữ chuyên môn hoàn toàn chính xác. Nó cũng không phải là công cụ dịch phát trực tiếp (live streaming), mà là xử lý ngoại tuyến hàng loạt.

Thêm một điểm nữa, hiệu quả khi dịch từ tiếng Trung sang sẽ kém hơn một chút so với từ tiếng Anh sang. Việc ngắt câu, chữ đa âm tiết, cách đọc số vốn dĩ đã khó. Tôi từng gặp trường hợp "32 gram" bị đọc thành một âm thanh kỳ lạ, và có cả từ tiếng Phúc Kiến (Taiwanese) bị dịch ép buộc. Tiếng Phúc Kiến hiện chưa được hỗ trợ chính thức.

Cách sử dụng: Phân tích từng bước

Bước 0: Chuẩn bị tài liệu (5 đến 10 phút)

Nhiều người bỏ qua bước này rồi phải làm lại từ đầu. Hãy xuất phiên bản 1080p với giọng nói rõ ràng. Nếu nhạc nền lớn hơn giọng nói, hãy giảm âm lượng hoặc loại bỏ nó; nếu có track giọng nói gốc không có nhạc nền thì hãy dùng track đó. Hãy chọn trước một video từ 3 đến 5 phút để thử nghiệm, đừng vội ném một bài giảng dài 30 phút vào ngay từ đầu.

Bước 1: Tạo dự án (Khoảng 1 phút)

Sau khi đăng nhập, nhấn nút Thêm dự án mới (New Project) ở góc trên bên phải của Dashboard, kéo tệp vào hoặc dán URL YouTube. Tiếp theo, cài đặt 3 thứ: Ngôn ngữ nguồn (chọn thủ công là tiếng Trung, đừng để tự động phát hiện vì tiếng Trung pha tiếng Anh rất dễ đoán sai), Ngôn ngữ đích (có thể chọn nhiều nhưng tính phí riêng từng ngôn ngữ, trước mắt chỉ chọn một), và Số lượng người nói. Nếu muốn sao chép giọng nói, hãy nhớ bật công tắc voice cloning, nếu không hệ thống sẽ dùng giọng tổng hợp mặc định.

Bước 2: Chờ hệ thống xử lý (Video 3 phút mất khoảng 5 đến 15 phút)

Thời gian chờ tùy thuộc vào mức độ bận rộn của máy chủ; khung giờ ban ngày ở Châu Âu thường chậm hơn. Khi chạy xong sẽ có email thông báo, bạn có thể đi làm việc khác trước.

Bước 3: Đối chiếu phụ đề và bản dịch (Phần tốn thời gian nhất)

Sau khi vào trình chỉnh sửa, bên trái là khu vực phụ đề được chia đoạn, bên phải là trình phát video. Cả văn bản gốc và bản dịch đều có thể chỉnh sửa trực tiếp. Thói quen của tôi là quét lại toàn bộ bản gốc tiếng Trung để sửa các từ bị nghe nhầm, rồi mới xem bản dịch. Với một video mười phút, bước này mất khoảng 30 đến 40 phút.

Sau khi sửa văn bản, bạn phải nhấn "tạo lại" (regenerate) cho đoạn đó thì âm thanh mới được cập nhật. Nhiều người dùng lần đầu hay bỏ sót bước này, kết quả là xuất file ra vẫn là giọng cũ.

Bước 4: Xử lý các đoạn bị tràn thời lượng

Khi dịch từ tiếng Trung sang tiếng Nhật, số lượng chữ thường phình ra hơn 30%, dẫn đến việc bản dịch nói không kịp nên bị cắt cụt, hoặc tốc độ đọc bị ép lại đến mức khó nghe. Trình chỉnh sửa cho phép điều chỉnh độ dài thời gian của từng đoạn, hoặc cho phép một đoạn nào đó vượt quá mốc thời gian ban đầu. Cách làm của tôi là quay lại rút ngắn văn bản dịch lại, việc này thường tự nhiên hơn là cố kéo giãn mốc thời gian.

Bước 5: Đồng bộ môi (Tùy chọn, cần chờ thêm một lượt xử lý)

Sau khi bản lồng tiếng đã được chốt thì mới bật lip-sync. Đây là một lớp xử lý khác, sửa văn bản một lần là phải chạy lại từ đầu.

Bước 6: Xuất file

Bạn chỉ có thể tải xuống track âm thanh lồng tiếng (tôi thường làm cách này để đưa về phần mềm dựng phim khớp lại mốc thời gian), hoặc tải xuống file MP4 đã đóng cứng phụ đề hoặc file phụ đề SRT/VTT.

Mẹo nâng cao

1. Tạo từ điển dịch (Glossary) trước khi bắt đầu. Cho tên thương hiệu, tên sản phẩm, tên diễn viên, thuật ngữ chuyên ngành vào Glossary. Sản phẩm của khách hàng tôi tên là "Xà phòng ngải cứu" (艾草皂), khi chưa cài đặt từ điển thì bị dịch thành "ヨモギ石鹸", sau khi cài đặt thì đúng theo cách viết trên trang web chính thức của họ bên Nhật. Thời gian chỉnh sửa tiết kiệm được ở bước này lớn hơn rất nhiều so với mười phút tạo từ điển.

2. Sử dụng câu lệnh dịch (Prompt) để kiểm soát ngữ điệu. Đây là tính năng tôi thấy bị đánh giá thấp nhất. Bạn có thể sao chép trực tiếp đoạn này để sửa lại:

Translate into casual spoken Japanese suitable for a YouTube lifestyle channel.
Keep the brand name "XXXX" in Latin letters, do not translate it.
Use short sentences under 25 characters; avoid formal keigo except in the closing line.
Convert measurements to the metric phrasing a Japanese speaker would say aloud.

Tôi đã thử cả hai cách, và mức độ tuân thủ câu lệnh bằng tiếng Anh rõ ràng là tốt hơn một chút.

3. Xuất video thử nghiệm 30 giây trước khi render toàn bộ. Số phút chính là tiền. Hãy cắt một đoạn 30 giây có mặt chính diện, có thuật ngữ chuyên môn và có số để chạy thử trước. Xác nhận âm sắc và ngữ điệu ổn rồi mới gửi làm nguyên video. Bản thân tôi lười làm bước này nên đã lãng phí mất 8 phút hạn mức.

4. Dịch bên ngoài trước, sau đó đưa lại file SRT vào. Đối với các dự án đòi hỏi chất lượng cao, tôi sẽ tải file SRT gốc, đưa sang ChatGPT để dịch một bản, chỉnh sửa thủ công xong rồi mới tải lên lại Rask để tạo giọng nói. Chất lượng dịch do bạn kiểm soát, Rask chỉ chịu trách nhiệm phát ra âm thanh. Dành thêm 20 phút, thành phẩm sẽ khác biệt hẳn một bậc.

5. Tách biệt việc lồng tiếng và dựng phim. Trình chỉnh sửa của nó tồn tại là để khớp mốc thời gian chứ không phải để làm nội dung. Sau khi lấy được track âm thanh, hãy mang về quy trình biên tập ban đầu để xử lý thẻ chữ, phần mở đầu và tỷ lệ khung hình cho mạng xã hội.

Lưu ý và những cạm bẫy thường gặp

Tính phí theo số phút video, và mỗi ngôn ngữ được tính là một phần. Một video mười phút dịch sang ba ngôn ngữ sẽ tính là ba mươi phút, đây là điều mà nhiều người thanh toán xong mới phát hiện ra. Các gói hiện tại chia thành Dùng thử miễn phí 3 phút, Creator, Creator Pro, Business và Enterprise. Theo các con số công bố trên trang web chính thức, gói Creator có giá 60 USD/tháng, thanh toán theo năm khoảng 33 USD/tháng; gói Creator Pro có giá 150 USD/tháng, thanh toán theo năm khoảng 78 USD/tháng; gói Business có giá 750 USD/tháng, phí vượt mức là 3 USD/phút. Đơn vị tiền tệ là USD, và trang web chính thức vẫn hiển thị thông báo giá sắp điều chỉnh, vì vậy hãy lấy trang thanh toán làm chuẩn thực tế.

Cách tính hạn mức thanh toán theo năm và theo tháng là khác nhau. Thanh toán theo năm cung cấp tổng số phút cho cả năm, trong khi thanh toán theo tháng cấp hạn mức hàng tháng và thường không được cộng dồn. Thanh toán theo năm sẽ tiết kiệm hơn nếu tập trung làm một loạt trong một quý; còn thanh toán theo tháng sẽ linh hoạt hơn nếu ra video đều đặn mỗi tuần.

Cần có sự cho phép đối với giọng nói và hình ảnh. Việc sao chép giọng nói sử dụng âm sắc của người thật, muốn sao chép giọng của ai thì phải có sự đồng ý bằng văn bản của người đó. Quyền nhân thân theo Bộ luật Dân sự và quy định của Luật Bảo vệ Dữ liệu Cá nhân đối với các đặc điểm sinh học như vân giọng đều không phải là những vùng có thể mập mờ. Nếu video có nhân viên, khách mời hoặc người qua đường, hãy hỏi rõ phạm vi ủy quyền trước khi làm phiên bản đa ngôn ngữ.

Quyền sử dụng nhạc nền không mất đi chỉ vì video đã được dịch. Nhạc nền ban đầu chỉ được cấp phép sử dụng tại thị trường Đài Loan, nhưng khi làm phiên bản tiếng Nhật và đưa sang Nhật Bản, vấn đề bản quyền vẫn giữ nguyên.

Đồng bộ môi không phải là vạn năng. Các khung hình chính diện đơn người như phỏng vấn, diễn thuyết rất đáng để bật; còn góc nghiêng, quay khi đang đi bộ, hoặc nhiều người cùng xuất hiện trong một khung hình mà bật lên thì miệng sẽ bị nhòe. Trong những trường hợp đó, tôi thà chỉ đổi giọng còn hơn.

So sánh các giải pháp thay thế

HeyGen — Nếu trong tay không có sẵn video mà chỉ có văn bản, các bản sao kỹ thuật số (digital avatars) của nó có thể trực tiếp tạo ra một người để thuyết trình, giao diện cũng dễ sử dụng hơn Rask. Phù hợp cho các đội ngũ marketing sản xuất nhanh một loạt nguyên liệu video ngắn.

ElevenLabs — Chuyên về âm thanh thuần túy. Đối với các nội dung không cần khớp khẩu hình như Podcast, lời bình (voiceover), sách nói (audiobook), chi phí sẽ thấp hơn, chi tiết âm thanh tốt hơn và API cũng dễ tích hợp hơn. Nhược điểm là quy trình ở phía video bạn phải tự hoàn thiện.

VEED.IO — Nếu nhu cầu của bạn là phụ đề đa ngôn ngữ chứ không phải lồng tiếng đa ngôn ngữ, thì khả năng bao phủ ngôn ngữ phụ đề của nó rộng hơn, lại có thể tiện tay biên tập xong video luôn. Số lượng ngôn ngữ lồng tiếng thì ít hơn Rask một chút.

Phân chia đơn giản: Cần chiều sâu lồng tiếng thì chọn Rask, cần tạo người nói thì chọn HeyGen, chỉ cần âm thanh thì chọn ElevenLabs, cần phụ đề kết hợp dựng phim thì chọn VEED.

Đánh giá từ TheAI学院

Rask AI đưa việc "bản địa hóa lồng tiếng" đạt đến mức độ sâu nhất hiện có trên thị trường, nhưng logic tính phí theo phút của nó sẽ ép bạn phải hình thành kỷ luật: kiểm tra kỹ bản thảo trước rồi mới tạo - thực chất điều này rất tốt cho chất lượng thành phẩm.

Đề xuất cụ thể cho độc giả Đài Loan: Đừng vội thanh toán theo năm. Hãy dùng thử 3 phút miễn phí trước, lấy giọng của chính bạn để chạy thử bài dịch từ tiếng Trung sang tiếng Nhật, nghe thử xem âm sắc có giống không, ngữ điệu có chấp nhận được không. Sau đó tính toán kỹ xem trong 12 tháng tới bạn "thực sự" cần xuất bao nhiêu phút video tiếng nước ngoài, nhân với số lượng ngôn ngữ rồi mới đối chiếu các gói cước. Hầu hết các doanh nghiệp vừa và nhỏ tại Đài Loan dùng chưa đến 300 phút mỗi năm, gói Creator thanh toán theo năm là đủ dùng. Việc nhảy lên gói Pro thường là để dùng tính năng đồng bộ môi cho nhiều người nói và cộng tác nhóm, chứ không phải vì hạn mức phút.

Còn một cách làm rất thực tế: Hãy xuất bản phiên bản phụ đề trước để tung ra thị trường mục tiêu đo lường phản ứng, khi dữ liệu có khởi sắc thì mới quay lại làm phiên bản lồng tiếng. Dịch thuật là chi phí, còn việc kiểm chứng thị trường mới là trọng tâm.

Nguồn dữ liệu

Câu hỏi thường gặp

Rask AI có hỗ trợ tiếng Trung và tiếng Đài Loan không?

Tiếng Trung (bao gồm cả chữ phồn thể và giản thể) nằm trong phạm vi hỗ trợ. Trang chính thức liệt kê hơn 130 ngôn ngữ dịch thuật và 32 ngôn ngữ sao chép giọng nói, bao gồm các ngôn ngữ phổ biến để vươn ra toàn cầu như Trung, Nhật, Anh, Hàn. Tiếng Đài Loan hiện chưa được hỗ trợ chính thức, các từ ngữ tiếng Đài Loan trong video sẽ bị dịch cứng thành tiếng Trung, đối với các nội dung này cần chỉnh sửa bản thảo thủ công trước. Danh sách hỗ trợ thực tế vui lòng tham khảo trang web chính thức của rask.ai tại thời điểm đó.

Rask AI tính phí thế nào? Dịch sang nhiều ngôn ngữ có bị tính thêm tiền không?

Tính phí theo số phút của video, và mỗi ngôn ngữ đích được tính là một phần riêng biệt. Một video dài mười phút dịch sang ba ngôn ngữ sẽ tiêu tốn hạn mức ba mươi phút, đây là điều mà hầu hết mọi người chỉ phát hiện ra sau khi thanh toán. Hiện tại chính thức có bản dùng thử miễn phí ba phút, các gói trả phí bao gồm Creator, Creator Pro, Business và Enterprise, giá được tính bằng đô la Mỹ và mức giá hiển thị trên trang web chính thức có thể thay đổi, vui lòng tham khảo trang thanh toán.

Việc sao chép giọng nói của người khác có gây ra vấn đề pháp lý không?

Có. Trước khi sao chép âm sắc của người thật, bạn phải có sự đồng ý bằng văn bản của người đó, nhân viên hoặc khách mời xuất hiện trong video cũng vậy. Quy định bảo vệ quyền nhân thân trong Bộ luật Dân sự và Luật bảo vệ dữ liệu cá nhân đối với các đặc điểm sinh học như mẫu giọng nói đều được áp dụng, đặc biệt không được bỏ qua các tài liệu ủy quyền đối với mục đích thương mại. Ngoài ra, xin lưu ý rằng phạm vi bản quyền âm thanh nền của video gốc sẽ không tự động mở rộng sang thị trường mới chỉ vì đã tạo phiên bản tiếng nước ngoài.

Có nhất thiết phải bật tính năng đồng bộ hóa chuyển động môi không?

Tùy thuộc vào loại khung hình. Đối với các tài liệu như phỏng vấn, bài phát biểu có góc quay chính diện, một người, ổn định thì việc bật tính năng này sẽ ghi điểm rõ rệt; đối với các khung hình thao tác sản phẩm, quay khi di chuyển, nhiều người cùng khung hình, khi bật tính năng này phần miệng dễ bị nhòe và sẽ bị trừ điểm ngược lại. Ngoài ra, đồng bộ hóa chuyển động môi là một lớp tính toán bổ sung, cứ sửa chữ một lần là phải chạy lại một lần, khuyên bạn nên chốt bản lồng tiếng rồi hãy bật.

繁體中文版 →