Rask AI 教學:把一支中文影片翻成日文配音,我實測的完整流程與踩雷筆記
2026年7月20日
找配音員把三十支影片重錄一輪,報價貴到老闆變臉。我用 Rask AI 實測中文轉日文的完整流程,把按分鐘計費的坑、聲音授權紅線,還有哪些步驟千萬不能省,一次寫清楚。
Rask AI 教學:把一支中文影片翻成日文配音,我實測的完整流程與踩雷筆記
上個月我幫台中一家做手工皂的品牌整理 YouTube 頻道。三十幾支中文影片,老闆想推日本市場,問我找配音員重錄要多少錢。我問了兩家後製,一分鐘成品兩千五到四千台幣,三十支、平均六分鐘,算下來是一台機車的錢。老闆的表情我到現在還記得。
那天下午我就把 Rask AI 開起來試。結果不是「完全取代配音員」那種童話,但預算壓到十分之一以下,日本那邊的合作夥伴看完樣片說「聽得出是 AI,但看得下去」。這篇把我實際跑過的流程、設定,還有幾個很花錢的坑寫清楚。
這是什麼工具
Rask AI 是一個做「影片在地化」的平台,總部在歐洲,主力就是把你既有的影片換成另一種語言的配音。它跟一般翻譯軟體不一樣的地方在於,它不是只給你字幕,而是走完整條龍:自動聽打逐字稿、翻譯、用你原本講者的聲線生成目標語言的語音、再選配唇形同步。
官方頁面目前寫的支援範圍是翻譯 130 種以上語言(有些子頁面寫 135),語音克隆則是 32 種語言。中文、日文、韓文、英文這些台灣品牌最常出海的語言都在裡面。數字官方偶爾會調,以 rask.ai 當下頁面為準。
說穿了,它服務的對象很明確:手上已經有影片庫、想低成本開新語言市場的人。YouTuber、線上課程講師、做產品教學影片的行銷,這三種人用它最有感。
它能做什麼(與不能做什麼)
能做的部分:多語配音是核心,一支影片可以同時派好幾個語言的工作。語音克隆會抓原講者音色,我自己的聲音翻成日文,像度我給七成五,語調偏平但不到機器人。多講者辨識認得出對談影片裡的兩三個人並各自配聲線。唇形同步是另一層運算,正臉近景效果最好。字幕可以下載 SRT、VTT,也能上傳自己校好的 SRT 蓋掉它的翻譯。另外還有翻譯字典跟翻譯提示詞,這兩個是專業用戶的分水嶺。量大有 API 可以批次跑。
不能做的部分要講清楚,這裡最容易期待落空。它不是影片剪輯軟體,轉場、字卡、B-roll、封面都做不了,我通常配音出來再丟 VEED.IO 收尾。它救不了爛收音,原始音檔有回音、環境噪音蓋過人聲,聽打就會錯,錯的逐字稿翻出來是災難。它不保證專有名詞正確。它也不是即時直播翻譯,是離線批次處理。
還有一點,中文轉出去的效果比英文轉出去差一些。斷句、破音字、數字讀法本來就難,我遇過「三十二克」被讀成怪腔,也遇過台語詞被硬翻。台語目前沒有正式支援。
怎麼用:步驟拆解
步驟零:整理素材(五到十分鐘)
這步很多人跳過然後回頭重做。輸出 1080p、人聲清楚的版本,背景音樂如果壓過人聲先降下來或拿掉,有原始無配樂人聲軌就用那個。先挑一支三到五分鐘的來試水溫,不要一開始就丟三十分鐘的講座。
步驟一:建立專案(約一分鐘)
登入後在 Dashboard 右上角按新增專案,把檔案拖進去或貼 YouTube 網址。接著設定三件事:來源語言(手動指定成中文,別讓它自動偵測,中英夾雜常猜錯)、目標語言(可複選但各自計費,先只勾一個)、講者數量。要語音克隆的話,記得把 voice cloning 開關打開,不然會給你預設的合成聲。
步驟二:等它跑(三分鐘影片大概五到十五分鐘)
等待時間看伺服器忙不忙,歐洲白天時段比較慢。跑完會寄信通知,可以先去忙別的。
步驟三:校對逐字稿與翻譯(真正花時間的地方)
進編輯器後,左邊是一段一段的字幕區塊,右邊是播放器,原文跟譯文都能直接改。我的習慣是先把中文原文從頭掃一遍修掉聽錯的字,再看譯文。一支十分鐘的影片,這步大概花三十到四十分鐘。
改完文字之後,那段的語音要按重新生成才會更新。很多人第一次用會漏掉,結果匯出來還是舊的聲音。
步驟四:處理長度爆掉的段落
中文翻日文,字數常膨脹三成以上,於是譯文講不完被切掉,或語速被壓到聽不清。編輯器可以調整單段時間長度,也可以允許某段超出原時間軸。我的做法是回頭把譯文改短,通常比硬拉時間軸自然。
步驟五:唇形同步(選配,要再等一輪)
配音定稿之後才開 lip-sync,它是另一層運算,改一次文字就要重跑一次。
步驟六:匯出
可以只下載配音音軌(我常這樣做,拿回剪輯軟體對時間軸),也可以下載燒好的 MP4 或 SRT/VTT 字幕檔。
進階技巧
一、開工前先建翻譯字典。 把品牌名、產品名、講者名字、術語通通丟進 Glossary。我那個客戶的產品叫「艾草皂」,沒設字典時被翻成「ヨモギ石鹸」,設了才照他們日本官網的寫法走。這步省下的修改時間,遠多於建字典的那十分鐘。
二、用翻譯提示詞控語氣。 這是我覺得最被低估的功能。可以直接複製這段去改:
Translate into casual spoken Japanese suitable for a YouTube lifestyle channel.
Keep the brand name "XXXX" in Latin letters, do not translate it.
Use short sentences under 25 characters; avoid formal keigo except in the closing line.
Convert measurements to the metric phrasing a Japanese speaker would say aloud.
兩邊我都試過,英文提示詞的遵守度明顯好一點。
三、先出三十秒試片再燒整支。 分鐘數就是錢。剪一段有正臉、有專有名詞、有數字的三十秒片段先跑一輪,確認音色跟語氣再送整支。我自己懶得做這步,浪費過八分鐘額度。
四、外部先翻,再回丟 SRT。 品質要求高的案子,我會下載原文 SRT,丟給 ChatGPT 翻一版,人工修完再上傳回 Rask 生成語音。翻譯品質由你掌控,Rask 只負責發聲。多花二十分鐘,成品差一個檔次。
五、配音跟剪輯分開做。 它的編輯器是為了對時間軸而存在,不是為了做內容。拿到音軌之後回原本的剪輯流程處理字卡、片頭跟社群比例。
注意事項與常見坑
計費按影片分鐘數,而且每個語言各算一份。 一支十分鐘影片翻三個語言就是三十分鐘,這是最多人結帳後才發現的事。方案目前分免費試用三分鐘、Creator、Creator Pro、Business 與 Enterprise。以官網公布的數字,Creator 月繳 60 美元、年繳約每月 33 美元;Creator Pro 月繳 150 美元、年繳約每月 78 美元;Business 月繳 750 美元,超額每分鐘 3 美元。幣別是美元,官網還掛著價格即將調整的字樣,實際以結帳頁為準。
年繳跟月繳的額度算法不一樣。 年繳給全年總分鐘數,月繳是每月額度且通常不累積。一季集中做一批的年繳划算,每週穩定出片的月繳彈性好。
聲音跟肖像要拿到授權。 語音克隆用的是真人音色,要複製誰的聲音就要有那個人的書面同意。台灣民法上的人格權、個資法對聲紋這類生物特徵的認定,都不是能打模糊仗的區域。影片裡有員工、來賓、路人的,做多語版本前把授權範圍問清楚。
背景音樂的授權不會因為翻譯而消失。 原本只授權台灣地區使用的配樂,做成日文版丟去日本,還是同一個問題。
唇形同步不是萬靈丹。 訪談、演講這種正面單人鏡頭值得開;側臉、走動拍攝、多人同框開了嘴部會糊,那種情況我寧可只換聲音。
替代方案比一比
HeyGen — 手上沒有現成影片、只有文字稿的話,它的數位分身可以直接生一個人出來講,介面也比 Rask 好上手。適合行銷團隊快速產一堆短版素材。
ElevenLabs — 純語音派。Podcast、旁白、有聲書這種沒有對嘴需求的內容,成本更低、音質細節更好,API 也好接。缺點是影片端流程要自己組。
VEED.IO — 需求如果是多語字幕而不是多語配音,它的字幕語言涵蓋更廣,又能順手把影片剪完。配音語言數則比 Rask 少一截。
簡單分:要配音深度選 Rask,要生人出來講選 HeyGen,只要聲音選 ElevenLabs,要字幕加剪輯選 VEED。
TheAI學院 評語
Rask AI 把「配音在地化」這件事做到目前市面上最深的一層,但它按分鐘計價的邏輯,會逼你養成先校稿、再生成的紀律——這對成品品質其實是好事。
給台灣讀者的具體建議:別急著年繳。先用免費的三分鐘,拿自己的聲音跑一次中文轉日文,聽聽看音色像不像、語氣受不受得了。接著算清楚未來十二個月「真的」要出幾分鐘外語影片,乘以語言數再去對照方案。多數台灣中小品牌一年用不到三百分鐘,年繳的 Creator 就夠,跳到 Pro 通常是為了多講者唇形同步跟團隊協作,不是為了額度。
還有個很實際的做法:第一支先出字幕版丟到目標市場測水溫,數據有起色再回頭做配音版。翻譯是成本,市場驗證才是重點。
資料來源
常見問題
Rask AI 支援中文和台語嗎?
中文(含繁體、簡體)在支援範圍內,翻譯語言官方頁面寫 130 種以上、語音克隆 32 種語言,中日英韓等常見出海語言都有。台語目前沒有正式支援,影片裡的台語詞會被當成中文硬翻,遇到這種素材要先人工改逐字稿。實際支援清單以 rask.ai 官網當下頁面為準。
Rask AI 怎麼計費?翻多個語言會多收錢嗎?
按影片分鐘數計費,而且每個目標語言各算一份。一支十分鐘影片翻三個語言就是消耗三十分鐘額度,這是最多人結帳後才發現的事。官方目前有免費三分鐘試用,付費分 Creator、Creator Pro、Business 與 Enterprise,價格以美元計價且官網標示可能調整,請以結帳頁為準。
語音克隆別人的聲音會有法律問題嗎?
會。複製真人音色前要取得本人書面同意,影片中出現的員工、來賓也一樣。台灣民法的人格權保護、個資法對聲紋這類生物特徵的規範都適用,商業用途更不能省略授權文件。另外提醒,原影片的背景音樂授權範圍不會因為做了外語版就自動延伸到新市場。
唇形同步一定要開嗎?
看畫面類型。訪談、演講這種正臉、單人、鏡頭穩定的素材開了加分明顯;產品操作、走動拍攝、多人同框的畫面開了嘴部容易糊,反而扣分。另外唇形同步是額外一層運算,文字改一次就要重跑一次,建議配音定稿之後再開。