AI 配音與聲音克隆實戰:怎麼讓你的聲音講日文、英文而不出戲
多益金色證書的創作者,錄兩個半小時只完成四分鐘英文旁白,因為聽起來不像他。這篇談合成語音與聲音克隆的取捨、素材錄製清單、讓 AI 講外語不出戲的三個技巧,以及 2026 年不能踩的合規紅線。
AI 配音與聲音克隆實戰:怎麼讓你的聲音講日文、英文而不出戲
去年年底,我在內湖一間小型製作公司的錄音間裡,看一位做知識型頻道的創作者 Ken 錄他的英文版旁白。他英文其實不差,多益金色證書,但錄了兩個半小時,只完成四分鐘的成片。原因不是文法錯,是「聽起來不像他」—— 中文版的他語速快、會停頓、會突然拉高音強調重點;英文版的他,像在唸課本。
那天他半開玩笑說:「乾脆讓 AI 用我的聲音講英文算了。」
三個月後他真的這樣做了。而且說真的,效果比他自己硬唸好。
聲音克隆這件事在 2026 年已經不是技術問題了,是判斷問題:什麼時候該用、用哪一種、以及哪些線不能踩。
合成語音 vs. 聲音克隆:不要一開始就克隆
先把兩件事分開。
合成語音是用平台現成的聲庫,挑一個聽起來順的聲音來唸稿。優點是快、便宜、沒有法律風險,缺點是沒有辨識度 —— 你的日文版聽起來會跟另外三千個頻道一樣。
聲音克隆是拿你自己的錄音去訓練一個聲音模型,讓它用你的音色講其他語言。優點是品牌一致性,缺點是門檻、成本、還有一堆合規要處理。
我的判斷標準很簡單:你的臉或聲音本身是不是品牌的一部分? 如果是知識型 KOL、老闆現身說法、個人品牌,克隆值得做。如果是產品說明、電商開箱、企業內訓這種「誰講都可以」的內容,直接用合成語音,省下來的力氣拿去做別的。
ElevenLabs 上千種現成聲庫夠你挑到天亮,何必為了一支月觀看三千的產品影片去訓練聲音模型。
兩種克隆等級,差在哪
以 ElevenLabs 為例(其他平台邏輯類似),克隆分兩個等級:
即時克隆(Instant Voice Clone) — 上傳一到幾分鐘乾淨錄音,幾分鐘內就有聲音。適合試水溫、內部測試、社群短影音。缺點是情緒層次淺,長句容易露餡,尤其是問句和語氣詞。
專業克隆(Professional Voice Clone) — 官方文件建議至少 30 分鐘、要做到量產品質建議 3 小時的一致性錄音室級素材,而且要通過身分驗證才能開始訓練。你只能克隆自己的聲音,就算對方同意,也不能拿別人的聲音來訓。這條規則寫在官方文件裡,不是模糊地帶。
我的實測心得:即時克隆做中文很像、做英文有六七成像、做日文大概五成。專業克隆做完之後,英文可以到八成五,日文大概七成五 —— 日文的音節結構跟中文差太多,母音長度、促音、語尾上揚這些細節,模型還是會有點卡。
值得知道的是,Eleven v3 在 2026 年 2 月正式推出,官方標示支援 70 種以上語言,還加了音訊標籤(audio tags)跟多人對話。音訊標籤是我認為最實用的更新,它讓你可以在稿子裡標記語氣,而不是祈禱模型猜對。
錄素材:這一步決定成敗,而且沒有捷徑
克隆效果的上限,在你按下錄音鍵的那一刻就決定了。我看過太多人花錢買方案、結果拿手機在咖啡廳錄的素材去訓練,然後抱怨「聽起來很機械」。
給台灣創作者的實務建議:
【聲音克隆素材錄製清單】
環境
□ 房間要有軟裝(床、窗簾、衣櫃),不要在浴室或空房間
□ 關冷氣、關除濕機、手機轉靜音(不是震動)
□ 麥克風距離嘴 15-20 公分,斜 30 度避開氣爆音
設備(台灣現實預算版)
□ 3,000 元以下:手機 + 領夾式麥克風,效果比想像中好
□ 5,000-8,000 元:入門 USB 麥克風(動圈優於電容,房間爛的話特別明顯)
□ 別買 RGB 燈效那種直播麥,那是給遊戲直播用的
內容(重點:涵蓋你真實的說話方式)
□ 30 分鐘以上,同一天、同一支麥、同一個位置錄完
□ 唸稿 15 分鐘 + 自由講話 15 分鐘(自由講話很重要)
□ 要包含:陳述句、問句、笑聲、強調、停頓、數字、英文夾雜
□ 語速維持你平常的樣子,不要刻意放慢
後製
□ 只做降噪與去除環境嗡聲,不要上壓縮、不要 EQ、不要修飾
□ 剪掉咳嗽、吞口水、明顯口誤
□ 輸出 WAV,不要 MP3 再壓一次
「自由講話 15 分鐘」那項我特別想強調。只餵唸稿素材,模型學到的是你的朗讀腔;餵自由對話,它才學得到你講話的呼吸與節奏。差別在成品上非常明顯。
讓 AI 講外語不出戲的三個技巧
技巧一:稿子要先在地化,不是先翻譯。 這點跟 影片在地化流程 那篇講的一樣。中文的長句結構直翻成日文,語音模型會用很怪的地方換氣。正確做法是讓 LLM 先把稿子改寫成「當地人講話的句長」。
技巧二:用標記控制語氣,不要靠標點符號。 這是我的實戰提示詞,配 Claude 或 ChatGPT 用:
你是配音導演。以下是一段要用 AI 語音合成的日文旁白稿。
請幫我做三件事:
1. 依照口語呼吸節奏重新斷句,每句不超過 20 個音節;
過長的句子拆開,必要時改寫句型
2. 在需要語氣變化的位置插入標記:
[pause-short] [pause-long] [emphasis] [warm] [excited]
3. 把所有阿拉伯數字、英文縮寫、單位,改寫成日文的口語唸法
(例:50% → 五割、AI → エーアイ)
輸出:標記後的稿子 + 一份「我改動了什麼」的清單,
並標出 3 個你認為 AI 語音最容易唸錯或聽起來不自然的位置,說明原因。
技巧三:先做 30 秒樣本給母語者聽。 全片產出前,一定先做一小段。我通常會直接問對方一句話:「這個人聽起來像哪裡人?」如果回答「聽不太出來,但有點外國腔」,那就是及格線。如果回答「像導航語音」,回去重調。
成本怎麼算:一支 10 分鐘影片,四種語言
拿 2026 年 7 月的官網公開價位抓個概念(方案會變,請自行確認):
- ElevenLabs Creator 方案 22 美元/月,含約 50 分鐘配音額度;Pro 方案 99 美元/月,約 250 分鐘。超額後每分鐘從 Creator 的 0.6 美元、到 Business 的 0.24 美元不等。
- 關鍵陷阱:每種語言分開計費。10 分鐘影片 × 4 種語言 = 40 分鐘額度。
- 想要對嘴的話,HeyGen 帶 lip-sync 的完整翻譯是 5 credits/分鐘;Rask AI 的對嘴要到 Creator Pro(150 美元/月)才開,官網也註明語音克隆支援的語言數少於總翻譯語言數。
換算下來,一支 10 分鐘影片做四種語言的配音,成本大概落在幾百到一兩千台幣之間。對照傳統錄音室一種語言三萬起跳,這個落差就是台灣中小企業能不能出海的分水嶺。
合規:這條線真的不要踩
2025 到 2026 年,聲音的法律環境明顯收緊。美國已有多州立法規範聲音克隆(田納西州的 ELVIS Act 是代表),歐盟 AI 法案也把揭露與書面同意從「最佳實務」變成義務。
台灣目前沒有專法,但如果你的內容要上架到日本、歐美平台,或接跨國品牌的案子,對方的法務會問。實務上請做到三件事:只克隆自己的聲音;接案時把「聲音使用範圍與期限」寫進合約;商業影片在說明欄註明使用 AI 語音。
這不是道德說教,是保護你自己。我看過有人拿藝人聲音做示範影片被下架,帳號還被限流三個月。省一時的方便,賠掉整個頻道,不划算。
TheAI學院 總結與評語
AI 能複製你的音色,但複製不了你為什麼要開口 —— 稿子寫得爛,克隆得再像也是白搭。
給台灣創作者的具體建議:先花一個週末,用手機加一支千元領夾麥,錄 30 分鐘乾淨素材,做一次即時克隆試水溫,總成本不到一千塊。覺得有搞頭,再升級專業克隆和好一點的麥克風。順序反過來的人,通常會買了一堆器材、然後放著長灰塵。
還有,別把 AI 配音當成「不用露臉」的偷懶方案。它是讓你把省下來的三十個小時,拿去做內容本身。想找更多配音稿與在地化提示詞,提示詞庫 有現成的可以改。
資料來源
常見問題
即時克隆和專業克隆該選哪一個?
先做即時克隆試水溫。上傳一到幾分鐘乾淨錄音、幾分鐘就有結果,適合社群短影音和內部測試,成本幾乎為零。如果你的聲音是品牌的一部分、而且確認要長期做多語內容,再升級專業克隆。ElevenLabs 官方文件建議專業克隆至少 30 分鐘素材、要做到量產品質則建議 3 小時,並需通過身分驗證。
聲音克隆需要多好的麥克風?手機可以嗎?
手機加一支千元內的領夾式麥克風,在安靜有軟裝的房間裡錄,效果比很多人想像中好。決定品質的其實是環境而不是器材:關掉冷氣與除濕機、避開空房間的迴音、麥克風距離嘴 15 到 20 公分並稍微側開,這幾件事的影響遠大於升級麥克風。後製只做降噪,不要上壓縮或 EQ。
可以用別人的聲音做克隆嗎?例如老闆或藝人?
不行。以 ElevenLabs 為例,官方明確規定專業克隆只能克隆自己的聲音,就算取得對方同意也不能替他人建立。2025 到 2026 年法律環境也明顯收緊,美國多州已立法規範聲音克隆,歐盟 AI 法案把揭露與書面同意變成義務。接案時務必把聲音使用範圍與期限寫進合約,商業影片在說明欄註明使用 AI 語音。
一支 10 分鐘影片做四種語言配音,大概要花多少錢?
以 2026 年 7 月的官網公開價位估算,大約落在幾百到一兩千元台幣之間,遠低於傳統錄音室單一語言三萬起跳的行情。要留意的是多數平台採每種語言分開計費,10 分鐘影片乘以 4 種語言等於扣掉 40 分鐘額度,不是 10 分鐘。想要對嘴功能通常要升級到更高階方案,成本會再往上跳一階。