AI 配音與聲音克隆實戰:怎麼讓你的聲音講日文、英文而不出戲

AI 配音與聲音克隆實戰:怎麼讓你的聲音講日文、英文而不出戲

多益金色證書的創作者,錄兩個半小時只完成四分鐘英文旁白,因為聽起來不像他。這篇談合成語音與聲音克隆的取捨、素材錄製清單、讓 AI 講外語不出戲的三個技巧,以及 2026 年不能踩的合規紅線。

AI 配音與聲音克隆實戰:怎麼讓你的聲音講日文、英文而不出戲

去年年底,我在內湖一間小型製作公司的錄音間裡,看一位做知識型頻道的創作者 Ken 錄他的英文版旁白。他英文其實不差,多益金色證書,但錄了兩個半小時,只完成四分鐘的成片。原因不是文法錯,是「聽起來不像他」—— 中文版的他語速快、會停頓、會突然拉高音強調重點;英文版的他,像在唸課本。

那天他半開玩笑說:「乾脆讓 AI 用我的聲音講英文算了。」

三個月後他真的這樣做了。而且說真的,效果比他自己硬唸好。

聲音克隆這件事在 2026 年已經不是技術問題了,是判斷問題:什麼時候該用、用哪一種、以及哪些線不能踩。

合成語音 vs. 聲音克隆:不要一開始就克隆

先把兩件事分開。

合成語音是用平台現成的聲庫,挑一個聽起來順的聲音來唸稿。優點是快、便宜、沒有法律風險,缺點是沒有辨識度 —— 你的日文版聽起來會跟另外三千個頻道一樣。

聲音克隆是拿你自己的錄音去訓練一個聲音模型,讓它用你的音色講其他語言。優點是品牌一致性,缺點是門檻、成本、還有一堆合規要處理。

我的判斷標準很簡單:你的臉或聲音本身是不是品牌的一部分? 如果是知識型 KOL、老闆現身說法、個人品牌,克隆值得做。如果是產品說明、電商開箱、企業內訓這種「誰講都可以」的內容,直接用合成語音,省下來的力氣拿去做別的。

ElevenLabs 上千種現成聲庫夠你挑到天亮,何必為了一支月觀看三千的產品影片去訓練聲音模型。

兩種克隆等級,差在哪

以 ElevenLabs 為例(其他平台邏輯類似),克隆分兩個等級:

即時克隆(Instant Voice Clone) — 上傳一到幾分鐘乾淨錄音,幾分鐘內就有聲音。適合試水溫、內部測試、社群短影音。缺點是情緒層次淺,長句容易露餡,尤其是問句和語氣詞。

專業克隆(Professional Voice Clone) — 官方文件建議至少 30 分鐘、要做到量產品質建議 3 小時的一致性錄音室級素材,而且要通過身分驗證才能開始訓練。你只能克隆自己的聲音,就算對方同意,也不能拿別人的聲音來訓。這條規則寫在官方文件裡,不是模糊地帶。

我的實測心得:即時克隆做中文很像、做英文有六七成像、做日文大概五成。專業克隆做完之後,英文可以到八成五,日文大概七成五 —— 日文的音節結構跟中文差太多,母音長度、促音、語尾上揚這些細節,模型還是會有點卡。

值得知道的是,Eleven v3 在 2026 年 2 月正式推出,官方標示支援 70 種以上語言,還加了音訊標籤(audio tags)跟多人對話。音訊標籤是我認為最實用的更新,它讓你可以在稿子裡標記語氣,而不是祈禱模型猜對。

錄素材:這一步決定成敗,而且沒有捷徑

克隆效果的上限,在你按下錄音鍵的那一刻就決定了。我看過太多人花錢買方案、結果拿手機在咖啡廳錄的素材去訓練,然後抱怨「聽起來很機械」。

給台灣創作者的實務建議:

【聲音克隆素材錄製清單】

環境
□ 房間要有軟裝(床、窗簾、衣櫃),不要在浴室或空房間
□ 關冷氣、關除濕機、手機轉靜音(不是震動)
□ 麥克風距離嘴 15-20 公分,斜 30 度避開氣爆音

設備(台灣現實預算版)
□ 3,000 元以下:手機 + 領夾式麥克風,效果比想像中好
□ 5,000-8,000 元:入門 USB 麥克風(動圈優於電容,房間爛的話特別明顯)
□ 別買 RGB 燈效那種直播麥,那是給遊戲直播用的

內容(重點:涵蓋你真實的說話方式)
□ 30 分鐘以上,同一天、同一支麥、同一個位置錄完
□ 唸稿 15 分鐘 + 自由講話 15 分鐘(自由講話很重要)
□ 要包含:陳述句、問句、笑聲、強調、停頓、數字、英文夾雜
□ 語速維持你平常的樣子,不要刻意放慢

後製
□ 只做降噪與去除環境嗡聲,不要上壓縮、不要 EQ、不要修飾
□ 剪掉咳嗽、吞口水、明顯口誤
□ 輸出 WAV,不要 MP3 再壓一次

「自由講話 15 分鐘」那項我特別想強調。只餵唸稿素材,模型學到的是你的朗讀腔;餵自由對話,它才學得到你講話的呼吸與節奏。差別在成品上非常明顯。

讓 AI 講外語不出戲的三個技巧

技巧一:稿子要先在地化,不是先翻譯。 這點跟 影片在地化流程 那篇講的一樣。中文的長句結構直翻成日文,語音模型會用很怪的地方換氣。正確做法是讓 LLM 先把稿子改寫成「當地人講話的句長」。

技巧二:用標記控制語氣,不要靠標點符號。 這是我的實戰提示詞,配 ClaudeChatGPT 用:

你是配音導演。以下是一段要用 AI 語音合成的日文旁白稿。

請幫我做三件事:
1. 依照口語呼吸節奏重新斷句,每句不超過 20 個音節;
   過長的句子拆開,必要時改寫句型
2. 在需要語氣變化的位置插入標記:
   [pause-short] [pause-long] [emphasis] [warm] [excited]
3. 把所有阿拉伯數字、英文縮寫、單位,改寫成日文的口語唸法
   (例:50% → 五割、AI → エーアイ)

輸出:標記後的稿子 + 一份「我改動了什麼」的清單,
並標出 3 個你認為 AI 語音最容易唸錯或聽起來不自然的位置,說明原因。

技巧三:先做 30 秒樣本給母語者聽。 全片產出前,一定先做一小段。我通常會直接問對方一句話:「這個人聽起來像哪裡人?」如果回答「聽不太出來,但有點外國腔」,那就是及格線。如果回答「像導航語音」,回去重調。

成本怎麼算:一支 10 分鐘影片,四種語言

拿 2026 年 7 月的官網公開價位抓個概念(方案會變,請自行確認):

  • ElevenLabs Creator 方案 22 美元/月,含約 50 分鐘配音額度;Pro 方案 99 美元/月,約 250 分鐘。超額後每分鐘從 Creator 的 0.6 美元、到 Business 的 0.24 美元不等。
  • 關鍵陷阱:每種語言分開計費。10 分鐘影片 × 4 種語言 = 40 分鐘額度。
  • 想要對嘴的話,HeyGen 帶 lip-sync 的完整翻譯是 5 credits/分鐘;Rask AI 的對嘴要到 Creator Pro(150 美元/月)才開,官網也註明語音克隆支援的語言數少於總翻譯語言數。

換算下來,一支 10 分鐘影片做四種語言的配音,成本大概落在幾百到一兩千台幣之間。對照傳統錄音室一種語言三萬起跳,這個落差就是台灣中小企業能不能出海的分水嶺。

合規:這條線真的不要踩

2025 到 2026 年,聲音的法律環境明顯收緊。美國已有多州立法規範聲音克隆(田納西州的 ELVIS Act 是代表),歐盟 AI 法案也把揭露與書面同意從「最佳實務」變成義務。

台灣目前沒有專法,但如果你的內容要上架到日本、歐美平台,或接跨國品牌的案子,對方的法務會問。實務上請做到三件事:只克隆自己的聲音;接案時把「聲音使用範圍與期限」寫進合約;商業影片在說明欄註明使用 AI 語音。

這不是道德說教,是保護你自己。我看過有人拿藝人聲音做示範影片被下架,帳號還被限流三個月。省一時的方便,賠掉整個頻道,不划算。

TheAI學院 總結與評語

AI 能複製你的音色,但複製不了你為什麼要開口 —— 稿子寫得爛,克隆得再像也是白搭。

給台灣創作者的具體建議:先花一個週末,用手機加一支千元領夾麥,錄 30 分鐘乾淨素材,做一次即時克隆試水溫,總成本不到一千塊。覺得有搞頭,再升級專業克隆和好一點的麥克風。順序反過來的人,通常會買了一堆器材、然後放著長灰塵。

還有,別把 AI 配音當成「不用露臉」的偷懶方案。它是讓你把省下來的三十個小時,拿去做內容本身。想找更多配音稿與在地化提示詞,提示詞庫 有現成的可以改。

資料來源

常見問題

即時克隆和專業克隆該選哪一個?

先做即時克隆試水溫。上傳一到幾分鐘乾淨錄音、幾分鐘就有結果,適合社群短影音和內部測試,成本幾乎為零。如果你的聲音是品牌的一部分、而且確認要長期做多語內容,再升級專業克隆。ElevenLabs 官方文件建議專業克隆至少 30 分鐘素材、要做到量產品質則建議 3 小時,並需通過身分驗證。

聲音克隆需要多好的麥克風?手機可以嗎?

手機加一支千元內的領夾式麥克風,在安靜有軟裝的房間裡錄,效果比很多人想像中好。決定品質的其實是環境而不是器材:關掉冷氣與除濕機、避開空房間的迴音、麥克風距離嘴 15 到 20 公分並稍微側開,這幾件事的影響遠大於升級麥克風。後製只做降噪,不要上壓縮或 EQ。

可以用別人的聲音做克隆嗎?例如老闆或藝人?

不行。以 ElevenLabs 為例,官方明確規定專業克隆只能克隆自己的聲音,就算取得對方同意也不能替他人建立。2025 到 2026 年法律環境也明顯收緊,美國多州已立法規範聲音克隆,歐盟 AI 法案把揭露與書面同意變成義務。接案時務必把聲音使用範圍與期限寫進合約,商業影片在說明欄註明使用 AI 語音。

一支 10 分鐘影片做四種語言配音,大概要花多少錢?

以 2026 年 7 月的官網公開價位估算,大約落在幾百到一兩千元台幣之間,遠低於傳統錄音室單一語言三萬起跳的行情。要留意的是多數平台採每種語言分開計費,10 分鐘影片乘以 4 種語言等於扣掉 40 分鐘額度,不是 10 分鐘。想要對嘴功能通常要升級到更高階方案,成本會再往上跳一階。