AI 配音与声音克隆实战:怎么让你的声音讲日文、英文而不出戏

多益金色证书的创作者,录两个半小时只完成四分钟英文旁白,因为听起来不像他。这篇谈合成语音与声音克隆的取舍、素材录制清单、让 AI 讲外语不出戏的三个技巧,以及 2026 年不能踩的合规红线。

AI 配音与声音克隆实战:怎么让你的声音讲日文、英文而不出戏

去年年底,我在内湖一间小型制作公司的录音间里,看一位做知识型频道的创作者 Ken 录他的英文版旁白。他英文其实不差,多益金色证书,但录了两个半小时,只完成四分钟的成片。原因不是文法错,是「听起来不像他」—— 中文版的他语速快、会停顿、会突然拉高音强调重点;英文版的他,像在念课本。

那天他半开玩笑说:「干脆让 AI 用我的声音讲英文算了。」

三个月后他真的这样做了。而且说真的,效果比他自己硬念好。

声音克隆这件事在 2026 年已经不是技术问题了,是判断问题:什么时候该用、用哪一种、以及哪些线不能踩。

合成语音 vs. 声音克隆:不要一开始就克隆

先把两件事分开。

合成语音是用平台现成的声库,挑一个听起来顺的声音来念稿。优点是快、便宜、没有法律风险,缺点是没有辨识度 —— 你的日文版听起来会跟另外三千个频道一样。

声音克隆是拿你自己的录音去训练一个声音模型,让它用你的音色讲其他语言。优点是品牌一致性,缺点是门槛、成本、还有一堆合规要处理。

我的判断标准很简单:你的脸或声音本身是不是品牌的一部分? 如果是知识型 KOL、老板现身说法、个人品牌,克隆值得做。如果是产品说明、电商开箱、企业内训这种「谁讲都可以」的内容,直接用合成语音,省下来的力气拿去做别的。

ElevenLabs 上千种现成声库够你挑到天亮,何必为了一支月观看三千的产品影片去训练声音模型。

两种克隆等级,差在哪

以 ElevenLabs 为例(其他平台逻辑类似),克隆分两个等级:

即时克隆(Instant Voice Clone) — 上传一到几分钟干净录音,几分钟内就有声音。适合试水温、内部测试、社群短影音。缺点是情绪层次浅,长句容易露馅,尤其是问句和语气词。

专业克隆(Professional Voice Clone) — 官方文件建议至少 30 分钟、要做到量产品质建议 3 小时的一致性录音室级素材,而且要通过身分验证才能开始训练。你只能克隆自己的声音,就算对方同意,也不能拿别人的声音来训。这条规则写在官方文件里,不是模糊地带。

我的实测心得:即时克隆做中文很像、做英文有六七成像、做日文大概五成。专业克隆做完之后,英文可以到八成五,日文大概七成五 —— 日文的音节结构跟中文差太多,母音长度、促音、语尾上扬这些细节,模型还是会有点卡。

值得知道的是,Eleven v3 在 2026 年 2 月正式推出,官方标示支援 70 种以上语言,还加了音讯标签(audio tags)跟多人对话。音讯标签是我认为最实用的更新,它让你可以在稿子里标记语气,而不是祈祷模型猜对。

录素材:这一步决定成败,而且没有捷径

克隆效果的上限,在你按下录音键的那一刻就决定了。我看过太多人花钱买方案、结果拿手机在咖啡厅录的素材去训练,然后抱怨「听起来很机械」。

给台湾创作者的实务建议:

【声音克隆素材录制清单】

环境
□ 房间要有软装(床、窗帘、衣柜),不要在浴室或空房间
□ 关冷气、关除湿机、手机转静音(不是震动)
□ 麦克风距离嘴 15-20 公分,斜 30 度避开气爆音

设备(台湾现实预算版)
□ 3,000 元以下:手机 + 领夹式麦克风,效果比想像中好
□ 5,000-8,000 元:入门 USB 麦克风(动圈优于电容,房间烂的话特别明显)
□ 别买 RGB 灯效那种直播麦,那是给游戏直播用的

内容(重点:涵盖你真实的说话方式)
□ 30 分钟以上,同一天、同一支麦、同一个位置录完
□ 念稿 15 分钟 + 自由讲话 15 分钟(自由讲话很重要)
□ 要包含:陈述句、问句、笑声、强调、停顿、数字、英文夹杂
□ 语速维持你平常的样子,不要刻意放慢

后制
□ 只做降噪与去除环境嗡声,不要上压缩、不要 EQ、不要修饰
□ 剪掉咳嗽、吞口水、明显口误
□ 输出 WAV,不要 MP3 再压一次

「自由讲话 15 分钟」那项我特别想强调。只喂念稿素材,模型学到的是你的朗读腔;喂自由对话,它才学得到你讲话的呼吸与节奏。差别在成品上非常明显。

让 AI 讲外语不出戏的三个技巧

技巧一:稿子要先在地化,不是先翻译。 这点跟 影片在地化流程 那篇讲的一样。中文的长句结构直翻成日文,语音模型会用很怪的地方换气。正确做法是让 LLM 先把稿子改写成「当地人讲话的句长」。

技巧二:用标记控制语气,不要靠标点符号。 这是我的实战提示词,配 ClaudeChatGPT 用:

你是配音导演。以下是一段要用 AI 语音合成的日文旁白稿。

请帮我做三件事:
1. 依照口语呼吸节奏重新断句,每句不超过 20 个音节;
   过长的句子拆开,必要时改写句型
2. 在需要语气变化的位置插入标记:
   [pause-short] [pause-long] [emphasis] [warm] [excited]
3. 把所有阿拉伯数字、英文缩写、单位,改写成日文的口语念法
   (例:50% → 五割、AI → エーアイ)

输出:标记后的稿子 + 一份「我改动了什么」的清单,
并标出 3 个你认为 AI 语音最容易念错或听起来不自然的位置,说明原因。

技巧三:先做 30 秒样本给母语者听。 全片产出前,一定先做一小段。我通常会直接问对方一句话:「这个人听起来像哪里人?」如果回答「听不太出来,但有点外国腔」,那就是及格线。如果回答「像导航语音」,回去重调。

成本怎么算:一支 10 分钟影片,四种语言

拿 2026 年 7 月的官网公开价位抓个概念(方案会变,请自行确认):

  • ElevenLabs Creator 方案 22 美元/月,含约 50 分钟配音额度;Pro 方案 99 美元/月,约 250 分钟。超额后每分钟从 Creator 的 0.6 美元、到 Business 的 0.24 美元不等。
  • 关键陷阱:每种语言分开计费。10 分钟影片 × 4 种语言 = 40 分钟额度。
  • 想要对嘴的话,HeyGen 带 lip-sync 的完整翻译是 5 credits/分钟;Rask AI 的对嘴要到 Creator Pro(150 美元/月)才开,官网也注明语音克隆支援的语言数少于总翻译语言数。

换算下来,一支 10 分钟影片做四种语言的配音,成本大概落在几百到一两千台币之间。对照传统录音室一种语言三万起跳,这个落差就是台湾中小企业能不能出海的分水岭。

合规:这条线真的不要踩

2025 到 2026 年,声音的法律环境明显收紧。美国已有多州立法规范声音克隆(田纳西州的 ELVIS Act 是代表),欧盟 AI 法案也把揭露与书面同意从「最佳实务」变成义务。

台湾目前没有专法,但如果你的内容要上架到日本、欧美平台,或接跨国品牌的案子,对方的法务会问。实务上请做到三件事:只克隆自己的声音;接案时把「声音使用范围与期限」写进合约;商业影片在说明栏注明使用 AI 语音。

这不是道德说教,是保护你自己。我看过有人拿艺人声音做示范影片被下架,帐号还被限流三个月。省一时的方便,赔掉整个频道,不划算。

TheAI学院 总结与评语

AI 能复制你的音色,但复制不了你为什么要开口 —— 稿子写得烂,克隆得再像也是白搭。

给台湾创作者的具体建议:先花一个周末,用手机加一支千元领夹麦,录 30 分钟干净素材,做一次即时克隆试水温,总成本不到一千块。觉得有搞头,再升级专业克隆和好一点的麦克风。顺序反过来的人,通常会买了一堆器材、然后放着长灰尘。

还有,别把 AI 配音当成「不用露脸」的偷懒方案。它是让你把省下来的三十个小时,拿去做内容本身。想找更多配音稿与在地化提示词,提示词库 有现成的可以改。

资料来源

常见问题

即时克隆和专业克隆该选哪一个?

先做即时克隆试水温。上传一到几分钟干净录音、几分钟就有结果,适合社群短影音和内部测试,成本几乎为零。如果你的声音是品牌的一部分、而且确认要长期做多语内容,再升级专业克隆。ElevenLabs 官方文件建议专业克隆至少 30 分钟素材、要做到量产品质则建议 3 小时,并需通过身分验证。

声音克隆需要多好的麦克风?手机可以吗?

手机加一支千元内的领夹式麦克风,在安静有软装的房间里录,效果比很多人想像中好。决定品质的其实是环境而不是器材:关掉冷气与除湿机、避开空房间的回音、麦克风距离嘴 15 到 20 公分并稍微侧开,这几件事的影响远大于升级麦克风。后制只做降噪,不要上压缩或 EQ。

可以用别人的声音做克隆吗?例如老板或艺人?

不行。以 ElevenLabs 为例,官方明确规定专业克隆只能克隆自己的声音,就算取得对方同意也不能替他人建立。2025 到 2026 年法律环境也明显收紧,美国多州已立法规范声音克隆,欧盟 AI 法案把揭露与书面同意变成义务。接案时务必把声音使用范围与期限写进合约,商业影片在说明栏注明使用 AI 语音。

一支 10 分钟影片做四种语言配音,大概要花多少钱?

以 2026 年 7 月的官网公开价位估算,大约落在几百到一两千元台币之间,远低于传统录音室单一语言三万起跳的行情。要留意的是多数平台采每种语言分开计费,10 分钟影片乘以 4 种语言等于扣掉 40 分钟额度,不是 10 分钟。想要对嘴功能通常要升级到更高阶方案,成本会再往上跳一阶。

繁體中文版 →