Chatterbox
MIT 授權的開源 TTS,盲測有 65% 的人覺得比 ElevenLabs 好聽
Chatterbox 是 Resemble AI 推出的第一個生產等級開源 TTS 模型,採 MIT 授權,這在語音生成領域相當罕見——多數開源語音模型都有非商業或研究限制。
功能特色與適用場景
它有幾個規格值得認真看待。第一,它是第一個支援情緒誇張度控制(emotion exaggeration)的開源 TTS,你可以調整語氣的強烈程度,而不是只能得到一種平板的朗讀腔。第二,延遲低於 200 毫秒,這個數字讓它可以放進即時的語音代理與互動應用,而不只是離線批次生成。第三,支援 23 種以上語言。
模型本身是 5 億參數,基於 CosyVoice 風格的改良 Llama 架構,用約 50 萬小時的清理過音訊訓練。官方公布的盲測結果是:65.3% 的聽眾偏好 Chatterbox-Turbo、24.5% 偏好 ElevenLabs、10.2% 沒有偏好——這個數字要打點折扣看(廠商自己做的測試),但至少說明它已經進入可用等級。
MIT 授權加上本機部署的組合,讓它特別適合三種情境:需要大量生成、雲端 API 成本吃不消的;資料不能出境的;以及想把 TTS 嵌進自家產品但不想被 API 供應商綁死的。
代價是你得自己處理部署、GPU 資源與模型更新。對沒有 ML 工程能力的團隊,付錢用 API 仍然比較划算——這件事不要因為「開源免費」四個字就搞錯。
TheAI學院 編輯建議
編輯實測後的真心話開源 TTS 這幾年最大的問題一直是授權——好用的不能商用,能商用的不好聽。Chatterbox 用 MIT 把這道牆拆了,光這一點就值得注意。但別忘了自架的隱藏成本:GPU、維運、更新,這些加起來未必比買 API 便宜。
主要功能
- MIT 授權,商用完全免費
- 首個支援情緒誇張度控制的開源 TTS
- 延遲低於 200 毫秒,可用於即時語音代理
- 支援 23 種以上語言
- 5 億參數,約 50 萬小時音訊訓練
- 可完全本機或私有雲部署
適用場景
- 大量語音生成,避開 API 用量計費
- 資料不得出境的政府或金融語音應用
- 即時語音代理的語音輸出層
- 嵌入自家產品的離線語音功能
Chatterbox 的優點與缺點
優點
- MIT 授權讓商用零授權成本,這在語音模型裡很少見
- 本機部署,資料不出境也不受 API 限速影響
- 延遲夠低,可以放進即時互動場景
缺點
- 需要自行處理部署、GPU 與模型維護
- 官方盲測數據為廠商自行發布,應保留判斷空間
- 中文表現需自行驗證,未必優於專用中文模型
價格方案
MIT 授權開源,可自行部署;商用亦免費
Chatterbox 常見問題
真的可以商用嗎?
MIT 授權允許商業使用、修改與再散布,這是最寬鬆的開源授權之一。不過使用時仍需注意:訓練資料的合法性與你生成的內容本身,仍是使用者的責任,尤其是模仿特定人聲的用途。
要什麼樣的硬體才跑得動?
5 億參數的模型在消費級 GPU 上可運行,實際延遲取決於顯卡與量化設定。要達到官方宣稱的 200 毫秒以下延遲,通常需要合適的 GPU 與最佳化設定,純 CPU 推論會慢很多。
使用者評價
還沒有足夠評價,搶先分享你的使用心得!
寫下你的評價
Chatterbox 的替代方案
查看相似的 AI 工具 →相關 AI 工具
猜你也想看的AI 語音生成
更多加拿大的 AI 工具
同樣來自加拿大的 AI 工具,一起看看。