MVSEP 使用教學:一百多個分軌模型要怎麼挑?照這個順序試,十分鐘找到最合的那個
分軌工具最氣人的地方是「效果不好也沒得換」。MVSEP 反過來,把幾十種演算法全部開放讓你選——代價是第一次打開會完全不知道從哪按。這篇給你一套挑選流程。
一位做短影音的朋友傳訊息問我:「為什麼我分出來的人聲聽起來像在浴室裡唱歌?」
我請他把原曲傳給我。是一首八〇年代的台語老歌,錄音本身混響就很重,而他用的是預設模型。
換了一個模型重跑,水聲感少了七成。
這就是 MVSEP 存在的理由:分軌的效果,很大一部分取決於你挑了哪個模型,而多數工具不讓你挑。
MVSEP 是什麼
MVSEP(Music & Voice Separation)是一個線上音訊分離平台,用神經網路把一首歌拆成人聲、鼓、貝斯、吉他、鋼琴等分軌。它最大的特色是同時開放數十種不同的分離模型與其眾多變體讓你比較,而不是替你決定一個「最佳解」。
官網目前顯示每日 50 次免費分離,預設輸出 320 kbps 的 MP3,用排隊制處理(現有 16 張 GPU 運作中)。付費使用者可以取得 WAV(16/32-bit)、FLAC(16/24-bit)、M4A 等無損格式、較高排隊優先權,以及進階的 ensemble 模型。
它能做什麼
依官網的分類,模型大致分成這幾群:
- 人聲/伴奏分離:BS Roformer、MelBand Roformer、MDX23C、SCNet、Demucs4
- 多軌分離:BS Roformer SW 可分出六軌(人聲、貝斯、鼓、吉他、鋼琴、其他)
- 鼓與貝斯專用:MVSep Drums、MVSep Bass、DrumSep(鼓組再細分)
- 樂器專用:鋼琴、管風琴、吉他(木吉他/電吉他/主奏-節奏)、弦樂、管樂
- 特殊用途:卡拉 OK 人聲抽取、去除觀眾聲、男女聲分離、合唱抽離
- 影視音效:對白/音樂/音效分離、電影音訊拆解
除了分軌,還有三類附加工具:
- MIDI 轉換:Transkun(鋼琴轉譜)、Basic Pitch(旋律樂器)、ADTOF Plus(鼓組)
- 音訊修復:DeNoise 降噪、去殘響、超解析度升頻
- 語音合成:VibeVoice、Qwen3-TTS(含聲音克隆)
另外支援批次上傳與遠端上傳。
怎麼用:五個步驟
第一步:先不要註冊,直接丟一首進去
首頁就能上傳。第一次用的目的不是要拿到成品,是要感覺一下這個工具的節奏——上傳、選模型、排隊、下載。
選一首你很熟的歌。熟悉度很重要,因為你等下要靠耳朵判斷哪個模型比較好,用不熟的歌你聽不出差別。
第二步:用預設模型跑一次當基準線
第一次跑,直接用人聲/伴奏分離裡的主流模型(BS Roformer 系列通常是安全的起手式)。
聽完之後,記下你覺得哪裡不對。常見的問題有四種:
- 人聲有「水聲感」或金屬感(通常是原曲混響重)
- 伴奏裡還聽得到人聲殘留(分離不乾淨)
- 高頻的細節被吃掉(鈸、氣音變鈍)
- 低頻悶掉(貝斯與大鼓糊在一起)
把問題講清楚,下一步才知道要往哪個方向換。
第三步:依問題類型換模型再跑一次
這是整套流程的核心。我的經驗歸納如下:
- 人聲有水聲感 → 試 MelBand Roformer 系列,或先用「去殘響」工具處理原曲再分軌
- 伴奏有人聲殘留 → 試 ensemble(多模型合議)類的選項,通常乾淨度較好,但處理較久
- 高頻細節被吃掉 → 試 MDX23C 或 SCNet,這幾個在高頻保留上通常較穩
- 要細分鼓組 → 分軌完之後,把鼓軌再丟進 DrumSep 做二次分離
重點是一次只改一個變數。 換模型就不要同時換輸出格式,不然你不知道差別從哪來。
第四步:A/B 比對,用耳朵決定
把兩個版本的人聲軌拉進你的 DAW,對齊之後切換聽。不要用手機喇叭聽,用耳機。
聽三個地方:氣音(子音)、長音的尾巴、以及有樂器重疊的段落。這三處最容易露餡。
第五步:需要無損就付費,只是聽聽就免費
如果分出來的素材要進 DAW 做後製,MP3 的壓縮損失會在疊多軌之後被放大,建議付費用 WAV 或 FLAC。如果只是要做一個伴奏帶自己唱,免費的 MP3 完全夠。
進階技巧
技巧一:先修復再分軌,效果常常更好。 老錄音的殘響與底噪會干擾分離模型的判斷。先用 DeNoise 或去殘響處理過,再丟進分軌,結果往往比直接分軌好一截。這個順序很多人沒想到。
技巧二:二階段分離。 六軌模型一次分出所有東西很方便,但每一軌的品質不一定最好。想要最高品質的做法是:先用最強的人聲模型分出人聲/伴奏,再把伴奏丟進多軌模型分樂器。多花一次額度,但品質差別明顯。
技巧三:用 MIDI 轉換當編曲起點。 把一段你喜歡的旋律轉成 MIDI(Basic Pitch),你會得到一個可以直接編輯的音符檔。它不會完美,但作為採譜或重新編曲的起點,省下的時間很可觀。鋼琴用 Transkun,鼓組用 ADTOF Plus。
技巧四:批次上傳留給離峰時段。 官網用排隊制,尖峰時段等很久。如果你有十幾首要處理,晚上丟進去,隔天早上收。
注意事項
第一,版權跟工具無關。 分軌工具本身合法,但分出來的素材能不能用,看的是原曲授權。拿商業歌曲的人聲軌做成自己的作品發行,該有的授權一樣得有。這件事在台灣的短影音圈被忽略得很嚴重。
第二,中文歌的分離通常比英文歌難一點。 咬字與共鳴特性不同,很多模型的訓練資料以西方流行樂為主。這恰好是 MVSEP 多模型的價值——多試幾個,總有一個比較合。
第三,介面很工程師取向。 沒有精美的引導、沒有「推薦模型」的提示,就是一長串選項。心理準備一下,前十分鐘會有點混亂。
第四,別迷信 benchmark。 模型名稱後面的版本號與分數,反映的是在某個測試集上的平均表現,不代表在你這首歌上最好。耳朵是最終仲裁者。
想找同類工具比較,可以看站上的 LALAL.AI(介面乾淨、一鍵處理)與 Moises(面向樂手,有變速變調與和弦辨識),也可以逛 AI 音樂相關工具 分類找完整清單。
TheAI學院 評語
回到開頭那位做短影音的朋友。他後來養成了一個習慣:每首歌都跑兩到三個模型,聽過再決定用哪個。多花五分鐘,成品品質差很多。
我覺得這正是 MVSEP 這類工具的正確用法——它不是要給你一鍵完成的體驗,而是把「選擇權」還給你。代價是你得學會聽,得知道什麼叫水聲感、什麼叫高頻被吃掉。
這個學習成本是值得的。因為當你聽得出差別之後,你對聲音的判斷力會一併提升,而那件事對創作者的價值遠超過任何工具。
給新手的具體建議:先用一首你很熟的歌,跑三個不同模型,把三個版本放在一起聽。這一個練習,會比讀十篇教學更有用。
評語:它是給願意動手的人用的工具,不是給想省事的人用的。你要的是「最好的結果」而不是「最快的結果」,那多花五分鐘試三個模型,是我看過投報率最高的習慣。
資料來源
本文功能與數字依 2026 年 9 月官網公開資訊整理,模型清單與額度以官方最新公告為準。素材使用請自行確認原曲授權。
常見問題
MVSEP 免費能用多少?
官網顯示每日 50 次免費分離,預設輸出為 320 kbps 的 MP3。付費(註冊使用者方案)解鎖 WAV(16/32-bit)、FLAC(16/24-bit)與 M4A 等無損格式、較高的排隊優先權,以及進階的 ensemble 模型。
為什麼要有一百多個模型?一個最好的不就好了?
因為沒有「最好的」,只有「最適合這首歌的」。不同演算法在不同曲風、不同錄音品質上的表現差很多——重金屬的鼓組跟爵士的鼓組,適合的模型往往不一樣。多數工具幫你決定,MVSEP 選擇讓你自己試。
分出來的音軌可以商業使用嗎?
工具本身的使用不違法,但分離出來的素材能不能用,取決於原曲的授權,跟你用什麼工具無關。拿商業歌曲分軌做成影片配樂上架,該取得的授權一樣要取得。自己的作品、公版音樂或已取得授權的素材才沒有這個問題。
處理很慢是正常的嗎?
是。MVSEP 用排隊制處理(官網顯示目前有 16 張 GPU 在跑),尖峰時段等待時間會拉長。付費方案有較高優先權。如果你有大量素材要處理,建議用批次上傳並預留時間,別排在交件前一晚。