人聲分離
用神經網路音源分離模型把歌曲拆成人聲與伴奏兩軌——秒變卡拉OK
🎙️ 神經網路模型把音訊分離為人聲 + 伴奏兩軌 MP3。支援最長 10 分鐘的影片。
伺服器端 FFmpeg 支援任意格式——包括瀏覽器放不了的 HEVC/H.265。檔案在 30 分鐘內自動從伺服器刪除。
⚠️ 處理完成前請不要關閉或重新整理此頁面,否則可能無法取得處理結果。
💡 大檔案以你自己網路的速率傳輸:上傳會自動接續、可安全斷點續傳,網路慢只影響時間,絕不會影響你的點數。
練唱、混音與卡拉OK的分軌
把任何曲目分成人聲與伴奏——或含鼓與貝斯的四軌版本——以 ZIP 壓縮檔交付各自獨立的檔案。
AI 人聲分離
深度學習模型(Demucs)透過聆聽混音內容,將音軌分離成人聲與音樂——不是靠簡單的頻率過濾。
人聲 + 伴奏雙軌
一次上傳就能同時取得卡拉 OK 伴奏與乾淨的人聲軌——無論是重混、翻唱還是練唱都行。
ZIP 一次打包雙音軌
兩條分離好的音軌打包成一個 ZIP 供下載,可直接匯入你的 DAW 或影片剪輯軟體。
常見問題
分離效果有多好?⌄
Demucs 是目前最強的開源音源分離模型。乾淨的錄音室混音中,人聲軌幾乎不帶樂器聲。極端情況——重度混響、失真人聲、密集的金屬混音——兩軌之間會有一些串音,這對任何音源分離模型來說都是正常的。
為什麼返回 ZIP 而不是兩個獨立下載?⌄
兩軌在伺服器上一起生成,ZIP 能讓它們成對並保留檔名。壓縮包內恰好是 vocals.mp3 和 instrumental.mp3 兩個檔案。
長度限制是多少?⌄
每次任務最長 10 分鐘——神經網路音源分離非常吃 CPU,更長的輸入會耗盡伺服器容量。更長的歌曲可以先用影片裁剪工具切段,再分段分離。
為什麼伴奏裡還隱約聽得到人聲?⌄
音源分離是統計方法,並非完美——人聲與樂器重疊的頻段會留下殘留。四軌模型的殘留比二軌更低;想要完全乾淨的伴奏,請挑選人聲居中定位且編曲稀疏的曲目。
音源分離模型與輸出
分離採用針對 SDR 最佳化的類神經網路,在伺服器端 CPU 上執行:
- 二軌模式——人聲對伴奏;速度最快,最適合製作卡拉OK伴唱帶與跟唱練習。
- 四軌模式——額外分離鼓與貝斯,方便混音創作與挖取取樣素材;處理時間約增加一倍。
每條分軌以來源的取樣率編碼為 MP3 320 kbps(輸入若是無損格式則輸出 WAV),打包成單一 ZIP。接受最長 15 分鐘的歌曲。母帶處理良好的流行/搖滾樂分軌滲漏最低,元素密集的電子混音較高——頁面會事先講明白,因為誠實的預期勝過令人錯愕的退款。
如何使用
- 1
上傳歌曲或影片——最長 10 分鐘,任意音訊格式或大多數影片。
- 2
開始任務。神經網路模型分析混音,把人聲與樂器聲分開。
- 3
下載包含 vocals.mp3 和 instrumental.mp3 的 ZIP 壓縮包。CPU 處理時長大約與歌曲本身相當。
相關工具
什麼是人聲分離?
人聲分離可以把一首歌拆成兩條乾淨的獨立音軌:單獨的人聲和單獨的伴奏。它不是靠簡單的濾波把另一邊的殘留一起留下,而是由神經網路模型聽完整段混音,再把歌聲與樂器分別重建為各自的音訊串流。上傳一段不超過 10 分鐘的音訊檔案(或帶聲音的影片),伺服器會回傳一個 ZIP 壓縮檔,裡面裝有兩份 MP3:vocals.mp3 人聲版與 instrumental.mp3 伴奏版。歌手用它脫離旋律練唱,混音師用它單獨抽出副歌或節拍,播客編輯用它去掉片段中多餘的人聲,想唱卡拉OK的人幾秒鐘就能拿到伴奏——分離本身在我們的伺服器上用開源 Demucs 模型完成。
這款工具能做什麼
- 🎤 從任何歌曲中取出乾淨的人聲,得到純清唱音軌
- 🎹 分離出伴奏,瞬間變成卡拉OK版
- 📦 兩條音軌以 MP3 格式打包成一個 ZIP 下載
- 🧠 用理解混音的類神經網路模型分軌,而非簡單濾波
- ⏱️ 支援最長 10 分鐘的音訊或影片檔案
- 🗑️ 上傳檔案與結果都會在 30 分鐘內自動刪除
什麼時候用它
- 🎤 練唱:跟著伴奏唱,或反覆聽單獨的人聲琢磨自己的部分
- 🎶 在家辦卡拉OK之夜,不用到處找消音伴奏
- 🎧 用乾淨的分軌做混音與串燒
- 🎙️ 移除播客或影片配樂中的人聲,換成別的背景音樂
- 🎓 音樂教學:人聲與伴奏分開聆聽,更容易分辨
你上傳的檔案會傳送到我們的 VPS 伺服器,由 Demucs 神經網路完成分離,上傳檔案與產出結果都會在 30 分鐘內自動刪除。每次任務消耗積分,模型在伺服器 CPU 上跑完的時間大約等同於歌曲播放一遍的長度。單次任務限 10 分鐘音訊,更長的曲子可以先用剪裁工具切開再分批處理。乾淨的錄音室混音分離後幾乎沒有串音;而重混響、失真人聲、密集金屬這類處理痕跡很重的錄音,兩條音軌之間可能會有少量串擾——這是所有源分離模型的正常特性。