人声分离
用神经网络音源分离模型把歌曲拆成人声与伴奏两轨——秒变卡拉OK
🎙️ 神经网络模型把音频分离为人声 + 伴奏两轨 MP3。支持最长 10 分钟的视频。
服务器端 FFmpeg 支持任意格式——包括浏览器放不了的 HEVC/H.265。文件在 30 分钟内自动从服务器删除。
⚠️ 处理完成前请不要关闭或刷新此页面,否则可能无法获取处理结果。
💡 大文件按你自己网络的速率传输:上传会自动继续、可安全断点续传,网速慢只影响时间,绝不会影响你的积分。
练习、混音、卡拉OK都要的分轨
把任意曲目拆成人声与伴奏两轨——或包含鼓和贝斯的四轨——打包成 ZIP 分轨文件交付。
AI 人声分离
深度学习模型(Demucs)通过聆听混音把人声与音乐分离——不是简单过滤频率。
人声 + 伴奏双轨
一次上传同时得到伴奏(卡拉 OK 版)和干净的人声轨——翻唱、混音、练歌都行。
ZIP 打包双轨下载
两条分离音轨打包在一个 ZIP 里下载,直接导入你的剪辑软件。
常见问题
分离效果有多好?⌄
Demucs 是目前最强的开源音源分离模型。干净的录音室混音中,人声轨几乎不带乐器声。极端情况——重度混响、失真人声、密集的金属混音——两轨之间会有一些串音,这对任何音源分离模型来说都是正常的。
为什么返回 ZIP 而不是两个独立下载?⌄
两轨在服务器上一起生成,ZIP 能让它们成对并保留文件名。压缩包内恰好是 vocals.mp3 和 instrumental.mp3 两个文件。
长度限制是多少?⌄
每次任务最长 10 分钟——神经网络音源分离非常吃 CPU,更长的输入会耗尽服务器容量。更长的歌曲可以先用视频裁剪工具切段,再分段分离。
为什么伴奏里还有隐隐约约的人声?⌄
分离是统计性的,做不到完美——人声与乐器重叠的频段总会留下残留。四轨模式比双轨抑制得更好;想要完全干净的伴奏,尽量选人声少、且集中在正中央声像的曲目。
音源分离模型与输出
分离采用针对 SDR 优化的神经网络,在服务器 CPU 上执行:
- 双轨模式——人声 vs 伴奏;速度最快,适合卡拉OK伴奏和跟唱练习。
- 四轨模式——额外分离鼓和贝斯,方便混音创作与采样挖掘;处理时间约翻一倍。
每个分轨按源文件采样率编码为 MP3 320 kbps(无损输入则输出 WAV),统一打包成一个 ZIP。支持最长 15 分钟的歌曲。母带精良的流行/摇滚串音最少,元素密集的电子乐偏高——页面事先说明这一点,因为诚实的预期好过意外的退款。
如何使用
- 1
上传歌曲或视频——最长 10 分钟,任意音频格式或大多数视频。
- 2
开始任务。神经网络模型分析混音,把人声与乐器声分开。
- 3
下载包含 vocals.mp3 和 instrumental.mp3 的 ZIP 压缩包。CPU 处理时长大约与歌曲本身相当。
相关工具
什么是人声分离?
人声分离可以把一首歌拆成两条干净的独立音轨:单独的人声和单独的伴奏。它不是用简单的滤波把另一边的残留一并留下,而是由神经网络模型听完整个混音,再把歌声与乐器分别重建为各自的音频流。上传一段不超过 10 分钟的音频文件(或带声音的视频),服务器会返回一个 ZIP 压缩包,里面装有两份 MP3:vocals.mp3 人声版和 instrumental.mp3 伴奏版。歌手用它脱离旋律练唱,混音师用它单独提取一段副歌或节拍,播客编辑用它去掉片段里多余的人声,想唱卡拉OK的人几秒钟就能拿到伴奏——分离本身在我们的服务器上用开源 Demucs 模型完成。
这款工具能做什么
- 🎤 从任意歌曲中提取干净的人声,得到纯清唱音轨
- 🎹 分离出伴奏,秒变卡拉OK版
- 📦 两条音轨以 MP3 格式打包在一个 ZIP 里下载
- 🧠 用理解混音的神经网络模型分轨,而不是简单滤波
- ⏱️ 支持最长 10 分钟的音频或视频文件
- 🗑️ 上传文件和结果都会在 30 分钟内自动删除
什么时候用它
- 🎤 练歌:跟着伴奏唱,或者反复听单独的人声琢磨自己的部分
- 🎶 在家办卡拉OK之夜,不用到处找消音伴奏
- 🎧 用干净的分轨做混音和串烧
- 🎙️ 去掉播客或视频配乐中的人声,换上别的背景音乐
- 🎓 音乐教学:人声与伴奏分开讲解,更容易听清
你上传的文件会发送到我们的 VPS 服务器,由 Demucs 神经网络完成分离,上传文件和生成结果都会在 30 分钟内自动删除。每次任务消耗积分,模型在服务器 CPU 上跑完的时间大约相当于歌曲播放一遍的时长。单次任务限 10 分钟音频,更长的曲子可以先用裁剪工具切开再分批处理。干净的录音室混音分离后几乎不带串音;而重混响、失真人声、密集金属这类处理痕迹很重的录音,两条音轨之间可能会有少量串扰——这是所有源分离模型的正常特性。