tomai
登录
☁️ 云端 · 点数

人声分离

用神经网络音源分离模型把歌曲拆成人声与伴奏两轨——秒变卡拉OK

🪙 服务器神经网络音源分离:每次 5 点

🎙️ 神经网络模型把音频分离为人声 + 伴奏两轨 MP3。支持最长 10 分钟的视频。

服务器端 FFmpeg 支持任意格式——包括浏览器放不了的 HEVC/H.265。文件在 30 分钟内自动从服务器删除。

练习、混音、卡拉OK都要的分轨

把任意曲目拆成人声与伴奏两轨——或包含鼓和贝斯的四轨——打包成 ZIP 分轨文件交付。

🎙️

AI 人声分离

深度学习模型(Demucs)通过聆听混音把人声与音乐分离——不是简单过滤频率。

🎤

人声 + 伴奏双轨

一次上传同时得到伴奏(卡拉 OK 版)和干净的人声轨——翻唱、混音、练歌都行。

📦

ZIP 打包双轨下载

两条分离音轨打包在一个 ZIP 里下载,直接导入你的剪辑软件。

常见问题

分离效果有多好?

Demucs 是目前最强的开源音源分离模型。干净的录音室混音中,人声轨几乎不带乐器声。极端情况——重度混响、失真人声、密集的金属混音——两轨之间会有一些串音,这对任何音源分离模型来说都是正常的。

为什么返回 ZIP 而不是两个独立下载?

两轨在服务器上一起生成,ZIP 能让它们成对并保留文件名。压缩包内恰好是 vocals.mp3 和 instrumental.mp3 两个文件。

长度限制是多少?

每次任务最长 10 分钟——神经网络音源分离非常吃 CPU,更长的输入会耗尽服务器容量。更长的歌曲可以先用视频裁剪工具切段,再分段分离。

为什么伴奏里还有隐隐约约的人声?

分离是统计性的,做不到完美——人声与乐器重叠的频段总会留下残留。四轨模式比双轨抑制得更好;想要完全干净的伴奏,尽量选人声少、且集中在正中央声像的曲目。

音源分离模型与输出

分离采用针对 SDR 优化的神经网络,在服务器 CPU 上执行:

每个分轨按源文件采样率编码为 MP3 320 kbps(无损输入则输出 WAV),统一打包成一个 ZIP。支持最长 15 分钟的歌曲。母带精良的流行/摇滚串音最少,元素密集的电子乐偏高——页面事先说明这一点,因为诚实的预期好过意外的退款。

如何使用

  1. 1

    上传歌曲或视频——最长 10 分钟,任意音频格式或大多数视频。

  2. 2

    开始任务。神经网络模型分析混音,把人声与乐器声分开。

  3. 3

    下载包含 vocals.mp3 和 instrumental.mp3 的 ZIP 压缩包。CPU 处理时长大约与歌曲本身相当。

相关工具

什么是人声分离?

人声分离可以把一首歌拆成两条干净的独立音轨:单独的人声和单独的伴奏。它不是用简单的滤波把另一边的残留一并留下,而是由神经网络模型听完整个混音,再把歌声与乐器分别重建为各自的音频流。上传一段不超过 10 分钟的音频文件(或带声音的视频),服务器会返回一个 ZIP 压缩包,里面装有两份 MP3:vocals.mp3 人声版和 instrumental.mp3 伴奏版。歌手用它脱离旋律练唱,混音师用它单独提取一段副歌或节拍,播客编辑用它去掉片段里多余的人声,想唱卡拉OK的人几秒钟就能拿到伴奏——分离本身在我们的服务器上用开源 Demucs 模型完成。

这款工具能做什么

  • 🎤 从任意歌曲中提取干净的人声,得到纯清唱音轨
  • 🎹 分离出伴奏,秒变卡拉OK版
  • 📦 两条音轨以 MP3 格式打包在一个 ZIP 里下载
  • 🧠 用理解混音的神经网络模型分轨,而不是简单滤波
  • ⏱️ 支持最长 10 分钟的音频或视频文件
  • 🗑️ 上传文件和结果都会在 30 分钟内自动删除

什么时候用它

  • 🎤 练歌:跟着伴奏唱,或者反复听单独的人声琢磨自己的部分
  • 🎶 在家办卡拉OK之夜,不用到处找消音伴奏
  • 🎧 用干净的分轨做混音和串烧
  • 🎙️ 去掉播客或视频配乐中的人声,换上别的背景音乐
  • 🎓 音乐教学:人声与伴奏分开讲解,更容易听清

你上传的文件会发送到我们的 VPS 服务器,由 Demucs 神经网络完成分离,上传文件和生成结果都会在 30 分钟内自动删除。每次任务消耗积分,模型在服务器 CPU 上跑完的时间大约相当于歌曲播放一遍的时长。单次任务限 10 分钟音频,更长的曲子可以先用裁剪工具切开再分批处理。干净的录音室混音分离后几乎不带串音;而重混响、失真人声、密集金属这类处理痕迹很重的录音,两条音轨之间可能会有少量串扰——这是所有源分离模型的正常特性。

相关工具