Separador de vocais
Divida qualquer música em faixas de voz e instrumental com um modelo neural — karaokê instantâneo
🎙️ Um modelo neural divide o áudio em vocais + instrumental (MP3). Vídeos de até 10 minutos são suportados.
O FFmpeg no servidor processa qualquer formato — inclusive arquivos HEVC/H.265 que seu navegador não reproduz. Os arquivos são apagados do servidor em 30 minutos.
⚠️ Não feche nem recarregue esta página até terminar, ou você pode perder o resultado.
💡 Arquivos grandes viajam no ritmo da sua conexão: o envio continua por conta própria e é retomado com segurança, então uma rede lenta afeta só o tempo, nunca os seus créditos.
Stems para prática, remixes e karaokê
Separe qualquer faixa em voz e instrumental — ou quatro stems, incluindo bateria e baixo — entregues em um ZIP de arquivos separados.
Separação de vocais com IA
Um modelo de aprendizado profundo (Demucs) separa a faixa em voz e música escutando a mixagem — não por filtragem de frequências.
Vocais + instrumental
Um único upload entrega o instrumental para karaokê e um acapella limpo — remixe, faça um cover ou estude qualquer uma das faixas.
ZIP com as duas faixas
As duas faixas separadas chegam em um único download ZIP, prontas para sua DAW ou editor de vídeo.
Perguntas frequentes
Quão boa é a separação?⌄
O Demucs é atualmente o modelo de separação de stems open-source mais forte. Em mixagens de estúdio limpas, os vocais saem praticamente sem instrumentação. Casos extremos — reverb pesado, vocais distorcidos, mixagens densas de metal — mostram algum vazamento entre as faixas, o que é normal para qualquer modelo de separação de fontes.
Por que recebo um ZIP em vez de dois downloads separados?⌄
As duas faixas são geradas juntas no nosso servidor, e um ZIP as mantém pareadas e preserva os nomes dos arquivos. O ZIP contém exatamente vocals.mp3 e instrumental.mp3.
Qual é o limite de duração?⌄
10 minutos por trabalho — a separação neural de stems exige muita CPU, e entradas mais longas esgotariam a capacidade do nosso servidor. Músicas mais longas podem ser cortadas antes com o cortador de vídeo e separadas em partes.
Por que o instrumental ainda contém um resquício de voz?⌄
A separação é estatística, não perfeita — frequências sobrepostas entre voz e instrumentos deixam resíduo. O modelo de 4 stems reduz isso mais do que o de 2; para instrumentais totalmente limpos, escolha faixas com vozes esparsas centralizadas no mix.
Modelos de separação de fontes e saídas
A separação usa uma rede neural otimizada para SDR executada na CPU do servidor:
- Modo 2 stems — voz versus acompanhamento; o mais rápido, ideal para faixas de karaokê e prática de covers.
- Modo 4 stems — isola também bateria e baixo para trabalho de remix e caça a samples; praticamente dobra o tempo de processamento.
Cada stem é codificado na taxa de amostragem da origem para MP3 320 kbps (ou WAV se a entrada era sem perdas), empacotado em um único ZIP. São aceitas músicas de até 15 minutos. O vazamento entre stems é menor em pop/rock bem masterizados e maior em mixes eletrônicos densos — a página avisa isso de cara, porque expectativas honestas valem mais do que reembolsos surpresa.
Como funciona
- 1
Envie a música ou o vídeo — até 10 minutos, qualquer formato de áudio ou a maioria dos vídeos.
- 2
Inicie o trabalho. O modelo neural analisa a mixagem e separa a voz da instrumentação.
- 3
Baixe o ZIP com vocals.mp3 e instrumental.mp3. O processamento em CPU leva aproximadamente o mesmo tempo da música.
Ferramentas relacionadas
O que é separação de vocais?
Um separador de vocais divide uma música em duas faixas limpas: a voz sozinha e a música sozinha. Em vez de uma filtragem grosseira que deixa passar resíduos da outra metade, um modelo neural de separação de fontes escuta toda a mixagem e reconstrói a voz e os instrumentos como fluxos de áudio independentes. Envie um arquivo de áudio — ou um vídeo com som — de até 10 minutos, e nosso servidor devolve um ZIP com vocals.mp3 e instrumental.mp3. Cantores usam para ensaiar sem a melodia, remixadores isolam um refrão ou uma batida, editores de podcast removem vozes indesejadas de um trecho, e fãs de karaokê conseguem uma base em segundos. A separação em si roda em nosso servidor com o modelo open-source Demucs.
O que esta ferramenta faz
- 🎤 Isolar a voz de qualquer música como faixa acapella limpa
- 🎹 Extrair o instrumental para uma versão karaokê imediata
- 📦 Baixar as duas faixas em MP3 em um único ZIP
- 🧠 Separar faixas com um modelo neural que entende a mixagem, não um filtro simples
- ⏱️ Aceitar arquivos de áudio e vídeo de até 10 minutos
- 🗑️ Apagar envios e resultados automaticamente em 30 minutos
Quando usar
- 🎤 Praticar uma música: cantar junto com o instrumental ou estudar a voz isolada
- 🎶 Fazer uma noite de karaokê em casa sem caçar versões sem voz
- 🎧 Criar remixes e mashups a partir de faixas limpas
- 🎙️ Remover a voz da trilha de um podcast ou vídeo
- 🎓 Ensinar música ouvindo voz e acompanhamento separadamente
Seu arquivo é enviado ao nosso VPS, onde a rede neural Demucs realiza a separação; tanto o envio quanto os resultados são apagados automaticamente em 30 minutos. Cada tarefa custa créditos e o modelo leva na CPU do servidor aproximadamente o tempo de reprodução da música. Cada tarefa aceita até 10 minutos de áudio — faixas mais longas podem ser cortadas antes com uma ferramenta de edição. Em mixagens de estúdio limpas, as faixas saem praticamente sem vazamento; gravações muito processadas, como metal denso, reverb pesado ou vocais distorcidos, podem apresentar um pouco de diafonia — uma propriedade normal de qualquer modelo de separação de fontes.
Ferramentas relacionadas
Estúdio de Áudio na Nuvem
Converta, comprima, corte, ajuste o volume, remova silêncios, altere a velocidade, aplique fade, inverta, crie loops e visualize arquivos de áudio.
Mesclar áudio
Combine de 2 a 6 clipes de áudio em um único arquivo, na ordem que você escolher
Áudio para texto
Transcreva a fala de qualquer vídeo ou áudio em texto simples — com tecnologia Qwen3-ASR