tomai
Entrar
☁️ Nuvem · créditos

Separador de vocais

Divida qualquer música em faixas de voz e instrumental com um modelo neural — karaokê instantâneo

🪙 Separação neural de faixas no nosso servidor: 5 créditos por trabalho

🎙️ Um modelo neural divide o áudio em vocais + instrumental (MP3). Vídeos de até 10 minutos são suportados.

O FFmpeg no servidor processa qualquer formato — inclusive arquivos HEVC/H.265 que seu navegador não reproduz. Os arquivos são apagados do servidor em 30 minutos.

Stems para prática, remixes e karaokê

Separe qualquer faixa em voz e instrumental — ou quatro stems, incluindo bateria e baixo — entregues em um ZIP de arquivos separados.

🎙️

Separação de vocais com IA

Um modelo de aprendizado profundo (Demucs) separa a faixa em voz e música escutando a mixagem — não por filtragem de frequências.

🎤

Vocais + instrumental

Um único upload entrega o instrumental para karaokê e um acapella limpo — remixe, faça um cover ou estude qualquer uma das faixas.

📦

ZIP com as duas faixas

As duas faixas separadas chegam em um único download ZIP, prontas para sua DAW ou editor de vídeo.

Perguntas frequentes

Quão boa é a separação?

O Demucs é atualmente o modelo de separação de stems open-source mais forte. Em mixagens de estúdio limpas, os vocais saem praticamente sem instrumentação. Casos extremos — reverb pesado, vocais distorcidos, mixagens densas de metal — mostram algum vazamento entre as faixas, o que é normal para qualquer modelo de separação de fontes.

Por que recebo um ZIP em vez de dois downloads separados?

As duas faixas são geradas juntas no nosso servidor, e um ZIP as mantém pareadas e preserva os nomes dos arquivos. O ZIP contém exatamente vocals.mp3 e instrumental.mp3.

Qual é o limite de duração?

10 minutos por trabalho — a separação neural de stems exige muita CPU, e entradas mais longas esgotariam a capacidade do nosso servidor. Músicas mais longas podem ser cortadas antes com o cortador de vídeo e separadas em partes.

Por que o instrumental ainda contém um resquício de voz?

A separação é estatística, não perfeita — frequências sobrepostas entre voz e instrumentos deixam resíduo. O modelo de 4 stems reduz isso mais do que o de 2; para instrumentais totalmente limpos, escolha faixas com vozes esparsas centralizadas no mix.

Modelos de separação de fontes e saídas

A separação usa uma rede neural otimizada para SDR executada na CPU do servidor:

Cada stem é codificado na taxa de amostragem da origem para MP3 320 kbps (ou WAV se a entrada era sem perdas), empacotado em um único ZIP. São aceitas músicas de até 15 minutos. O vazamento entre stems é menor em pop/rock bem masterizados e maior em mixes eletrônicos densos — a página avisa isso de cara, porque expectativas honestas valem mais do que reembolsos surpresa.

Como funciona

  1. 1

    Envie a música ou o vídeo — até 10 minutos, qualquer formato de áudio ou a maioria dos vídeos.

  2. 2

    Inicie o trabalho. O modelo neural analisa a mixagem e separa a voz da instrumentação.

  3. 3

    Baixe o ZIP com vocals.mp3 e instrumental.mp3. O processamento em CPU leva aproximadamente o mesmo tempo da música.

Ferramentas relacionadas

O que é separação de vocais?

Um separador de vocais divide uma música em duas faixas limpas: a voz sozinha e a música sozinha. Em vez de uma filtragem grosseira que deixa passar resíduos da outra metade, um modelo neural de separação de fontes escuta toda a mixagem e reconstrói a voz e os instrumentos como fluxos de áudio independentes. Envie um arquivo de áudio — ou um vídeo com som — de até 10 minutos, e nosso servidor devolve um ZIP com vocals.mp3 e instrumental.mp3. Cantores usam para ensaiar sem a melodia, remixadores isolam um refrão ou uma batida, editores de podcast removem vozes indesejadas de um trecho, e fãs de karaokê conseguem uma base em segundos. A separação em si roda em nosso servidor com o modelo open-source Demucs.

O que esta ferramenta faz

  • 🎤 Isolar a voz de qualquer música como faixa acapella limpa
  • 🎹 Extrair o instrumental para uma versão karaokê imediata
  • 📦 Baixar as duas faixas em MP3 em um único ZIP
  • 🧠 Separar faixas com um modelo neural que entende a mixagem, não um filtro simples
  • ⏱️ Aceitar arquivos de áudio e vídeo de até 10 minutos
  • 🗑️ Apagar envios e resultados automaticamente em 30 minutos

Quando usar

  • 🎤 Praticar uma música: cantar junto com o instrumental ou estudar a voz isolada
  • 🎶 Fazer uma noite de karaokê em casa sem caçar versões sem voz
  • 🎧 Criar remixes e mashups a partir de faixas limpas
  • 🎙️ Remover a voz da trilha de um podcast ou vídeo
  • 🎓 Ensinar música ouvindo voz e acompanhamento separadamente

Seu arquivo é enviado ao nosso VPS, onde a rede neural Demucs realiza a separação; tanto o envio quanto os resultados são apagados automaticamente em 30 minutos. Cada tarefa custa créditos e o modelo leva na CPU do servidor aproximadamente o tempo de reprodução da música. Cada tarefa aceita até 10 minutos de áudio — faixas mais longas podem ser cortadas antes com uma ferramenta de edição. Em mixagens de estúdio limpas, as faixas saem praticamente sem vazamento; gravações muito processadas, como metal denso, reverb pesado ou vocais distorcidos, podem apresentar um pouco de diafonia — uma propriedade normal de qualquer modelo de separação de fontes.

Ferramentas relacionadas