Separador de voces
Divide cualquier canción en pistas de voz e instrumental con un modelo neuronal — karaoke al instante
🎙️ Un modelo neuronal divide el audio en voces + instrumental (MP3). Se admiten videos de hasta 10 minutos.
FFmpeg en el servidor procesa cualquier formato — incluidos archivos HEVC/H.265 que tu navegador no reproduce. Los archivos se borran del servidor en 30 minutos.
⚠️ No cierres ni recargues esta página hasta que termine, o podrías perder el resultado.
💡 Los archivos grandes viajan al ritmo de tu conexión: la subida continúa sola y se reanuda con seguridad, así que una red lenta solo afecta al tiempo, nunca a tus créditos.
Stems para practicar, hacer remixes y karaoke
Separe cualquier pista en voz e instrumental — o en cuatro stems que incluyen batería y bajo — entregados como un ZIP de archivos independientes.
Separación vocal con IA
Un modelo de aprendizaje profundo (Demucs) separa la pista en voz y música analizando la mezcla, no filtrando frecuencias.
Voz + instrumental
Con una sola subida se obtienen un instrumental de karaoke y una acapella limpia: para remezclar, versionar o estudiar cualquiera de las dos pistas.
ZIP con ambas pistas
Ambas pistas separadas llegan en una única descarga ZIP, listas para su DAW o editor de video.
Preguntas frecuentes
¿Qué tan buena es la separación?⌄
Demucs es actualmente el modelo de separación de stems open-source más fuerte. En mezclas de estudio limpias, la voz sale prácticamente sin instrumentación. Casos extremos — reverb pesado, voz distorsionada, mezclas densas de metal — muestran algo de sangrado entre pistas, algo normal en cualquier modelo de separación de fuentes.
¿Por qué recibo un ZIP en lugar de dos descargas separadas?⌄
Las dos pistas se generan juntas en nuestro servidor, y un ZIP las mantiene emparejadas y conserva los nombres de archivo. El ZIP contiene exactamente vocals.mp3 e instrumental.mp3.
¿Cuál es el límite de duración?⌄
10 minutos por trabajo — la separación neuronal de stems consume mucha CPU, y entradas más largas agotarían la capacidad de nuestro servidor. Las canciones más largas pueden cortarse antes con el recortador de video y separarse en partes.
¿Por qué el instrumental aún contiene restos tenues de voz?⌄
La separación es estadística, no perfecta — las frecuencias que se solapan entre voz e instrumentos dejan residuo. El modelo de 4 stems lo reduce más que el de 2 stems; para instrumentales totalmente limpios, elija pistas con voz poco densa y centrada en el paneo.
Modelos de separación de fuentes y salidas
La separación usa una red neuronal optimizada para SDR ejecutada en la CPU del worker:
- Modo 2 stems — voz contra acompañamiento; el más rápido, ideal para pistas de karaoke y práctica de covers.
- Modo 4 stems — además aísla batería y bajo para trabajo de remix y búsqueda de samples; aproximadamente duplica el tiempo de procesamiento.
Cada stem se codifica a la frecuencia de muestreo de la fuente en MP3 320 kbps (o WAV si la entrada era sin pérdida) y todo se empaqueta en un único ZIP. Se aceptan canciones de hasta 15 minutos. El sangrado entre stems es mínimo en pop/rock bien masterizado y mayor en mezclas electrónicas densas — la página lo advierte de antemano porque unas expectativas honestas valen más que reembolsos sorpresa.
Cómo funciona
- 1
Sube la canción o el video — hasta 10 minutos, cualquier formato de audio o la mayoría de videos.
- 2
Inicia el trabajo. El modelo neuronal analiza la mezcla y separa la voz de la instrumentación.
- 3
Descarga el ZIP con vocals.mp3 e instrumental.mp3. El procesamiento en CPU tarda aproximadamente lo mismo que dura la canción.
Herramientas relacionadas
¿Qué es la separación de voz?
Un separador de voz divide una canción en dos pistas limpias: la voz por un lado y la música por el otro. En lugar de un filtrado bruto que deja pasar restos de la otra mitad, un modelo neuronal de separación de fuentes escucha toda la mezcla y reconstruye la voz y los instrumentos como flujos de audio independientes. Sube un archivo de audio —o un vídeo con sonido— de hasta 10 minutos y nuestro servidor te devuelve un ZIP con vocals.mp3 e instrumental.mp3. Los cantantes lo usan para ensayar sin melodía, los remixers aíslan un estribillo o una base, los editores de pódcast eliminan voces no deseadas de un clip y los aficionados al karaoke consiguen una pista de acompañamiento en segundos. La separación se ejecuta en nuestro servidor con el modelo de código abierto Demucs.
Qué puede hacer esta herramienta
- 🎤 Aislar la voz de cualquier canción como pista acapella limpia
- 🎹 Extraer el instrumental para una versión karaoke al instante
- 📦 Descargar ambas pistas como MP3 en un solo ZIP
- 🧠 Separar pistas con un modelo neuronal que entiende la mezcla, no con un filtro simple
- ⏱️ Aceptar archivos de audio y vídeo de hasta 10 minutos
- 🗑️ Eliminar subidas y resultados automáticamente en 30 minutos
Cuándo usarla
- 🎤 Practicar una canción: canta con el instrumental o estudia la voz aislada
- 🎶 Montar una noche de karaoke sin buscar versiones sin voz
- 🎧 Crear remezclas y mashups con pistas limpias
- 🎙️ Quitar la voz de la banda sonora de un pódcast o vídeo
- 🎓 Enseñar música escuchando voz y acompañamiento por separado
Tu archivo se envía a nuestro VPS, donde la red neuronal Demucs realiza la separación; tanto la subida como los resultados se eliminan automáticamente en 30 minutos. Cada tarea cuesta créditos y el modelo tarda en la CPU del servidor aproximadamente lo que dura la reproducción de la canción. Cada tarea admite hasta 10 minutos de audio: las pistas más largas pueden cortarse antes con una herramienta de recorte. En mezclas de estudio limpias las pistas salen prácticamente sin contaminación; las grabaciones muy procesadas, como el metal denso, la reverberación intensa o las voces distorsionadas, pueden mostrar algo de diafonía: una propiedad normal de cualquier modelo de separación de fuentes.
Herramientas relacionadas
Estudio de audio en la nube
Convierte, comprime, recorta, ajusta el volumen, elimina silencios, cambia la velocidad, aplica fundidos, invierte, crea bucles y visualiza archivos de audio.
Combinar audio
Combina de 2 a 6 clips de audio en un solo archivo, en el orden que elijas
Audio a texto
Transcribe el habla de cualquier vídeo o audio a texto plano — con la potencia de Qwen3-ASR