tomai
Connexion
☁️ Cloud · crédits

Séparateur de voix

Séparez n'importe quelle chanson en voix et instrument avec un modèle neuronal — karaoké instantané

🪙 Séparation neuronale de pistes sur notre serveur : 5 crédits par travail

🎙️ Un modèle neuronal divise l'audio en voix + instrumental (MP3). Vidéos jusqu'à 10 minutes prises en charge.

FFmpeg côté serveur gère tous les formats — y compris les fichiers HEVC/H.265 que votre navigateur ne lit pas. Les fichiers sont supprimés du serveur sous 30 minutes.

Des stems pour s’exercer, remixer et faire du karaoké

Séparez n’importe quel morceau en voix et instrumental — ou en quatre stems incluant batterie et basse — livré sous forme d’un ZIP de fichiers distincts.

🎙️

Séparation vocale par IA

Un modèle de deep learning (Demucs) sépare la piste en voix et musique en analysant le mix — et non en filtrant les fréquences.

🎤

Voix + instrumental

Obtenez un instrumental karaoké et une acapella propre en un seul envoi — remixez, reprenez ou travaillez chaque piste.

📦

Les deux pistes dans un ZIP

Les deux pistes séparées arrivent dans un seul ZIP à télécharger, prêt pour votre DAW ou votre éditeur vidéo.

Questions fréquentes

Quelle est la qualité de la séparation ?

Demucs est actuellement le modèle open-source de séparation de pistes le plus puissant. Sur des mixes de studio propres, la voix sort pratiquement sans instrument. Les cas extrêmes — forte réverbération, voix déformée, mixes de métal denses — présentent un léger chevauchement entre les pistes, ce qui est normal pour tout modèle de séparation de sources.

Pourquoi un ZIP plutôt que deux téléchargements séparés ?

Les deux pistes sont générées ensemble sur notre serveur, et un ZIP les garde appariées et préserve les noms de fichiers. Le ZIP contient exactement vocals.mp3 et instrumental.mp3.

Quelle est la limite de durée ?

10 minutes par travail — la séparation neuronale de pistes est gourmande en CPU, et des entrées plus longues épuiseraient la capacité de notre serveur. Les chansons plus longues peuvent d'abord être coupées avec l'outil de rognage vidéo puis séparées en plusieurs parties.

Pourquoi l’instrumental contient-il encore vaguement la voix ?

La séparation est statistique, pas parfaite — les fréquences partagées entre la voix et les instruments laissent un résidu. Le modèle 4 stems le réduit davantage que le 2 stems ; pour des instrumentaux parfaitement propres, choisissez des morceaux dont la voix, centrée dans le mix, reste clairsemée.

Modèles de séparation de sources et sorties

La séparation utilise un réseau neuronal optimisé pour le SDR, exécuté sur le CPU du worker :

Chaque stem est encodé à la fréquence d’échantillonnage de la source en MP3 320 kbps (ou WAV si l’entrée était sans perte), puis regroupé dans un ZIP unique. Les morceaux allant jusqu’à 15 minutes sont acceptés. La fuite entre stems est minimale sur du pop/rock bien masterisé, plus élevée sur des mix électroniques denses — la page l’annonce d’emblée, car des attentes honnêtes valent mieux que des remboursements surprises.

Comment ça marche

  1. 1

    Téléversez la chanson ou la vidéo — jusqu'à 10 minutes, tout format audio ou la plupart des vidéos.

  2. 2

    Lancez le travail. Le modèle neuronal analyse le mix et sépare la voix de l'instrumentation.

  3. 3

    Téléchargez le ZIP contenant vocals.mp3 et instrumental.mp3. Le traitement CPU dure à peu près aussi longtemps que la chanson elle-même.

Outils associés

Qu'est-ce que la séparation vocale ?

Un séparateur vocal découpe une chanson en deux pistes propres : la voix seule et la musique seule. Plutôt qu'un filtrage grossier qui laisse passer des résidus de l'autre moitié, un modèle neuronal de séparation de sources écoute tout le mix et reconstruit la voix et les instruments comme des flux audio distincts. Téléversez un fichier audio — ou une vidéo avec du son — de 10 minutes maximum, et notre serveur renvoie un ZIP contenant vocals.mp3 et instrumental.mp3. Les chanteurs s'en servent pour répéter sans la mélodie, les remixeurs isolent un refrain ou un beat, les éditeurs de podcast retirent des voix indésirables d'un extrait, et les fans de karaoké obtiennent une piste d'accompagnement en quelques secondes. La séparation elle-même tourne sur notre serveur avec le modèle open source Demucs.

Ce que cet outil peut faire

  • 🎤 Isoler la voix de n'importe quelle chanson en piste acapella propre
  • 🎹 Extraire l'instrumental pour une version karaoké immédiate
  • 📦 Télécharger les deux pistes en MP3 dans un seul ZIP
  • 🧠 Séparer les pistes avec un modèle neuronal qui comprend le mix, pas un simple filtre
  • ⏱️ Accepter des fichiers audio et vidéo jusqu'à 10 minutes
  • 🗑️ Supprimer automatiquement téléversements et résultats sous 30 minutes

Quand l'utiliser

  • 🎤 Répéter une chanson : chanter sur l'instrumental ou étudier la voix isolée
  • 🎶 Organiser une soirée karaoké sans chercher de versions sans voix
  • 🎧 Créer des remixes et mashups à partir de pistes propres
  • 🎙️ Retirer la voix d'un podcast ou d'une bande-son vidéo
  • 🎓 Enseigner la musique en écoutant la voix et l'accompagnement séparément

Votre fichier est envoyé sur notre VPS, où le réseau neuronal Demucs effectue la séparation ; le téléversement comme les résultats sont supprimés automatiquement sous 30 minutes. Chaque tâche coûte des crédits, et le modèle met sur le CPU du serveur à peu près le temps de lecture du morceau. Chaque tâche est limitée à 10 minutes d'audio — les morceaux plus longs peuvent être découpés au préalable avec un outil de rognage. Sur les mix studios propres, les pistes sortent quasiment sans fuite ; les enregistrements très travaillés, comme le metal dense, la forte réverbération ou les voix saturées, peuvent présenter un peu de diaphonie — une propriété normale de tout modèle de séparation de sources.

Outils associés