Gesangstrennung
Songs mit einem neuronalen Stamm-Modell in Gesang und Instrumental teilen — Karaoke in Sekunden
🎙️ Ein neuronales Modell teilt das Audio in Gesang + Instrumental (MP3). Videos bis 10 Minuten werden unterstützt.
Serverseitiges FFmpeg verarbeitet jedes Format — auch HEVC/H.265-Dateien, die dein Browser nicht abspielen kann. Dateien werden innerhalb von 30 Minuten vom Server gelöscht.
⚠️ Bitte schließe oder aktualisiere diese Seite nicht, bis der Vorgang abgeschlossen ist — sonst kann das Ergebnis verloren gehen.
💡 Große Dateien reisen im Tempo Ihrer Verbindung: Der Upload läuft von selbst weiter und setzt sicher wieder an – ein langsames Netz kostet nur Zeit, niemals Credits.
Stems für Übung, Remixe und Karaoke
Jeden Track in Vocals und Instrumental trennen — oder in vier Stems inklusive Drums und Bass — geliefert als ZIP aus Einzeldateien.
AI-Gesangstrennung
Ein Deep-Learning-Modell (Demucs) zerlegt den Track in Gesang und Musik, indem es den Mix anhört – statt Frequenzen zu filtern.
Gesang + Instrumental
Aus einem einzigen Upload erhalten Sie ein Karaoke-Instrumental und eine saubere Acapella – remixen, covern oder üben Sie mit beiden Spuren.
ZIP mit beiden Spuren
Beide getrennten Spuren kommen in einem ZIP-Download – bereit für Ihre DAW oder Ihren Video-Editor.
Häufige Fragen
Wie gut ist die Trennung?⌄
Demucs ist derzeit das stärkste Open-Source-Stemm-Trennungsmodell. Bei sauberen Studiomixen ist der Gesang praktisch instrumental-frei. Extreme Fälle — starker Hall, verzerrter Gesang, dichte Metal-Mixe — zeigen etwas Überlappung zwischen den Spuren, was bei jedem Quellentrennungsmodell normal ist.
Warum bekomme ich ein ZIP statt zwei getrennte Downloads?⌄
Die beiden Spuren werden zusammen auf unserem Server erzeugt, und ein ZIP hält sie gepaart und bewahrt die Dateinamen. Das ZIP enthält genau vocals.mp3 und instrumental.mp3.
Welche Längenbegrenzung gibt es?⌄
10 Minuten pro Auftrag — neuronale Stammtrennung ist CPU-intensiv, längere Eingaben würden unsere Serverkapazität erschöpfen. Längere Songs können Sie vorher mit dem Video-Trimmer schneiden und in Teilen trennen.
Warum enthält das Instrumental noch schwach Vocals?⌄
Trennung ist Statistik, nicht Perfektion — Frequenzen, die sich zwischen Stimme und Instrumenten überlagern, hinterlassen Reste. Das 4-Stem-Modell reduziert sie stärker als das 2-Stem-Verfahren; für völlig saubere Instrumentale Tracks mit sparsam eingesetzten, mittig gepannter Vocals wählen.
Source-Separation-Modelle und Ausgaben
Die Trennung nutzt ein SDR-optimiertes neuronales Netzwerk auf der Worker-CPU:
- 2-Stem-Modus — Vocals vs. Begleitung; am schnellsten, ideal für Karaoke-Tracks und Mitspiel-Übung.
- 4-Stem-Modus — isoliert zusätzlich Drums und Bass für Remix-Arbeit und Sample-Jagd; verdoppelt etwa die Bearbeitungszeit.
Jeder Stem wird mit der Samplerate der Quelle als MP3 320 kbps kodiert (oder WAV, falls die Eingabe verlustfrei war) und in ein einzelnes ZIP gepackt. Songs bis 15 Minuten werden akzeptiert. Übersprechen zwischen den Stems ist bei gut gemastertem Pop/Rock am geringsten, bei dichten elektronischen Mischungen höher — die Seite sagt das vorab, weil ehrliche Erwartungen besser sind als überraschte Erstattungen.
So funktioniert es
- 1
Laden Sie den Song oder das Video hoch — bis zu 10 Minuten, jedes Audioformat oder die meisten Videos.
- 2
Starten Sie den Auftrag. Das neuronale Modell analysiert den Mix und trennt Stimme von Instrumentierung.
- 3
Laden Sie das ZIP mit vocals.mp3 und instrumental.mp3 herunter. Die CPU-Verarbeitung dauert etwa so lange wie der Song selbst.
Ähnliche Tools
Was ist Gesangstrennung?
Ein Gesangstrenner zerlegt einen Song in zwei saubere Spuren: die Stimme für sich und die Musik für sich. Statt grober Filterung, die Reste der jeweils anderen Seite durchlässt, hört sich ein neuronales Quellentrennungsmodell den gesamten Mix an und rekonstruiert Gesang und Instrumente als getrennte Audioströme. Laden Sie eine Audiodatei – oder ein Video mit Ton – von bis zu 10 Minuten Länge hoch, und unser Server liefert ein ZIP mit vocals.mp3 und instrumental.mp3 zurück. Sänger üben damit ohne Melodie, Remixer isolieren einen Hook oder Beat, Podcaster entfernen unerwünschte Stimmen aus einem Clip, und Karaoke-Fans bekommen in Sekunden eine Begleitung. Die Trennung selbst läuft auf unserem Server mit dem quelloffenen Demucs-Modell.
Was dieses Tool kann
- 🎤 Die Stimme aus jedem Song als saubere A-cappella-Spur isolieren
- 🎹 Das Instrumental extrahieren – sofort eine Karaoke-Version
- 📦 Beide Stems als MP3-Dateien in einem ZIP herunterladen
- 🧠 Stems mit einem neuronalen Modell trennen, das den Mix versteht, statt mit einfachem Filter
- ⏱️ Audio- und Videodateien bis 10 Minuten verarbeiten
- 🗑️ Uploads und Ergebnisse automatisch innerhalb von 30 Minuten löschen
Wann Sie es nutzen
- 🎤 Lieder üben: zur Begleitung mitsingen oder die isolierte Stimme studieren
- 🎶 Einen Karaoke-Abend zu Hause veranstalten, ohne nach Instrumentalversionen zu suchen
- 🎧 Remixe und Mashups aus sauberen Stems bauen
- 🎙️ Stimmen aus Podcast- oder Video-Soundtracks entfernen
- 🎓 Musik unterrichten – Stimme und Begleitung getrennt hörbar machen
Ihre Datei wird an unseren VPS übertragen, wo das Demucs-Neuronale-Netz die Trennung durchführt; Upload und Ergebnisse werden innerhalb von 30 Minuten automatisch gelöscht. Ein Auftrag kostet Credits; auf der Server-CPU braucht das Modell in etwa so lange, wie das Stück wiedergegeben wird. Pro Auftrag sind maximal 10 Minuten Audio erlaubt – längere Stücke lassen sich vorher mit einem Zuschneidewerkzeug teilen. Bei sauberen Studioabmischungen sind die Stems nahezu übersprechfrei; stark bearbeitete Aufnahmen wie dichter Metal, starkes Hall oder verzerrter Gesang können etwas Übersprechen zeigen – eine normale Eigenschaft jedes Quellentrennungsmodells.
Ähnliche Tools
Cloud-Audiostudio
Konvertiere, komprimiere, schneide, passe die Lautstärke an, entferne Stille, ändere die Geschwindigkeit, blende ein/aus, kehre um, erstelle Loops und visualisiere Audiodateien.
Audio zusammenführen
2-6 Audioclips in der von dir gewählten Reihenfolge zu einer Datei zusammenfügen
Audio in Text
Wandelt Sprache aus jedem Video oder jeder Audiodatei in reinen Text um — angetrieben von Qwen3-ASR