보컬 분리
신경망 스템 모델로 노래를 보컬과 반주로 나눠 드립니다 — 즉석 노래방
🎙️ 신경망 모델이 오디오를 보컬 + 반주(MP3)로 나눕니다. 최대 10분 동영상을 지원합니다.
서버의 FFmpeg가 모든 형식을 처리합니다 — 브라우저가 재생하지 못하는 HEVC/H.265도 지원. 파일은 30분 안에 서버에서 삭제됩니다.
⚠️ 완료될 때까지 이 페이지를 닫거나 새로고침하지 마세요. 결과가 사라질 수 있습니다.
💡 큰 파일은 사용자의 연결 속도에 맞춰 전송됩니다. 업로드는 자동으로 계속되고 안전하게 이어 올릴 수 있으므로, 느린 회선은 시간에만 영향을 줄 뿐 크레딧에는 영향을 주지 않습니다.
연습, 리믹스, 노래방을 위한 스템 분리
어떤 트랙이든 보컬과 반주로 — 또는 드럼과 베이스를 포함한 네 개의 스템으로 — 나누어 개별 파일을 ZIP 하나로 전달합니다.
AI 보컬 분리
딥러닝 모델(Demucs)이 주파수 필터링이 아니라 믹스를 분석해 음원을 보컬과 반주로 분리합니다.
보컬 + 반주 트랙
한 번의 업로드로 노래방용 반주와 깨끗한 아카펠라를 모두 얻을 수 있습니다. 리믹스, 커버, 연습에 자유롭게 활용하세요.
두 트랙이 담긴 ZIP
분리된 두 트랙이 하나의 ZIP으로 다운로드되어 DAW나 영상 편집 프로그램에 바로 불러올 수 있습니다.
자주 묻는 질문
분리 품질은 어느 정도인가요?⌄
Demucs는 현재 가장 강력한 오픈소스 스템 분리 모델입니다. 깨끗한 스튜디오 믹스에서는 보컬이 거의 악기 없이 뽑혀 나옵니다. 극단적인 경우(심한 리버브, 찌그러진 보컬, 빽빽한 메탈 믹스)에는 스템 사이에 약간의 섞임이 보이는데, 이는 어떤 소스 분리 모델에서도 정상입니다.
다운로드가 두 개가 아니라 ZIP인 이유는?⌄
두 스템은 저희 서버에서 함께 생성되며, ZIP이 두 파일을 묶어 주고 파일 이름도 보존합니다. ZIP 안에는 정확히 vocals.mp3와 instrumental.mp3가 들어 있습니다.
길이 제한은 어떻게 되나요?⌄
작업당 10분입니다 — 신경망 스템 분리는 CPU 부하가 커서 더 긴 입력은 서버 용량을 넘어섭니다. 더 긴 노래는 먼저 동영상 자르기 도구로 자른 뒤 부분별로 분리하세요.
반주에 보컬이 희미하게 섞여 나오는 이유는 무엇인가요?⌄
분리는 통계적 처리일 뿐 완벽하지 않습니다 — 목소리와 악기가 겹치는 주파수가 잔여물로 남습니다. 4스텝 모델이 2스텝보다 더 줄여 주며, 완전히 깨끗한 반주를 원한다면 보컬이 가운데에 드문드문 배치된 트랙을 고르세요.
소스 분리 모델과 출력물
분리는 워커 CPU에서 실행되는 SDR 최적화 신경망을 사용합니다:
- 2스텝 모드 — 보컬 대 반주. 가장 빠르며 노래방 트랙과 따라 부르기 연습에 이상적입니다.
- 4스텝 모드 — 리믹스 작업과 샘플 찾기를 위해 드럼과 베이스까지 추가로 분리하며, 처리 시간은 대략 두 배가 됩니다.
각 스템은 소스의 샘플레이트로 MP3 320 kbps로 인코딩되거나(입력이 무손실이었다면 WAV), 하나의 ZIP으로 묶여 전달됩니다. 최대 15분 길이의 곡까지 처리할 수 있습니다. 스템 간 블리딩은 마스터링이 잘 된 팝/록에서 가장 적고 밀도 높은 일렉트로닉 믹스에서는 커집니다 — 놀라운 환불보다 정직한 기대가 낫기에 페이지에 미리 안내합니다.
이용 방법
- 1
노래나 동영상을 업로드하세요 — 최대 10분, 모든 오디오 형식 또는 대부분의 동영상.
- 2
작업을 시작하세요. 신경망 모델이 믹스를 분석해 목소리와 연주를 분리합니다.
- 3
vocals.mp3와 instrumental.mp3가 담긴 ZIP을 내려받으세요. CPU 처리 시간은 노래 길이와 거의 같습니다.
관련 도구
보컬 분리란 무엇인가요?
보컬 분리기는 노래 하나를 두 개의 깨끗한 트랙으로 나눕니다. 목소리만 있는 트랙과 음악만 있는 트랙입니다. 단순한 필터로 반대쪽 잔여물까지 그대로 남기는 대신, 신경망 음원 분리 모델이 믹스 전체를 듣고 보컬과 악기를 각각 독립된 오디오 스트림으로 재구성합니다. 10분 이내의 오디오 파일(또는 소리가 있는 동영상)을 업로드하면 서버가 vocals.mp3와 instrumental.mp3가 담긴 ZIP 파일을 돌려줍니다. 가수는 멜로디 없이 연습하고, 리믹서는 훅이나 비트만 떼어 내고, 팟캐스트 편집자는 클립에서 원치 않는 목소리를 지우고, 노래방 팬은 몇 초 만에 반주를 얻습니다. 분리 자체는 오픈소스 Demucs 모델로 서버에서 실행됩니다.
이 도구로 할 수 있는 일
- 🎤 어떤 노래에서든 목소리를 추출해 깨끗한 아카펠라 트랙으로
- 🎹 반주를 분리해 즉석에서 노래방 버전으로
- 📦 두 트랙을 MP3로 묶어 ZIP 하나로 다운로드
- 🧠 믹스를 이해하는 신경망 모델로 스템 분리(단순 필터 아님)
- ⏱️ 10분 이내의 오디오·동영상 파일 지원
- 🗑️ 업로드와 결과물을 30분 안에 자동 삭제
언제 사용하면 좋을까요
- 🎤 노래 연습: 반주에 맞춰 부르거나 분리된 목소리로 파트를 연구
- 🎶 MR을 찾아 헤매지 않고 집에서 노래방 파티
- 🎧 깨끗한 스템으로 리믹스와 매시업 제작
- 🎙️ 팟캐스트나 영상 사운드트랙에서 목소리 제거
- 🎓 음악 수업: 목소리와 반주를 따로 들려주기
업로드한 파일은 VPS 서버로 전송되며, Demucs 신경망이 분리를 수행합니다. 업로드와 생성 결과는 모두 30분 안에 자동 삭제됩니다. 작업 1회에 크레딧이 소모되고, 서버 CPU에서 모델이 처리하는 시간은 곡 재생 시간과 거의 비슷합니다. 작업당 오디오는 10분까지이며, 더 긴 곡은 먼저 트리머로 잘라 나눠 처리하세요. 깨끗한 스튜디오 믹스에서는 스템 간 누출이 거의 없지만, 묵직한 리버브, 찌그러진 보컬, 조밀한 메탈처럼 후처리가 강한 녹음에서는 약간의 크로스토크가 나타날 수 있습니다. 이는 어떤 음원 분리 모델에서든 정상적인 현상입니다.