ボーカル分離
ニューラルステムモデルで曲をボーカルとインストに分割——即席カラオケ
🎙️ ニューラルモデルが音声をボーカル + インスト(MP3)に分割します。10分までの動画に対応。
サーバー側の FFmpeg があらゆる形式を処理します — ブラウザで再生できない HEVC/H.265 も対応。ファイルは30分以内にサーバーから削除されます。
⚠️ 完了するまでこのページを閉じたり更新したりしないでください。結果が失われる場合があります。
💡 大きなファイルはお使いの回線の速度に合わせて転送されます。アップロードは自動で続行し、安全に途中から再開できるため、回線が遅くても影響するのは所要時間だけで、クレジットが失われることはありません。
練習・リミックス・カラオケに使えるステム分離
どんなトラックもボーカルとインストゥルメンタルに分離 — あるいはドラムとベースを含む4ステームに分割 — し、別々のファイルを1つのZIPでお届けします。
AI ボーカル分離
ディープラーニングモデル(Demucs)がミックスを解析し、周波数フィルタではなく聴き取りによってボーカルと音楽を分離します。
ボーカル + カラオケ音源
1回のアップロードで、カラオケ用の伴奏とクリアなアカペラの両方を入手。リミックスやカバー、練習に使えます。
2トラックを ZIP で
分離した2トラックが1つの ZIP にまとまってダウンロードでき、DAW や動画編集ソフトにそのまま読み込めます。
よくある質問
分離の品質はどのくらいですか?⌄
Demucs は現時点で最強のオープンソースステム分離モデルです。きれいなスタジオミックスなら、ボーカルはほぼ楽器なしで取り出せます。極端なケース(強いリバーブ、歪んだボーカル、密度の高いメタルミックス)ではステム間でわずかに混ざりが見られますが、どの音源分離モデルでも正常な範囲です。
なぜ2つの別ダウンロードではなく ZIP なのですか?⌄
2つのステムはサーバー上で同時に生成され、ZIP ならペアを保ちファイル名も失いません。ZIP の中身はちょうど vocals.mp3 と instrumental.mp3 の2ファイルです。
長さの制限は?⌄
1回につき10分まで——ニューラルステム分離は CPU 負荷が高く、それ以上長い入力はサーバー容量を圧迫します。長い曲は先に動画トリマーで切り、部分ごとに分離してください。
インスト版にかすかにボーカルが残るのはなぜですか?⌄
分離は統計的な処理であり完全ではないため、声と楽器で重なる周波数帯にはどうしても残留が生じます。4ステームモデルは2ステームよりさらに低減しますが、完全にクリーンなインストを目指すなら、センター定位のボーカルが疎なトラックを選ぶのがおすすめです。
ソースセパレーションのモデルと出力
分離にはSDR最適化のニューラルネットワークを使用し、ワーカーのCPU上で実行します:
- 2ステームモード — ボーカル vs 伴奏。最速で、カラオケ音源やワンコーラス練習に最適です。
- 4ステームモード — ドラムとベースも個別に分離し、リミックス制作やサンプル探しに役立ちます。処理時間は約2倍になります。
各ステームはソースのサンプルレートでMP3 320 kbpsにエンコードされ(入力がロスレスの場合はWAV)、1つのZIPにまとめられます。最長15分の楽曲まで受け付けます。ステーム間のリーク(音漏れ)はマスタリングのしっかりしたポップ/ロックで最小となり、密度の高いエレクトロニックミックスでは大きくなります — 返金で驚かせるより、正直な期待値を先にお伝えする方が良いと考えているからです。
使い方
- 1
曲や動画をアップロードします——最大10分、あらゆる音声形式またはほとんどの動画。
- 2
処理を開始します。ニューラルモデルがミックスを分析し、声と楽器を分離します。
- 3
vocals.mp3 と instrumental.mp3 が入った ZIP をダウンロードします。CPU 処理は曲の長さとほぼ同じ時間かかります。
関連ツール
ボーカル分離とは?
ボーカル分離は、1曲の音源を「歌声だけ」と「音楽だけ」の2つのクリーンなトラックに分けます。単純なフィルターで残った音をそのまま残すのではなく、ニューラルネットワークの音源分離モデルがミックス全体を聴いて、歌声と楽器をそれぞれ独立した音声ストリームとして再構成します。10分以内の音声ファイル(または音声付き動画)をアップロードすると、サーバーが vocals.mp3 と instrumental.mp3 の2つを収めたZIPを返します。歌手はメロディなしで練習でき、リミキサーはフックやビートを単独で取り出せ、ポッドキャスト編集者は不要な声をクリップから消せ、カラオケ好きは数秒で伴奏を手に入れられます。分離処理自体はサーバー上でオープンソースの Demucs モデルが実行します。
このツールでできること
- 🎤 どんな曲からでも歌声を抽出し、クリーンなアカペラトラックに
- 🎹 伴奏を取り出して、すぐにカラオケバージョンに
- 📦 2つのトラックをMP3として1つのZIPでダウンロード
- 🧠 ミックスを理解するニューラルモデルで分離(単純なフィルターではない)
- ⏱️ 10分以内の音声・動画ファイルに対応
- 🗑️ アップロードと結果を30分以内に自動削除
こんなときに使う
- 🎤 練習用に:伴奏に合わせて歌う、または分離した歌声をじっくり研究する
- 🎶 カラオケ音源を探し回らず、家でカラオケナイトを開く
- 🎧 クリーンなステムでリミックスやマッシュアップを作る
- 🎙️ ポッドキャストや動画のサウンドトラックから歌声を除去する
- 🎓 音楽指導で、歌声と伴奏を別々に聞かせる
アップロードしたファイルはVPSサーバーに送られ、Demucsニューラルネットワークが分離を実行します。アップロードと生成結果はどちらも30分以内に自動削除されます。1回のジョブにはクレジットが必要で、サーバーのCPUでモデルがかける時間は曲の再生時間とほぼ同じです。1回のジョブは音声10分までで、それより長い曲は先にトリマーでカットして分割してください。クリーンなスタジオミックスならステム間の漏れはほぼありませんが、重いリバーブや歪んだ歌声、密度の高いメタルなど加工が強い録音では多少のクロストークが出ることがあります。これはどの音源分離モデルにも共通の正常な性質です。