tomai
ログイン
☁️ クラウド · クレジット

ボーカル分離

ニューラルステムモデルで曲をボーカルとインストに分割——即席カラオケ

🪙 サーバーでのニューラルステム分離:1回 5 クレジット

🎙️ ニューラルモデルが音声をボーカル + インスト(MP3)に分割します。10分までの動画に対応。

サーバー側の FFmpeg があらゆる形式を処理します — ブラウザで再生できない HEVC/H.265 も対応。ファイルは30分以内にサーバーから削除されます。

練習・リミックス・カラオケに使えるステム分離

どんなトラックもボーカルとインストゥルメンタルに分離 — あるいはドラムとベースを含む4ステームに分割 — し、別々のファイルを1つのZIPでお届けします。

🎙️

AI ボーカル分離

ディープラーニングモデル(Demucs)がミックスを解析し、周波数フィルタではなく聴き取りによってボーカルと音楽を分離します。

🎤

ボーカル + カラオケ音源

1回のアップロードで、カラオケ用の伴奏とクリアなアカペラの両方を入手。リミックスやカバー、練習に使えます。

📦

2トラックを ZIP で

分離した2トラックが1つの ZIP にまとまってダウンロードでき、DAW や動画編集ソフトにそのまま読み込めます。

よくある質問

分離の品質はどのくらいですか?

Demucs は現時点で最強のオープンソースステム分離モデルです。きれいなスタジオミックスなら、ボーカルはほぼ楽器なしで取り出せます。極端なケース(強いリバーブ、歪んだボーカル、密度の高いメタルミックス)ではステム間でわずかに混ざりが見られますが、どの音源分離モデルでも正常な範囲です。

なぜ2つの別ダウンロードではなく ZIP なのですか?

2つのステムはサーバー上で同時に生成され、ZIP ならペアを保ちファイル名も失いません。ZIP の中身はちょうど vocals.mp3 と instrumental.mp3 の2ファイルです。

長さの制限は?

1回につき10分まで——ニューラルステム分離は CPU 負荷が高く、それ以上長い入力はサーバー容量を圧迫します。長い曲は先に動画トリマーで切り、部分ごとに分離してください。

インスト版にかすかにボーカルが残るのはなぜですか?

分離は統計的な処理であり完全ではないため、声と楽器で重なる周波数帯にはどうしても残留が生じます。4ステームモデルは2ステームよりさらに低減しますが、完全にクリーンなインストを目指すなら、センター定位のボーカルが疎なトラックを選ぶのがおすすめです。

ソースセパレーションのモデルと出力

分離にはSDR最適化のニューラルネットワークを使用し、ワーカーのCPU上で実行します:

各ステームはソースのサンプルレートでMP3 320 kbpsにエンコードされ(入力がロスレスの場合はWAV)、1つのZIPにまとめられます。最長15分の楽曲まで受け付けます。ステーム間のリーク(音漏れ)はマスタリングのしっかりしたポップ/ロックで最小となり、密度の高いエレクトロニックミックスでは大きくなります — 返金で驚かせるより、正直な期待値を先にお伝えする方が良いと考えているからです。

使い方

  1. 1

    曲や動画をアップロードします——最大10分、あらゆる音声形式またはほとんどの動画。

  2. 2

    処理を開始します。ニューラルモデルがミックスを分析し、声と楽器を分離します。

  3. 3

    vocals.mp3 と instrumental.mp3 が入った ZIP をダウンロードします。CPU 処理は曲の長さとほぼ同じ時間かかります。

関連ツール

ボーカル分離とは?

ボーカル分離は、1曲の音源を「歌声だけ」と「音楽だけ」の2つのクリーンなトラックに分けます。単純なフィルターで残った音をそのまま残すのではなく、ニューラルネットワークの音源分離モデルがミックス全体を聴いて、歌声と楽器をそれぞれ独立した音声ストリームとして再構成します。10分以内の音声ファイル(または音声付き動画)をアップロードすると、サーバーが vocals.mp3 と instrumental.mp3 の2つを収めたZIPを返します。歌手はメロディなしで練習でき、リミキサーはフックやビートを単独で取り出せ、ポッドキャスト編集者は不要な声をクリップから消せ、カラオケ好きは数秒で伴奏を手に入れられます。分離処理自体はサーバー上でオープンソースの Demucs モデルが実行します。

このツールでできること

  • 🎤 どんな曲からでも歌声を抽出し、クリーンなアカペラトラックに
  • 🎹 伴奏を取り出して、すぐにカラオケバージョンに
  • 📦 2つのトラックをMP3として1つのZIPでダウンロード
  • 🧠 ミックスを理解するニューラルモデルで分離(単純なフィルターではない)
  • ⏱️ 10分以内の音声・動画ファイルに対応
  • 🗑️ アップロードと結果を30分以内に自動削除

こんなときに使う

  • 🎤 練習用に:伴奏に合わせて歌う、または分離した歌声をじっくり研究する
  • 🎶 カラオケ音源を探し回らず、家でカラオケナイトを開く
  • 🎧 クリーンなステムでリミックスやマッシュアップを作る
  • 🎙️ ポッドキャストや動画のサウンドトラックから歌声を除去する
  • 🎓 音楽指導で、歌声と伴奏を別々に聞かせる

アップロードしたファイルはVPSサーバーに送られ、Demucsニューラルネットワークが分離を実行します。アップロードと生成結果はどちらも30分以内に自動削除されます。1回のジョブにはクレジットが必要で、サーバーのCPUでモデルがかける時間は曲の再生時間とほぼ同じです。1回のジョブは音声10分までで、それより長い曲は先にトリマーでカットして分割してください。クリーンなスタジオミックスならステム間の漏れはほぼありませんが、重いリバーブや歪んだ歌声、密度の高いメタルなど加工が強い録音では多少のクロストークが出ることがあります。これはどの音源分離モデルにも共通の正常な性質です。

関連ツール