AI 動画字幕生成
クリエイターのために:どんな動画にも字幕を自動生成 — 映像への焼き込みも SRT/VTT も、11言語への翻訳も
音声認識は自社サーバー(Qwen3-ASR モデル、強制アライメントで正確なタイムコードを生成)で実行 — 音声は文字起こし後30分以内に削除されます。所要時間は動画の長さの約20〜50%、焼き込み動画を選ぶと再エンコードの時間が加わります。
⚠️ 完了するまでこのページを閉じたり更新したりしないでください。結果が失われる場合があります。
💡 アップロードはチャンク(分割)方式で、中断したところから再開できます。速度はお使いのネットワーク環境次第です。失敗したチャンクは自動で再試行され、課金はジョブが実際に完了したときにだけ行われます。
✏️ 字幕エディター
行やタイムスタンプ(00:00:01,000 形式)を修正して「適用」— ダウンロード・翻訳・焼き込みはすべて編集後の内容を使います。
パイプラインの各段階とスタイル設定
- ASRパス — 単語レベルのタイミング付き文字起こし。句読点は自動で付与されます。
- 翻訳パス(任意) — キューごとの表示速度制限を守る、行単位を考慮した翻訳。
- 焼き込みパス — フォント、サイズ、縁取り、位置をピクセルに描き込みます。
- ソフト字幕オプション — 焼き込まずにSRTを選択可能なトラックとして多重化し、映像は無変更のまま保てます。
文字起こし・翻訳・焼き込みを1つのジョブで
音声認識が話されている言語のSRT/VTTをタイムスタンプ付きで生成し、任意で行単位の翻訳を行い、スタイルを整えた字幕を動画に焼き込みます。
本物の音声認識エンジン
音声や動画は、不安定なブラウザの音声エンジンではなく、サーバー上の Qwen3-ASR で文字起こしされ、正確なタイミングの字幕が処理完了と同時に編集可能な状態で生成されます。
SRT・VTT・ASS・プレーンテキスト
エディタやプラットフォーム、プレイヤーが必要とする形式で字幕をダウンロードできます。字幕は元の音声と同期しているので、文言の修正や行の分割をして、いつでも再エクスポートできます。
翻訳も焼き込みもワンタップで
完成した SRT を DeepSeek に渡して 11 言語へ翻訳したり、字幕を動画に直接焼き込んだりできます。各オプションは別々に、使ったときだけ課金されます。
使い方
- 1
動画をアップロード(全形式・最大 1 GB)— 話されている言語を選ぶか Qwen3-ASR の自動検出に任せます。
- 2
サーバーが音声を文字起こしし、既定では字幕をそのまま映像に焼き込みます。
- 3
投稿できる字幕付き動画をダウンロード — 編集ソフト用の SRT/VTT や、11言語への AI 翻訳も。
- 4
焼き込みかソフト字幕かを選び、スタイルを調整してダウンロードします。SRT自体もいつでもダウンロードできます。
よくある質問
字幕の精度はどのくらいですか?
音声認識に Qwen3-ASR モデルを使用し、強制アライメントで正確なタイムコードを生成しています — クリアな音声なら英語・中国語を含む多くの言語で非常に高精度に文字起こしできます。強い訛り、BGM、話者の重なりは精度を下げますが、SRT プレビューで手直しも簡単です。
どの形式で出力され、翻訳後もタイムスタンプは保たれますか?
標準的な SRT(あらゆる編集ソフト・プレイヤー対応)と、ウェブプレイヤー用の WebVTT が得られます。AI 翻訳が書き換えるのはテキスト行だけ — すべてのキューが元のタイミングを保つので、翻訳ファイルはそのまま YouTube や編集ソフトに投入できます。
動画は保存されたり学習に使われたりしますか?
いいえ。アップロード、抽出した音声、文字起こし結果はすべて30分以内にサーバーから削除され、ジョブにはセッションの署名付きトークンでしかアクセスできません。共有も学習利用も一切ありません。
関連ツール
AI 動画字幕とは?
AI 動画字幕とは、動画内の音声から自動生成されるキャプションです——手動で文字起こしする必要も、文字起こしサービスも不要です。本ツールは当社の VPS 上で Whisper クラスの音声認識モデル Qwen3-ASR を実行します:最大 1 GB の任意の動画をアップロードすると、正確にタイミング調整されたキャプションが得られ、投稿できる状態で動画に焼き込んでダウンロードするか、編集ソフト用に SRT や WebVTT として書き出すかを選べます。キャプションは AI で 11 言語に翻訳することもできます。YouTuber、TikToker、コース制作者、そして動画からリーチとアクセシビリティを引き出したいすべての人向けに作られています。 また、エクスポート前にページ内でキャプションを編集できるので、モデルの選択だけでなく、あなたの言葉づかいにも合った最終ファイルにできます。
このツールでできること
- 🎙️ Qwen3-ASR が単語レベルのタイミング付きで音声を文字起こし
- 🌍 10 言語のソース言語ヒントに加え、自動検出にも対応
- 🔥 字幕を動画に直接焼き込み、投稿できる状態で出力
- 📄 SRT または WebVTT で書き出し、あらゆる編集ソフトに対応
- 🌐 キャプションを AI で 11 言語に翻訳
- ✏️ ページ内でキャプションを編集し、動画を再焼き込み
こんなときに使います
- 動画を公開していて、リーチとエンゲージメントのためにキャプションが欲しい
- コンテンツを聴覚障害のある視聴者にもアクセシブルにしたい
- 動画を他の言語に作り替えて、新しい視聴者に向けたい
- コースや社内の動画ライブラリ用に字幕ファイルが必要
動画は当社の VPS にアップロードされ、Qwen3-ASR が文字起こしを行います;ファイルは 30 分以内に自動削除されます。文字起こしは長さに基づいてクレジットを消費し、AI 翻訳の実行ごとに別途少額の費用がかかります。品質について正直に言えば、認識精度は音声そのものに依存します——大きな背景ノイズ、強いアクセント、話者の重なり、極端に速い話し方はすべて精度を下げます——そのため、書き出す前に確認・修正できるページ内エディタを用意しています。