tomai
登录
☁️ 云端 · AI · 点数

AI 视频字幕生成

博主必备:视频一键自动生成字幕——可直接烧录进画面发布,也可导出 SRT/VTT,还能 AI 翻译成 11 种语言

🪙 转录:5 点 · AI 翻译:每次 3 点

语音识别在我们自己的服务器上运行(Qwen3-ASR 模型,配合强制对齐生成精准时间轴),音频转录后 30 分钟内删除。转录耗时约为视频时长的 20%-50%;勾选烧录视频会额外增加一次转码时间。

管线阶段与样式选项

  1. ASR 阶段——转录并标注词级时间点;标点自动补全。
  2. 翻译阶段(可选)——感知上下文的逐行翻译,同时遵守每条字幕的阅读速度上限。
  3. 烧录阶段——字体、字号、描边和位置直接渲染进像素。
  4. 软字幕选项——把 SRT 作为可切换的字幕轨道封装进去而不烧入画面,视频本体分毫不动。

转录、翻译、烧录,一次任务全完成

语音识别生成带时间戳的 SRT/VTT(按所说语言),可再逐行翻译,最后把带样式的字幕烧录进视频。

🎧

真正的语音识别引擎

音频或视频由我们服务器上的 Qwen3-ASR 转写,而不是不稳定的浏览器语音引擎——生成带精确时间轴的字幕,处理完成即可立即编辑。

🌍

SRT、VTT、ASS 或纯文本

按你的编辑器、平台或播放器需要的格式下载字幕。字幕与原始音轨同步,你可以随时润色措辞、拆分台词并再次导出。

⏱️

一键翻译或烧录字幕

把做好的 SRT 交给 DeepSeek 翻译成十一种语言,或直接把字幕烧进视频——每个可选步骤单独计费,且只在你使用时才扣费。

如何使用

  1. 1

    上传你的视频(任意格式,最大 1 GB),选择语音语言或让 Qwen3-ASR 自动检测。

  2. 2

    服务器自动识别语音,默认把字幕直接烧录进画面。

  3. 3

    下载带字幕的成品视频直接发布——同时提供 SRT/VTT 给剪辑软件,还可一键 AI 翻译成 11 种语言。

  4. 4

    选择烧录或软字幕,调整样式后下载——SRT 文件本身也始终可以单独下载。

常见问题

字幕的准确率怎么样?

我们运行 Qwen3-ASR 模型,配合强制对齐生成精准时间轴。清晰的语音在包括中英文在内的多种语言中都有出色的准确率;口音重、背景音乐或多人抢话会降低效果,页面上的字幕预览方便快速人工校对。

输出什么格式?翻译后时间轴还在吗?

输出标准 SRT(所有剪辑软件和播放器通用)和网页播放器用的 WebVTT。AI 翻译只改写文字内容——每条字幕的时间轴原样保留,翻译好的文件可直接导入 YouTube 或剪辑软件。

我的视频会被保留或拿去训练吗?

不会。上传文件、提取的音频和字幕结果都会在 30 分钟内从服务器删除,任务只能用你会话签发的令牌访问,不分享、不用于训练。

相关工具

什么是 AI 视频字幕?

AI 视频字幕是根据视频中的语音自动生成的字幕——不用手动打字,也不用转录服务。本工具在我们的 VPS 上运行 Qwen3-ASR,一款 Whisper 级别的语音识别模型:上传任意视频(最大 1 GB),拿到时间轴精准的字幕,可直接烧录进画面发布,也可导出 SRT 和 WebVTT 给剪辑软件。字幕还能用 AI 翻译成 11 种语言。它是为 B 站、抖音、YouTube 博主、课程作者,以及任何想从视频中获得更大曝光和更好无障碍体验的人打造的。 你还可以在导出前于页面内编辑字幕,让最终文件符合你的措辞,而不是只有模型的选择。

这款工具能做什么

  • 🎙️ Qwen3-ASR 识别语音,带词级时间轴
  • 🌍 10 种语言可选提示,外加自动检测
  • 🔥 字幕直接烧录进视频,下载即可发布
  • 📄 导出 SRT 或 WebVTT,适配任何剪辑软件
  • 🌐 字幕可 AI 翻译成 11 种语言
  • ✏️ 页面内可编辑字幕,然后重新烧录

什么时候会用到

  • 发布视频时想带上字幕,提升曝光和互动
  • 想让内容对聋哑和听障观众无障碍
  • 想把视频翻译成其他语言,面向新受众
  • 课程或内部视频库需要字幕文件

你的视频会上传到我们的 VPS,由 Qwen3-ASR 转录;文件 30 分钟内自动删除。转录按时长消耗积分,每次 AI 翻译另收少量费用。对质量的如实说明:识别效果取决于音频本身——背景噪音大、口音重、多人抢话或语速过快都会降低准确率,因此我们提供页面内编辑器,导出前可以逐句检查修正。

相关工具