AI 동영상 자막 생성기
크리에이터를 위해: 어떤 영상이든 자막 자동 생성 — 화면에 굽거나 SRT/VTT로, 11개 언어 번역까지
음성 인식은 자체 서버(Qwen3-ASR 모델, 강제 정렬로 정확한 타임코드 생성)에서 실행됩니다 — 오디오는 전사 후 30분 안에 삭제됩니다. 전사에는 영상 길이의 약 20~50%가 걸리고, 자막 굽기 영상을 선택하면 재인코딩 시간이 추가됩니다.
⚠️ 완료될 때까지 이 페이지를 닫거나 새로고침하지 마세요. 결과가 사라질 수 있습니다.
💡 업로드는 청크 단위로 분할되어 이어 올리기가 가능하며 속도는 사용자의 네트워크 환경이 좌우합니다. 실패한 청크는 자동으로 재시도되며, 과금은 작업이 실제로 완료되었을 때만 이루어집니다.
✏️ 자막 편집기
줄이나 타임스탬프(00:00:01,000 형식)를 고치고 '적용'을 누르세요 — 다운로드·번역·굽기 모두 편집본을 사용합니다.
파이프라인 단계와 스타일 옵션
- ASR 단계 — 단어 단위 타이밍으로 전사하고 문장부호는 자동으로 붙습니다.
- 번역 단계 (선택) — 자막 한 줄의 읽기 속도 제한을 지키는 문맥 인식 번역입니다.
- 자막 삽입 단계 — 글꼴, 크기, 외곽선, 위치가 화면 픽셀에 렌더링됩니다.
- 소프트 자막 옵션 — 화면에 새기는 대신 SRT를 선택 가능한 트랙으로 넣어 영상은 그대로 유지할 수 있습니다.
한 번의 작업으로 전사, 번역, 자막 삽입까지
음성 인식이 발화 언어로 타임스탬프가 찍힌 SRT/VTT를 만들고, 원하면 줄 단위로 번역한 뒤 스타일을 입힌 자막을 영상에 새겨 넣습니다.
진짜 음성 인식
오디오나 비디오는 불안정한 브라우저 음성 엔진이 아니라 서버의 Qwen3-ASR로 받아쓰며, 정확한 타임라인이 있는 자막이 처리 완료와 동시에 바로 편집 가능한 상태로 생성됩니다.
SRT·VTT·ASS·일반 텍스트
편집기, 플랫폼 또는 플레이어가 요구하는 형식으로 자막을 다운로드하세요. 자막은 원본 오디오와 동기화되어 있어 문구를 다듬거나 줄을 나누고 언제든 다시 내보낼 수 있습니다.
번역이나 굽기도 한 번에
완성된 SRT를 DeepSeek에 넘겨 11개 언어로 번역하거나, 자막을 영상에 바로 굽습니다. 각 선택 단계는 별도로 청구되며 사용할 때만 요금이 부과됩니다.
이용 방법
- 1
동영상을 업로드하세요(모든 형식, 최대 1 GB) — 언어를 직접 고르거나 Qwen3-ASR 자동 감지에 맡기세요.
- 2
서버가 음성을 전사하고, 기본 설정에서는 자막을 화면에 바로 구워 넣습니다.
- 3
바로 올릴 수 있는 자막 영상을 다운로드하세요 — 편집기용 SRT/VTT와 11개 언어 AI 번역도 함께.
- 4
자막 삽입 방식이나 소프트 자막을 고르고 스타일을 조정한 뒤 내려받으세요 — SRT 파일 자체도 언제든 내려받을 수 있습니다.
자주 묻는 질문
자막이 얼마나 정확한가요?
음성 인식에는 Qwen3-ASR 모델을 사용하며, 강제 정렬로 타임코드를 생성합니다 — 또렷한 음성이라면 영어·중국어를 포함한 여러 언어에서 매우 정확하게 전사됩니다. 심한 사투리, 배경 음악, 겹치는 말소리는 정확도를 낮추지만 SRT 미리보기로 빠른 손질이 쉽습니다.
어떤 형식으로 나오고, 번역해도 타임스탬프가 유지되나요?
모든 편집기·플레이어에서 통하는 표준 SRT와 웹 플레이어용 WebVTT를 받습니다. AI 번역은 텍스트 줄만 다시 쓰며 모든 큐가 원래 타이밍을 유지하므로 번역 파일을 유튜브나 편집기에 그대로 넣을 수 있습니다.
영상이 보관되거나 학습에 쓰이나요?
아니요. 업로드, 추출된 오디오, 전사 결과 모두 30분 안에 서버에서 삭제되며, 작업에는 세션의 서명된 토큰으로만 접근할 수 있습니다. 공유나 학습 활용은 일절 없습니다.
관련 도구
AI 동영상 자막이란?
AI 동영상 자막은 동영상의 음성을 기반으로 자동 생성되는 캡션입니다——수동 타이핑도, 필사 서비스도 필요 없습니다. 이 도구는 당사 VPS에서 Whisper급 음성 인식 모델인 Qwen3-ASR을 실행합니다: 최대 1GB의 어떤 동영상이든 업로드하면 정확하게 타이밍된 캡션을 얻고, 게시 가능한 상태로 동영상에 새겨 넣어 다운로드하거나 편집기용 SRT/WebVTT 파일로 내보낼 수 있습니다. 캡션은 AI로 11개 언어로 번역할 수도 있습니다. 유튜버, 틱토커, 강좌 제작자, 그리고 동영상에서 도달 범위와 접근성을 끌어내고 싶은 모든 사람을 위해 만들어졌습니다. 또한 내보내기 전에 페이지에서 캡션을 편집할 수 있어, 모델의 선택뿐 아니라 당신의 문구에 맞는 최종 파일을 만들 수 있습니다.
이 도구로 할 수 있는 일
- 🎙️ Qwen3-ASR이 단어 단위 타이밍으로 음성을 필사
- 🌍 10개 언어의 소스 언어 힌트 + 자동 감지
- 🔥 자막을 동영상에 직접 새겨 넣어 게시 가능한 상태로 출력
- 📄 SRT 또는 WebVTT로 내보내 어떤 편집 소프트웨어에도 적용
- 🌐 캡션을 AI로 11개 언어에 번역
- ✏️ 페이지 안에서 캡션을 편집한 뒤 동영상에 다시 새기기
이런 때 사용해요
- 동영상을 게시하면서 도달 범위와 참여도를 위해 캡션이 필요할 때
- 콘텐츠를 청각 장애가 있는 시청자도 접근 가능하게 만들고 싶을 때
- 동영상을 다른 언어로 바꿔 새로운 시청자를 만나고 싶을 때
- 강좌나 사내 동영상 라이브러리용 자막 파일이 필요할 때
동영상은 당사 VPS에 업로드되어 Qwen3-ASR이 필사합니다; 파일은 30분 안에 자동 삭제됩니다. 필사는 길이에 따라 크레딧을 소비하고, AI 번역은 실행할 때마다 별도의 소액이 부과됩니다. 품질에 대해 솔직히 말하면: 인식 정확도는 오디오 자체에 달려 있습니다——심한 배경 소음, 강한 억양, 말이 겹치는 상황, 지나치게 빠른 말투는 모두 정확도를 떨어뜨립니다——그래서 내보내기 전에 확인·수정할 수 있는 페이지 내 편집기를 제공합니다.