텍스트 음성 변환
신경망 음성으로 텍스트를 자연스러운 MP3 음성으로 바꿔 드립니다 — 만다린과 영어 음성 2종
작업당 최대 20,000자 — 약 30분 분량의 음성. 작업이 끝나면 MP3를 내려받습니다.
⚠️ 완료될 때까지 이 페이지를 닫거나 새로고침하지 마세요. 결과가 사라질 수 있습니다.
💡 큰 파일은 사용자의 연결 속도에 맞춰 전송됩니다. 업로드는 자동으로 계속되고 안전하게 이어 올릴 수 있으므로, 느린 회선은 시간에만 영향을 줄 뿐 크레딧에는 영향을 주지 않습니다.
음성 엔진과 실무상 제한
합성은 네 가지 음성 프로필을 갖춘 신경망 TTS 엔진으로 실행됩니다:
- Zh female / Zh male — 중국 본토 만다린 억양에 최적화되어 숫자와 날짜를 관용적으로 읽어 냅니다.
- En female / En male — 중립적인 악센트로 문장부호와 소제목에서 적절히 쉬어 갑니다.
긴 텍스트는 문장 경계로 나누어 각 청크를 독립적으로 합성한 뒤 무음 구간 없이 이어 붙입니다 — 그래서 15분짜리 내레이션도 끝으로 갈수록 품질이 떨어지지 않습니다. 출력은 다른 클라우드 작업과 같은 방식으로 전달되는 MP3(48 kHz)입니다. 문장부호가 호흡을 조절합니다: em 대시(—)는 숨을 만들고, 줄임표는 템포를 늦춥니다. SSML은 의도적으로 노출하지 않습니다 — 일반 텍스트만 써야 결과를 예측할 수 있기 때문입니다.
실제 프로젝트 규모에 맞는 자연스러운 음성
작업당 최대 20,000자의 글을 내레이션으로 바꾸고, 중국어와 영어에는 구분되는 남성·여성 음성을 제공합니다.
자연스러운 신경망 음성
신경망 TTS 모델이 자연스러운 리듬과 억양으로 텍스트를 읽어 줍니다. 기계적인 합성음보다 훨씬 또렷하고 자연스럽습니다.
중국어 + 영어 음성
중국어 음성 1종과 영어 음성 2종 중 선택할 수 있어, 중국어 콘텐츠와 해외 콘텐츠 모두에 목소리를 입힐 수 있습니다.
즉시 MP3 다운로드
음성 오디오가 MP3로 즉시 변환되어 바로 다운로드할 수 있습니다. 더빙, 학습용 오디오, 접근성 콘텐츠에 모두 유용합니다.
이용 방법
- 1
텍스트를 입력하거나 붙여넣으세요 — 작업당 최대 20,000자(약 30분 분량의 음성).
- 2
음성을 고르세요: 중국어(만다린), 미국식 영어 여성, 또는 미국식 영어 남성.
- 3
작업을 시작하고 MP3를 내려받으세요. 서버가 신경망 음성 모델로 합성합니다 — 보통 몇 초면 끝납니다.
자주 묻는 질문
진짜 신경망 TTS인가요, 아니면 옛날 로봇 합성음인가요?⌄
진짜 신경망 TTS입니다. 목소리는 수천 시간의 스튜디오 녹음으로 학습한 Piper 모델로, 멈춤·억양·강세가 자연스럽습니다 — 초기 합성음의 로봇 목소리와는 전혀 다릅니다.
어떤 음성이 있나요?⌄
3가지: 중국어(만다린), 미국식 영어 여성(Amy), 미국식 영어 남성(Joe). 음성 목록은 서버에 있으며 나중에 더 추가할 수 있습니다.
텍스트 길이 제한이 있나요?⌄
네 — 작업당 최대 20,000자(약 30분 오디오). 더 긴 텍스트는 여러 작업으로 나눠서 오디오 병합 도구로 이어 붙일 수 있습니다.
오디오를 상업적으로 사용할 수 있나요?⌄
네 — 권리가 있는 텍스트로 생성한 내레이션은 수익화된 영상이나 강좌를 포함해 자유롭게 게시할 수 있습니다. 우리 약관은 음성 출처 표기를 요구하지 않습니다.
관련 도구
텍스트 음성 변환이란?
텍스트 음성 변환은 쓴 글을 말소리로 바꿔 주는 도구입니다. 텍스트를 입력하거나 붙여 넣으면 서버에서 실행되는 신경망 음성 모델(Piper)이 자연스러운 MP3 음성을 합성합니다. 녹음을 읽어 내는 음성 인식과는 반대 방향으로, 말을 듣는 대신 단어를 쓰면 목소리가 돌아옵니다. 내장된 음성은 세 가지입니다. 중국어(만다린), 미국 영어 여성 음성, 미국 영어 남성 음성. 업로드할 파일이 없는 유일한 처리 방식이라 텍스트 자체가 요청으로 전송되며, 합성은 보통 몇 초 안에 끝납니다. 영상 제작자는 내레이션에, 학습자는 발음 연습에, 바쁜 독자는 이동 중에 기사를 듣는 데 활용합니다.
이 도구로 할 수 있는 일
- 📝 입력하거나 붙여 넣은 텍스트를 들을 수 있는 MP3 음성으로 변환
- 🗣️ 세 가지 신경망 음성 선택: 만다린, 미국 영어 여성, 미국 영어 남성
- 📏 작업당 최대 20,000자 — 약 20~30분 분량의 음성
- ⚡ 거의 실시간 합성, 보통 몇 초 안에 완료
- 🎧 페이지에서 바로 재생하고 MP3 파일 다운로드
- 🔤 글자 수 실시간 표시, 파일 업로드 없이 사용
이런 때 사용하세요
- 영상·프레젠테이션·슬라이드쇼의 내레이션이나 더빙 만들기
- 선명한 목소리를 들으며 영어나 중국어 발음 연습하기
- 기사나 문서를 음성으로 바꿔 이동 중에 듣기
- 온라인 강의, 공지, 팟캐스트 에피소드의 음성 준비하기
- 눈이 피로할 때 긴 글을 대신 읽어 주게 하기
텍스트는 암호화된 연결을 통해 VPS 서버로 전송되며 신경망 엔진이 음성을 합성합니다. 처리가 끝나면 작업 파일은 삭제되고 아무것도 보관하지 않습니다. 이 서비스는 작업당 크레딧을 소모합니다. 현재 제한 사항: 내장 음성 3종(만다린 1종, 영어 2종), 작업당 최대 20,000자, 고정된 자연스러운 속도의 MP3 출력만 지원하며 커스텀 음성·추가 언어·속도 조절은 아직 지원하지 않습니다.