Texto para fala
Transforme texto escrito em fala MP3 natural com vozes neurais — mandarim e duas vozes em inglês
Até 20.000 caracteres por trabalho — cerca de 30 minutos de fala. O MP3 é baixado ao final.
⚠️ Não feche nem recarregue esta página até terminar, ou você pode perder o resultado.
💡 Arquivos grandes viajam no ritmo da sua conexão: o envio continua por conta própria e é retomado com segurança, então uma rede lenta afeta só o tempo, nunca os seus créditos.
Motor de voz e limites práticos
A síntese roda em um motor TTS neural com quatro perfis de voz:
- Chinês feminina / Chinês masculina — otimizadas para a prosódia do mandarim da China continental, tratam números e datas de forma idiomática.
- Inglês feminina / Inglês masculina — acento neutro, pausas sensatas na pontuação e nos títulos.
Textos longos são divididos nas fronteiras de frase em trechos sintetizados independentemente e depois concatenados sem intervalos — assim, uma narração de 15 minutos não degrada no final. A saída é MP3 (48 kHz) entregue como qualquer trabalho em nuvem. A pontuação controla o ritmo: travessões criam respirações, reticências deixam a cadência mais lenta. SSML fica propositalmente fora do alcance — texto simples mantém os resultados previsíveis.
Vozes naturais à altura de projetos reais
Transforme artigos em narrações de até 20.000 caracteres por trabalho, com vozes masculinas e femininas distintas para chinês e inglês.
Vozes neurais naturais
Um modelo neural de conversão de texto em fala lê seu texto com ritmo e entonação naturais — mais claro do que vozes robóticas.
Vozes em mandarim e inglês
Escolha entre uma voz em mandarim e duas vozes em inglês — conteúdo chinês e internacional ganham narração.
Download instantâneo em MP3
O áudio falado é convertido em MP3 e fica pronto para download na hora — ideal para narrações, áudios de estudo ou acessibilidade.
Como funciona
- 1
Digite ou cole seu texto — até 20.000 caracteres por trabalho, cerca de 30 minutos de fala.
- 2
Escolha uma voz: chinês mandarim, inglês americano feminino ou masculino.
- 3
Inicie o trabalho e baixe seu MP3. O servidor o sintetiza com um modelo neural — normalmente em poucos segundos.
Perguntas frequentes
É síntese neural de verdade ou o TTS robótico antigo?⌄
Síntese neural de verdade. As vozes são modelos Piper treinados com milhares de horas de gravações de estúdio — pausas, entonação e acentos soam naturais, nada a ver com as vozes robóticas da síntese antiga.
Quais vozes estão disponíveis?⌄
Três: chinês mandarim, inglês americano feminino (Amy) e masculino (Joe). A lista de vozes fica no servidor e pode crescer depois.
Há limite de tamanho de texto?⌄
Sim — 20.000 caracteres por trabalho (cerca de 30 minutos de áudio). Textos maiores podem ser divididos em vários trabalhos e unidos com a ferramenta de mesclagem de áudio.
Posso usar o áudio comercialmente?⌄
Sim — narrações que você gera a partir de texto sobre o qual tem direitos são suas para publicar, incluindo vídeos monetizados e cursos. Nossos termos não exigem atribuição da voz.
Ferramentas relacionadas
O que é conversão de texto em fala?
A conversão de texto em fala transforma palavras escritas em áudio falado. Digite ou cole qualquer texto e a ferramenta devolve uma gravação MP3 de som natural, sintetizada por um modelo de voz neural (Piper) que roda no nosso servidor. É o oposto da transcrição de áudio: em vez de ler uma gravação, você escreve as palavras e recebe a voz de volta. Há três vozes integradas — mandarim, inglês americano feminino e masculino — e, como não há nenhum arquivo para enviar, o próprio texto é a solicitação. A síntese costuma levar apenas alguns segundos. Criadores de vídeo usam para narração, estudantes para praticar pronúncia e leitores ocupados para ouvir artigos em qualquer lugar.
O que esta ferramenta faz
- 📝 Converter texto digitado ou colado em uma gravação MP3 falada
- 🗣️ Escolher entre três vozes neurais: mandarim, inglês americano feminino ou masculino
- 📏 Processar até 20.000 caracteres por tarefa — cerca de 20 a 30 minutos de fala
- ⚡ Sintetizar quase em tempo real, normalmente em alguns segundos
- 🎧 Ouvir o resultado direto na página e baixar o arquivo MP3
- 🔤 Contar caracteres ao vivo — sem precisar enviar nenhum arquivo
Quando usar
- Para criar narração ou locução em vídeos, apresentações ou slides
- Para praticar a pronúncia de inglês ou chinês ouvindo uma voz clara
- Para transformar um artigo ou documento em áudio e ouvi-lo no caminho
- Para preparar a voz de cursos online, avisos ou episódios de podcast
- Para ler em voz alta textos longos quando os olhos precisam de descanso
Seu texto viaja por uma conexão criptografada até o nosso servidor VPS, onde o motor neural sintetiza o áudio; os arquivos da tarefa são excluídos assim que o processamento termina e nada é mantido. O serviço consome créditos por tarefa. Limites atuais: três vozes integradas (uma de mandarim, duas de inglês), máximo de 20.000 caracteres por tarefa e saída MP3 em ritmo natural fixo — vozes personalizadas, mais idiomas e controle de velocidade ainda não estão disponíveis.
Ferramentas relacionadas
Estúdio de Áudio na Nuvem
Converta, comprima, corte, ajuste o volume, remova silêncios, altere a velocidade, aplique fade, inverta, crie loops e visualize arquivos de áudio.
Mesclar áudio
Combine de 2 a 6 clipes de áudio em um único arquivo, na ordem que você escolher
Áudio para texto
Transcreva a fala de qualquer vídeo ou áudio em texto simples — com tecnologia Qwen3-ASR