tomai
Entrar
☁️ Nuvem · créditos

Texto para fala

Transforme texto escrito em fala MP3 natural com vozes neurais — mandarim e duas vozes em inglês

🪙 Síntese neural de voz no nosso servidor: 2 créditos por trabalho

Até 20.000 caracteres por trabalho — cerca de 30 minutos de fala. O MP3 é baixado ao final.

Digite ou cole o texto que deseja ouvir — até 20.000 caracteres por trabalho 0 / 20000

Motor de voz e limites práticos

A síntese roda em um motor TTS neural com quatro perfis de voz:

Textos longos são divididos nas fronteiras de frase em trechos sintetizados independentemente e depois concatenados sem intervalos — assim, uma narração de 15 minutos não degrada no final. A saída é MP3 (48 kHz) entregue como qualquer trabalho em nuvem. A pontuação controla o ritmo: travessões criam respirações, reticências deixam a cadência mais lenta. SSML fica propositalmente fora do alcance — texto simples mantém os resultados previsíveis.

Vozes naturais à altura de projetos reais

Transforme artigos em narrações de até 20.000 caracteres por trabalho, com vozes masculinas e femininas distintas para chinês e inglês.

🗣️

Vozes neurais naturais

Um modelo neural de conversão de texto em fala lê seu texto com ritmo e entonação naturais — mais claro do que vozes robóticas.

🌍

Vozes em mandarim e inglês

Escolha entre uma voz em mandarim e duas vozes em inglês — conteúdo chinês e internacional ganham narração.

🎵

Download instantâneo em MP3

O áudio falado é convertido em MP3 e fica pronto para download na hora — ideal para narrações, áudios de estudo ou acessibilidade.

Como funciona

  1. 1

    Digite ou cole seu texto — até 20.000 caracteres por trabalho, cerca de 30 minutos de fala.

  2. 2

    Escolha uma voz: chinês mandarim, inglês americano feminino ou masculino.

  3. 3

    Inicie o trabalho e baixe seu MP3. O servidor o sintetiza com um modelo neural — normalmente em poucos segundos.

Perguntas frequentes

É síntese neural de verdade ou o TTS robótico antigo?

Síntese neural de verdade. As vozes são modelos Piper treinados com milhares de horas de gravações de estúdio — pausas, entonação e acentos soam naturais, nada a ver com as vozes robóticas da síntese antiga.

Quais vozes estão disponíveis?

Três: chinês mandarim, inglês americano feminino (Amy) e masculino (Joe). A lista de vozes fica no servidor e pode crescer depois.

Há limite de tamanho de texto?

Sim — 20.000 caracteres por trabalho (cerca de 30 minutos de áudio). Textos maiores podem ser divididos em vários trabalhos e unidos com a ferramenta de mesclagem de áudio.

Posso usar o áudio comercialmente?

Sim — narrações que você gera a partir de texto sobre o qual tem direitos são suas para publicar, incluindo vídeos monetizados e cursos. Nossos termos não exigem atribuição da voz.

Ferramentas relacionadas

O que é conversão de texto em fala?

A conversão de texto em fala transforma palavras escritas em áudio falado. Digite ou cole qualquer texto e a ferramenta devolve uma gravação MP3 de som natural, sintetizada por um modelo de voz neural (Piper) que roda no nosso servidor. É o oposto da transcrição de áudio: em vez de ler uma gravação, você escreve as palavras e recebe a voz de volta. Há três vozes integradas — mandarim, inglês americano feminino e masculino — e, como não há nenhum arquivo para enviar, o próprio texto é a solicitação. A síntese costuma levar apenas alguns segundos. Criadores de vídeo usam para narração, estudantes para praticar pronúncia e leitores ocupados para ouvir artigos em qualquer lugar.

O que esta ferramenta faz

  • 📝 Converter texto digitado ou colado em uma gravação MP3 falada
  • 🗣️ Escolher entre três vozes neurais: mandarim, inglês americano feminino ou masculino
  • 📏 Processar até 20.000 caracteres por tarefa — cerca de 20 a 30 minutos de fala
  • ⚡ Sintetizar quase em tempo real, normalmente em alguns segundos
  • 🎧 Ouvir o resultado direto na página e baixar o arquivo MP3
  • 🔤 Contar caracteres ao vivo — sem precisar enviar nenhum arquivo

Quando usar

  • Para criar narração ou locução em vídeos, apresentações ou slides
  • Para praticar a pronúncia de inglês ou chinês ouvindo uma voz clara
  • Para transformar um artigo ou documento em áudio e ouvi-lo no caminho
  • Para preparar a voz de cursos online, avisos ou episódios de podcast
  • Para ler em voz alta textos longos quando os olhos precisam de descanso

Seu texto viaja por uma conexão criptografada até o nosso servidor VPS, onde o motor neural sintetiza o áudio; os arquivos da tarefa são excluídos assim que o processamento termina e nada é mantido. O serviço consome créditos por tarefa. Limites atuais: três vozes integradas (uma de mandarim, duas de inglês), máximo de 20.000 caracteres por tarefa e saída MP3 em ritmo natural fixo — vozes personalizadas, mais idiomas e controle de velocidade ainda não estão disponíveis.

Ferramentas relacionadas