tomai
Entrar
☁️ Nube · créditos

Texto a voz

Convierte texto escrito en voz MP3 natural con voces neuronales — mandarín y dos voces en inglés

🪙 Síntesis neuronal de voz en nuestro servidor: 2 créditos por trabajo

Hasta 20.000 caracteres por trabajo — unos 30 minutos de voz. El MP3 se descarga al terminar.

Escribe o pega el texto que quieres escuchar — hasta 20.000 caracteres por trabajo 0 / 20000

Motor de voz y límites prácticos

La síntesis corre sobre un motor TTS neuronal con cuatro perfiles de voz:

Los textos largos se dividen por límites de oración en fragmentos sintetizados de forma independiente y luego se concatenan sin silencios — una narración de 15 minutos no se degrada hacia el final. La salida es MP3 (48 kHz) entregada como cualquier tarea en la nube. La puntuación controla el ritmo: las rayas largas crean respiraciones, los puntos suspensivos aminoran la cadencia. SSML no se expone a propósito — el texto plano mantiene los resultados predecibles.

Voces naturales a la altura de proyectos reales

Convierta artículos en narraciones de hasta 20,000 caracteres por tarea, con voces masculinas y femeninas diferenciadas para chino e inglés.

🗣️

Voces neuronales naturales

Un modelo neuronal de texto a voz lee su texto con ritmo y entonación naturales, con más claridad que las voces sintéticas robóticas.

🌍

Voces en mandarín e inglés

Se puede elegir entre una voz en mandarín y dos en inglés, de modo que tanto el contenido en chino como el internacional puedan tener locución.

🎵

Descarga MP3 inmediata

El audio hablado se convierte a MP3 y queda listo para descargar al instante: ideal para locuciones, audio de estudio o accesibilidad.

Cómo funciona

  1. 1

    Escribe o pega tu texto — hasta 20.000 caracteres por trabajo, unos 30 minutos de voz.

  2. 2

    Elige una voz: chino mandarín, inglés estadounidense femenino o masculino.

  3. 3

    Inicia el trabajo y descarga tu MP3. El servidor lo sintetiza con un modelo neuronal — normalmente en unos segundos.

Preguntas frecuentes

¿Es síntesis neuronal real o el antiguo TTS robótico?

Síntesis neuronal real. Las voces son modelos Piper entrenados con miles de horas de grabaciones de estudio: pausas, entonación y acentos suenan naturales, nada que ver con las voces robóticas de la síntesis antigua.

¿Qué voces están disponibles?

Tres: chino mandarín, inglés estadounidense femenino (Amy) e inglés estadounidense masculino (Joe). La lista de voces está en el servidor y puede ampliarse.

¿Hay límite de longitud de texto?

Sí — 20.000 caracteres por trabajo (unos 30 minutos de audio). El texto más largo puede dividirse en varios trabajos y unirse con la herramienta de fusión de audio.

¿Se puede usar el audio con fines comerciales?

Sí — las narraciones generadas a partir de texto sobre el que se tengan derechos pueden publicarse libremente, incluidos videos monetizados y cursos. Nuestros términos no exigen atribuir la voz.

Herramientas relacionadas

¿Qué es la conversión de texto a voz?

La conversión de texto a voz convierte palabras escritas en audio hablado. Escribe o pega cualquier texto y la herramienta devuelve una grabación MP3 con sonido natural, sintetizada por un modelo de voz neuronal (Piper) que se ejecuta en nuestro servidor. Es lo contrario de la transcripción: en lugar de leer una grabación, escribes las palabras y recibes la voz. Hay tres voces integradas — chino mandarín, inglés estadounidense femenina y masculina — y, como no hay ningún archivo que subir, el propio texto es la solicitud. La síntesis suele tardar solo unos segundos. Los creadores de vídeo la usan para narraciones, los estudiantes para practicar pronunciación y los lectores ocupados para escuchar artículos en cualquier lugar.

Qué puede hacer esta herramienta

  • 📝 Convertir texto escrito o pegado en una grabación MP3 hablada
  • 🗣️ Elegir entre tres voces neuronales: chino mandarín, inglés estadounidense femenino o masculino
  • 📏 Procesar hasta 20.000 caracteres por tarea — unos 20 a 30 minutos de habla
  • ⚡ Sintetizar casi en tiempo real, normalmente en unos segundos
  • 🎧 Reproducir el resultado en la propia página y descargar el MP3
  • 🔤 Contar los caracteres en vivo — sin necesidad de subir ningún archivo

Cuándo usarla

  • Para crear narración o locución en vídeos, presentaciones o diapositivas
  • Para practicar la pronunciación de inglés o chino escuchando una voz clara
  • Para convertir un artículo o documento en audio y escucharlo de camino al trabajo
  • Para generar voz en cursos en línea, avisos o episodios de pódcast
  • Para leer en voz alta textos largos cuando los ojos necesitan un descanso

Tu texto viaja por una conexión cifrada hasta nuestro servidor VPS, donde el motor neuronal sintetiza el audio; los archivos de la tarea se eliminan al terminar el procesamiento y no se conserva nada. El servicio consume créditos por tarea. Los límites actuales: tres voces integradas (una de mandarín, dos de inglés), un máximo de 20.000 caracteres por tarea y salida MP3 a un ritmo natural fijo — las voces personalizadas, más idiomas y el control de velocidad aún no están disponibles.

Herramientas relacionadas