Texte en parole
Transformez du texte en parole MP3 naturelle grâce à des voix neuronales — mandarin et deux voix anglaises
Jusqu'à 20 000 caractères par travail — environ 30 minutes de parole. Le MP3 se télécharge à la fin.
⚠️ Ne fermez pas et n'actualisez pas cette page avant la fin, sinon vous risquez de perdre le résultat.
💡 Les fichiers volumineux voyagent au rythme de votre connexion : l'envoi continue de lui-même et reprend en toute sécurité — un réseau lent ne coûte que du temps, jamais de crédits.
Moteur de voix et limites pratiques
La synthèse repose sur un moteur TTS neuronal doté de quatre profils de voix :
- Zh féminine / Zh masculine — optimisée pour la prosodie du mandarin de Chine continentale, lit nombres et dates de façon idiomatique.
- En féminine / En masculine — accent neutre, pauses judicieuses aux ponctuations et aux titres.
Les textes longs sont scindés aux frontières des phrases en segments synthétisés indépendamment, puis concaténés sans interruption — une narration de 15 minutes ne se dégrade donc pas vers la fin. La sortie est un MP3 (48 kHz) livré comme toute tâche cloud. La ponctuation contrôle le rythme : les tirets cadratins créent des respirations, les points de suspension ralentissent la cadence. Le SSML n’est volontairement pas exposé — le texte brut garantit des résultats prévisibles.
Des voix naturelles taillées pour de vrais projets
Transformez des articles en narrations allant jusqu’à 20 000 caractères par tâche, avec des voix masculines et féminines distinctes pour le chinois et l’anglais.
Des voix neuronales naturelles
Un modèle de synthèse vocale neuronale lit votre texte avec un rythme et une intonation naturels — bien plus clair que les voix robotiques.
Voix mandarin et anglais
Choisissez parmi une voix en mandarin et deux voix en anglais : contenus chinois comme internationaux peuvent être doublés.
Téléchargement MP3 immédiat
L'audio lu est converti en MP3 et prêt à télécharger immédiatement — pour des voix off, des contenus d'étude ou l'accessibilité.
Comment ça marche
- 1
Saisissez ou collez votre texte — jusqu'à 20 000 caractères par travail, soit environ 30 minutes de parole.
- 2
Choisissez une voix : mandarin, anglais américain féminin ou masculin.
- 3
Lancez le travail et téléchargez votre MP3. Le serveur le synthétise avec un modèle neuronal — généralement en quelques secondes.
Questions fréquentes
Est-ce une vraie synthèse neuronale ou l'ancien TTS robotique ?⌄
Une vraie synthèse neuronale. Les voix sont des modèles Piper entraînés sur des milliers d'heures d'enregistrements en studio — pauses, intonation et accentuation sonnent naturelles, loin des voix robotiques des débuts.
Quelles voix sont disponibles ?⌄
Trois : mandarin, anglais américain féminin (Amy) et masculin (Joe). La liste des voix est côté serveur et pourra s'étoffer.
Y a-t-il une limite de longueur de texte ?⌄
Oui — 20 000 caractères par travail (environ 30 minutes d'audio). Un texte plus long peut être découpé en plusieurs travaux puis réassemblé avec l'outil de fusion audio.
Puis-je utiliser l’audio à des fins commerciales ?⌄
Oui — les narrations que vous générez à partir d’un texte sur lequel vous détenez des droits sont libres de publication, y compris dans des vidéos monétisées et des cours. Nos conditions n’imposent pas d’attribuer la voix.
Outils associés
Qu'est-ce que la synthèse vocale ?
La synthèse vocale transforme un texte écrit en parole. Saisissez ou collez n'importe quel texte et l'outil vous renvoie un enregistrement MP3 au son naturel, synthétisé par un modèle vocal neuronal (Piper) exécuté sur notre serveur. C'est l'exact opposé de la transcription : au lieu de lire un enregistrement, vous écrivez les mots et vous récupérez la voix. Trois voix sont intégrées — mandarin, anglais américain féminin et masculin — et comme il n'y a aucun fichier à téléverser, le texte lui-même constitue la requête. La synthèse ne prend généralement que quelques secondes. Les créateurs de vidéos l'utilisent pour les narrations, les étudiants pour travailler leur prononciation et les lecteurs pressés pour écouter des articles en déplacement.
Ce que cet outil peut faire
- 📝 Convertir un texte saisi ou collé en un enregistrement MP3 parlé
- 🗣️ Choisir parmi trois voix neuronales : mandarin, anglais américain féminin ou masculin
- 📏 Traiter jusqu'à 20 000 caractères par tâche — environ 20 à 30 minutes de parole
- ⚡ Synthétiser quasi en temps réel, généralement en quelques secondes
- 🎧 Écouter le résultat directement sur la page et télécharger le MP3
- 🔤 Suivre le nombre de caractères en direct — sans aucun fichier à téléverser
Quand l'utiliser
- Pour créer une narration ou une voix off pour une vidéo, une présentation ou un diaporama
- Pour travailler la prononciation de l'anglais ou du chinois en écoutant une voix claire
- Pour transformer un article ou un document en audio et l'écouter en déplacement
- Pour produire la voix de cours en ligne, d'annonces ou d'épisodes de podcast
- Pour faire lire à voix haute de longs textes quand les yeux ont besoin de repos
Votre texte transite par une connexion chiffrée jusqu'à notre serveur VPS, où le moteur neuronal synthétise l'audio ; les fichiers de la tâche sont supprimés une fois le traitement terminé, rien n'est conservé. Le service consomme des crédits par tâche. Limites actuelles : trois voix intégrées (une de mandarin, deux d'anglais), un maximum de 20 000 caractères par tâche et une sortie MP3 à un débit naturel fixe — les voix personnalisées, d'autres langues et le réglage de la vitesse ne sont pas encore disponibles.
Outils associés
Studio audio cloud
Convertissez, compressez, découpez, ajustez le volume, supprimez les silences, modifiez la vitesse, appliquez des fondu, inversez, bouclez et visualisez des fichiers audio.
Fusionner l'audio
Combinez 2 à 6 extraits audio en un seul fichier, dans l'ordre de votre choix
Audio vers texte
Transcrivez la parole de n'importe quelle vidéo ou fichier audio en texte brut — propulsé par Qwen3-ASR