文字转语音
用神经网络人声把文字变成自然的 MP3 语音——普通话 + 两种英语音色
每次任务最多 2 万字符——大约半小时的语音。任务完成后即可下载 MP3。
⚠️ 处理完成前请不要关闭或刷新此页面,否则可能无法获取处理结果。
💡 大文件按你自己网络的速率传输:上传会自动继续、可安全断点续传,网速慢只影响时间,绝不会影响你的积分。
语音引擎与实用限制
合成由神经网络 TTS 引擎完成,提供四种音色:
- 中文女声 / 中文男声——针对大陆普通话韵律优化,数字与日期的读法地道。
- 英语女声 / 英语男声——口音中性,标点和标题处停顿合理。
长文本按句子边界切成独立合成的分段,再无缝拼接——15 分钟的配音听到最后音质也不衰减。输出为 MP3(48 kHz),像其他云端任务一样交付。标点控制节奏:破折号带来换气感,省略号放慢语速。刻意不开放 SSML——纯文本能让结果保持可预期。
为真实项目而生的自然语音
把文章变成配音朗读,单次最长 20,000 字符,中文和英语均有男女声可选。
自然神经语音
神经 TTS 模型以自然的节奏和语调朗读文本——比机械合成音清晰自然。
中文 + 英文多声音
提供普通话声音和两档英文声音,中英文内容都能配音。
即时 MP3 下载
朗读音频即时转成 MP3 供下载——配音、学习音频、无障碍场景都好用。
如何使用
- 1
输入或粘贴文字——每次任务最多 2 万字符,大约是半小时的语音。
- 2
选择音色:普通话中文、美式英语女声或美式英语男声。
- 3
开始任务并下载 MP3。服务器用神经网络语音模型合成——通常只要几秒钟。
常见问题
这是真正的神经网络语音,还是老式机械合成音?⌄
真正的神经网络语音。音色基于 Piper 模型,用数千小时录音室素材训练而成——停顿、语调、重音都很自然,绝不是早期语音合成的机器人腔。
有哪些音色可选?⌄
三种:普通话中文、美式英语女声(Amy)、美式英语男声(Joe)。音色表在服务端,以后可以继续添加。
文本长度有限制吗?⌄
有——每次任务最多 2 万字符(约 30 分钟音频)。更长的文本可以分多次任务生成,再用音频合并工具拼接。
生成的音频可以商用吗?⌄
可以——用你有权使用的文本生成的朗读音频归你发布,包括用于变现的视频和课程。我们的条款不要求为语音署名。
相关工具
什么是文字转语音?
文字转语音是把文字变成说话声音的工具。输入或粘贴一段文字,服务器上的神经网络语音引擎(Piper)就会把它合成为自然的 MP3 朗读音频。它与语音转文字正好相反——不需要上传任何录音,你写出文字,它替你读出声音。工具内置三种音色:中文普通话、美式英语女声和美式英语男声。这是云端工具中唯一不需要上传文件的处理方式,输入的文字本身就是直接发送的请求,通常几秒钟就能完成合成。视频创作者用它配旁白,学生用它练发音,忙碌的读者用它把文章变成音频在路上听。
这个工具能做什么
- 📝 把输入或粘贴的文字合成为可听的 MP3 语音
- 🗣️ 三种神经网络音色可选:普通话、美式英语女声、美式英语男声
- 📏 单次最多 2 万字符,约合 20 到 30 分钟的语音
- ⚡ 近实时合成,通常几秒内完成
- 🎧 页面直接试听并下载 MP3 文件
- 🔤 实时字数统计,全程无需上传任何文件
什么时候用它
- 给视频、幻灯片或演示文稿配旁白配音
- 跟着标准发音练习英语或中文口语
- 把文章、文档转成音频,通勤路上听
- 为网课、公告或播客节目制作语音内容
- 眼睛累了的时候,让长文本自己读出来
你的文字会通过加密连接发送到 VPS 服务器,由神经网络引擎完成合成,任务文件处理完毕即删除,不做任何保留。本服务按任务消耗积分。当前限制:内置三种音色(一种普通话、两种英语),每次最多 2 万字符,输出为固定自然语速的 MP3——自定义音色、更多语言和语速调节暂不支持。