tomai
登入
☁️ 雲端 · 點數

文字轉語音

用神經網路人聲把文字變成自然的 MP3 語音——普通話 + 兩種英語音色

🪙 伺服器神經網路語音合成:每次 2 點

每次任務最多 2 萬字元——大約半小時的語音。任務完成後即可下載 MP3。

輸入或貼上要朗讀的文字——每次任務最多 2 萬字元 0 / 20000

語音引擎與實務限制

合成由神經 TTS 引擎執行,提供四種聲音設定:

長文會依句子邊界切成段落獨立合成,再無縫拼接——15 分鐘的旁白到了尾段也不會劣化。輸出為 MP3(48 kHz),與其他雲端任務相同的方式交付。標點能控制節奏:破折號帶來換氣感,刪節號會放慢語速。SSML 刻意不對外開放——純文字才能讓結果穩定可預期。

符合真實專案規模的自然語音

把文章轉成旁白,單次任務最長 20,000 字,中文與英文都有可清楚區分的男聲與女聲。

🗣️

自然流暢的神經語音

神經 TTS 模型以自然的節奏與語調朗讀你的文字——比機械式合成音更清晰自然。

🌍

中文 + 英文多種聲音

提供一個普通話聲音與兩個英文聲音,中英文內容都能輕鬆配音。

🎵

立即下載 MP3

朗讀音訊立即轉成 MP3 供你下載——配旁白、做學習音檔或無障礙使用都合適。

如何使用

  1. 1

    輸入或貼上文字——每次任務最多 2 萬字元,大約是半小時的語音。

  2. 2

    選擇音色:普通話中文、美式英語女聲或美式英語男聲。

  3. 3

    開始任務並下載 MP3。伺服器用神經網路語音模型合成——通常只要幾秒鐘。

常見問題

這是真正的神經網路語音,還是老式機械合成音?

真正的神經網路語音。音色基於 Piper 模型,用數千小時錄音室素材訓練而成——停頓、語調、重音都很自然,絕不是早期語音合成的機器人腔。

有哪些音色可選?

三種:普通話中文、美式英語女聲(Amy)、美式英語男聲(Joe)。音色表在伺服端,以後可以繼續添加。

文字長度有限制嗎?

有——每次任務最多 2 萬字元(約 30 分鐘音訊)。更長的文章可以分多次任務生成,再用音訊合併工具拼接。

產生的音訊可以商用嗎?

可以——只要你對文字內容享有權利,生成的旁白就能自由發布,包括營利影片與課程。我們的條款不要求標示語音來源。

相關工具

什麼是文字轉語音?

文字轉語音是把文字變成說話聲音的工具。貼上或輸入一段文字,伺服器上的類神經語音引擎(Piper)就會把它合成為自然的 MP3 朗讀音檔。它與語音轉文字正好相反——不需要上傳任何錄音,你寫下文字,它替你讀出聲音。工具內建三種音色:中文普通話、美式英語女聲與美式英語男聲。這是雲端工具中唯一不需要上傳檔案的方式:輸入的文字本身就作為請求送出,通常幾秒鐘就能完成合成。影片創作者用它配旁白,學生用它練發音,忙碌的讀者則把文章變成音檔在路上聽。

這個工具能做些什麼

  • 📝 把輸入或貼上的文字合成為可聆聽的 MP3 語音
  • 🗣️ 三種類神經音色可選:普通話、美式英語女聲、美式英語男聲
  • 📏 單次最多 2 萬字元,約等於 20 到 30 分鐘的語音
  • ⚡ 近即時合成,通常幾秒內完成
  • 🎧 在頁面上直接試聽並下載 MP3 檔案
  • 🔤 即時字數統計,全程不必上傳任何檔案

什麼時候會用到它

  • 為影片、簡報或投影片配上旁白配音
  • 跟著標準發音練習英文或中文口語
  • 把文章與文件轉成音檔,通勤途中收聽
  • 為線上課程、公告或 Podcast 製作語音內容
  • 眼睛累了的時候,讓長篇文字自己讀出來

你的文字會透過加密連線送到 VPS 伺服器,由類神經引擎完成合成,任務檔案處理完畢即刪除,不會留存。本服務按任務消耗點數。目前限制:內建三種音色(一種普通話、兩種英語)、每次最多 2 萬字元,輸出為固定自然語速的 MP3——自訂音色、更多語言與語速調整暫不支援。

相關工具