tomai
ログイン
☁️ クラウド · クレジット

テキスト読み上げ

ニューラル音声でテキストを自然な MP3 音声に変換——普通話と英語2種類の声

🪙 サーバーでのニューラル音声合成:1回 2 クレジット

1回あたり最大 20,000 文字——約30分の音声。完了後に MP3 をダウンロードできます。

読み上げたいテキストを入力または貼り付け — 1回あたり最大 20,000 文字 0 / 20000

音声エンジンと実用上の制限

音声合成はニューラルTTSエンジンで実行され、4つのボイスプロファイルを備えます:

長文は文の区切りでチャンクに分割して独立に合成し、ギャップなく連結するため、15分のナレーションでも後半で品質が落ちません。出力はMP3(48 kHz)で、他のクラウドジョブと同じ要領で納品されます。句読点がテンポを左右します:ダッシュは呼吸を、三点リーダーはゆったりしたリズムを作ります。SSMLはあえて公開していません — プレーンテキストの方が結果を予測しやすいからです。

実案件の規模に耐える自然な音声

記事を1ジョブ最大20,000文字のナレーションへ変換できます。中国語と英語それぞれに、男性声・女性声をご用意しています。

🗣️

自然なニューラル音声

ニューラル TTS モデルが、自然なリズムと抑揚でテキストを読み上げます。ロボット的な合成音声より、はるかに明瞭です。

🌍

中国語 + 英語の音声

普通話(中国語)の音声と英語の2種類の音声から選択可能。中国語コンテンツにも、海外向けコンテンツにも対応します。

🎵

すぐに MP3 ダウンロード

読み上げ音声は即座に MP3 に変換され、すぐにダウンロード可能。ナレーション、学習用音声、アクセシビリティにも最適です。

使い方

  1. 1

    テキストを入力または貼り付けます——1回あたり最大 20,000 文字(約30分の音声)。

  2. 2

    声を選びます:中国語(普通話)、アメリカ英語の女性、または男性。

  3. 3

    処理を開始して MP3 をダウンロードします。ニューラル音声モデルが合成します——通常数秒で完了します。

よくある質問

本物のニューラル TTS ですか、それとも旧式のロボット音声ですか?

本物のニューラル TTS です。声は数千時間のスタジオ録音で学習した Piper モデルで、間・抑揚・アクセントが自然——初期の合成音のようなロボット声ではありません。

どの声がありますか?

3種類:中国語(普通話)、アメリカ英語の女性(Amy)、アメリカ英語の男性(Joe)。声のリストはサーバー側にあり、今後追加できます。

文字数の制限はありますか?

はい——1回あたり最大 20,000 文字(約30分の音声)。長いテキストは複数の処理に分けて、音声結合ツールでつなげられます。

生成した音声を商用利用できますか?

はい — 権利を持つテキストから生成したナレーションは、収益化動画や講座を含めて自由に公開できます。当サービスの利用規約でボイスのクレジット表記を求めることはありません。

関連ツール

テキスト読み上げとは?

テキスト読み上げは、書かれた文章を音声に変えるツールです。テキストを入力または貼り付けると、サーバー上で動作するニューラル音声モデル(Piper)が自然なMP3音声を合成します。文字起こしとは逆の方向で、録音を読み取るのではなく、言葉を書けば声が返ってきます。音声は3種類を内蔵しています。中国語(普通話)、アメリカ英語の女性音声、アメリカ英語の男性音声です。アップロードするファイルが不要なのはこのツールの特徴で、入力したテキスト自体がそのままリクエストになり、合成は通常数秒で完了します。動画制作者はナレーションに、学習者は発音練習に、忙しい読者は移動中の記事リスニングに活用しています。

このツールでできること

  • 📝 入力・貼り付けしたテキストを音声のMP3音声に変換する
  • 🗣️ 3種類のニューラル音声から選択:普通話、アメリカ英語女性、アメリカ英語男性
  • 📏 1回につき最大20,000文字(約20〜30分の音声)まで対応
  • ⚡ ほぼリアルタイムで合成、通常数秒で完了
  • 🎧 ページ上でそのまま再生し、MP3ファイルをダウンロード
  • 🔤 文字数をリアルタイム表示、ファイルのアップロードは一切不要

こんなときに使う

  • 動画・プレゼン・スライドショーのナレーションや吹き替えを作る
  • はっきりした音声を聞いて英語や中国語の発音を練習する
  • 記事や文書を音声化して移動中に聴く
  • オンライン講座やお知らせ、ポッドキャストの音声を用意する
  • 目が疲れたときに長い文章を読み上げてもらう

テキストは暗号化された接続で当社のVPSサーバーに送信され、ニューラルエンジンが音声を合成します。処理完了後、タスクのファイルは削除され、何も保存されません。本サービスは1タスクごとにクレジットを消費します。現在の制限:内蔵音声は3種類(普通話1種・英語2種)、1回の上限は20,000文字、出力は一定の自然な速さのMP3のみで、カスタム音声・追加言語・速度調整にはまだ対応していません。

関連ツール