Gemini 3.8 Flash TTSとFlash-Lite TTSとは?違い・料金・使い方・日本語対応・声の複製のルールを公式情報でやさしく解説【2026年9月最新】|トレジャーフットAI

Gemini 3.8 Flash TTSとFlash-Lite TTSとは?違い・料金・使い方・日本語対応・声の複製のルールをやさしく解説【2026年9月最新】

この記事の結論(30秒で読める要約)

Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSは、Googleが2026年9月23日に発表した、文章を読み上げ音声に変える最新のAIモデル(TTS)です。Googleは「これまでで最も表現力の高い音声生成モデル」と紹介しています。Flash TTSはオーディオブックやゲームのような「演技の質」を重視する用途向け、Flash-Lite TTSは吹き替えや音声エージェントのような「大量に安く」を重視する用途向けです。文章で説明するだけで新しい声を作れる「ボイスデザイン」と、短い録音から同じ声を再現できる「ボイスレプリケーション」に両方とも対応しています。料金は2026年12月31日までの価格で、出力音声100万トークンあたりFlash TTSが9ドル、Flash-Lite TTSが6ドルです。Gemini APIには無料枠もあります。声の複製には、同じ成人の話者本人による同意の録音が必要です。

Contents

Gemini 3.8 Flash TTSとFlash-Lite TTSとは?

図1:Gemini 3.8 Flash TTSとFlash-Lite TTSの全体像
図1:Gemini 3.8 Flash TTSとFlash-Lite TTSの全体像(タップすると拡大できます)

Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSは、Googleの「Gemini 3.8」シリーズに加わった、テキスト読み上げ(Text-to-Speech、TTS)専用のAIモデルです。文章を入力すると、人が話しているような自然な音声を生成します。

Googleは2026年9月23日、公式ブログでこの2つのモデルを発表しました。GoogleはこれらをGoogleの「これまでで最も表現力の高い音声生成モデル」と位置づけています。

2つのモデルの役割は、はっきり分かれています。

モデル Googleによる位置づけ 主な用途
Gemini 3.8 Flash TTS 細かな演出やキャラクターづくりのためのモデル ゲーム、オーディオブック、ポッドキャスト、インタラクティブなメディア
Gemini 3.8 Flash-Lite TTS 大量の音声を低コストで生成するためのモデル 吹き替え、音声コンテンツの制作、表現力のある音声エージェント

どちらもGemini APIの公式ドキュメントで公開されており、Flash-Lite TTSは前モデル「Gemini 3.1 Flash TTS Preview」の後継として推奨されています。

Gemini 3.8のTTSで何ができる?主な機能

図2:Gemini 3.8 TTSの主な機能
図2:Gemini 3.8 TTSの主な機能(タップすると拡大できます)

Googleの発表とAPIドキュメントから、主な機能を整理します。

2,000以上の声から選べる

Googleは発表の中で、すぐに使える声を2,000以上用意していると紹介しています。Gemini APIのドキュメントでは、30種類の定番の声(プリビルトボイス)に加えて、数百の声を追加した「拡張ボイスライブラリ(Extended Voice Library)」から選べると説明されています。

文章で説明するだけで、新しい声を作れる(ボイスデザイン)

「30代の、はつらつとしたスポーツ実況アナウンサーの女性」のように、声の特徴を文章で説明するだけで、まったく新しい声を作れます。作った声はIDで保存し、何度でも使い回せます。

短い録音から、同じ声を再現できる(ボイスレプリケーション)

Googleの発表では、30秒の音声サンプルから一貫した声を再現できるとしています。ただし、同じ成人の話者本人による同意の録音が必要です。詳しくは後の章で説明します。

1行ずつ、演技を指示できる

セリフごとに、演技の指示、話す速さ、方言の切り替え、あいづちなどを細かく指示できます。<laugh>(笑う)や <sigh>(ため息)といった音声タグで、笑いやため息などの声も自然に入れられます。

2人の会話を1つの台本から生成できる

1つの台本から、複数ターンの会話を生成できます。APIでは、定番の声を使えば1回のリクエストで最大2人までの会話を生成できます。

何時間もの長い音声でも品質を保つ

GoogleはFlash TTSについて、何時間も続く音声でも、声の質、自然な間の取り方、キャラクターの声色を保てるとしています。また、前モデルのGemini 3.1 Flash TTSと比べて、長い音声や2人の掛け合いの台本の扱いが大きく改善したと説明しています。

生成しながら再生できる(ストリーミング)

APIでは、音声が生成されるのと同時に受け取るストリーミングに対応しています。出力は24kHz・モノラル・16ビットの音声です。

Flash TTSとFlash-Lite TTSの違いは?どっちを選べばいい?

図3:Flash TTSとFlash-Lite TTSの違い
図3:Flash TTSとFlash-Lite TTSの違い(タップすると拡大できます)

結論から言うと、「声の演技の質を最優先するならFlash TTS」「量とコストを優先するならFlash-Lite TTS」です。

比較項目 Gemini 3.8 Flash TTS Gemini 3.8 Flash-Lite TTS
モデルID gemini-3.8-flash-tts gemini-3.8-flash-lite-tts
重視していること(APIドキュメントより) 声の忠実さ、演技のニュアンス、方言の幅 処理量の多さ、低い遅延、コスト効率
対応言語数(APIドキュメントより) 130言語 101言語
出力音声の料金(100万トークンあたり、2026年12月31日まで) 9ドル 6ドル
入力トークンの上限 8,192 8,192
出力トークンの上限 16,384 16,384
ボイスデザイン 対応 対応
ボイスレプリケーション 対応 対応
2人の会話 対応 対応
Batch API(一括処理) 対応 対応
向いている用途 オーディオブック、スタジオ品質のナレーション、複雑な掛け合い、難しい発音、地方の方言 吹き替え、大量の音声コンテンツ、音声エージェント

2つのモデルは、同じAPIの形式と同じ指示の書き方で使えます。そのため、まずFlash-Lite TTSで試し、品質が足りない場面だけFlash TTSに切り替える、といった使い分けも簡単です。

なお、出力の上限は16,384トークンです。料金ページでは音声を1秒あたり25トークンとして数えるため、単純に換算すると約655秒(11分弱)になります。ただし、これは理論上の目安であり、Googleが1回のリクエストで生成できる最大の音声時間として明示した値ではありません。長い音声は複数回に分けて生成するのが安心です。

料金はいくら?無料で使える?

図4:1時間あたりの音声の出力料金の目安
図4:1時間あたりの音声の出力料金の目安(タップすると拡大できます)

Gemini APIには無料枠があり、どちらのモデルも無料枠の範囲で試せます。有料プランの料金は次のとおりです(Gemini APIの料金ページより、100万トークンあたり、2026年9月24日確認)。

項目 Flash TTS Flash-Lite TTS
入力(テキスト)2026年12月31日まで 0.50ドル 0.50ドル
入力(テキスト)2027年1月1日から 1.00ドル 1.00ドル
出力(音声)2026年12月31日まで 9.00ドル 6.00ドル
出力(音声)2027年1月1日から 18.00ドル 12.00ドル
Batch APIの出力(音声)2026年12月31日まで 4.50ドル 3.00ドル

注意したいのは、2027年1月1日から料金が2倍になる点です。2026年中に試すか、2027年以降の料金で予算を組んでおくと安心です。

1分の音声だといくら?

音声は1秒あたり25トークン、つまり1分あたり1,500トークンとして数えます。ここから出力音声の料金を計算すると、次のようになります(本記事独自の試算で、入力テキストの料金は含みません)。

モデル 1分あたり 1時間あたり
Flash TTS(2026年末まで) 約0.0135ドル 約0.81ドル
Flash TTS(2027年から) 約0.027ドル 約1.62ドル
Flash-Lite TTS(2026年末まで) 約0.009ドル 約0.54ドル
Flash-Lite TTS(2027年から) 約0.018ドル 約1.08ドル
参考:Gemini 3.1 Flash TTS(プレビュー版) 約0.03ドル 約1.80ドル

前モデルのGemini 3.1 Flash TTS(プレビュー版)は、出力音声100万トークンあたり20ドルです。2027年1月1日からの料金で比べても、Flash TTSは1割、Flash-Lite TTSは4割安くなります。

無料枠の注意点

料金ページでは、無料枠で入力した内容はGoogleの製品改善に使われる(有料枠では使われない)とされています。仕事の原稿や社外秘の情報を扱う場合は、有料枠を使いましょう。

日本語に対応している?性能は?

図5:ベンチマークの結果と、上位に入った言語
図5:ベンチマークの結果と、上位に入った言語(タップすると拡大できます)

日本語に対応しています。APIドキュメントでは、Flash TTSが130言語、Flash-Lite TTSが101言語に対応し、言語は自動で判別されるとしています。

Googleの発表によると、人が音声を聞き比べて評価する「Voice Arena」のブラインド評価で、Flash TTSとFlash-Lite TTSは日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語、メキシコのスペイン語、ヒンディー語などの主要言語で、競合の中で上位を獲得しました。

ほかにも、Googleは次のベンチマーク結果を発表しています。

  • Hume AIのVoice Design Benchmark:Flash TTSが総合スコア71.4で1位、なまりの再現(アクセントのモデリング)でも60.8で1位
  • Hume AIのOverall Quality Index:Flash TTSが1位、Flash-Lite TTSが2位

これらはGoogleが公式ブログで発表した結果です。実際の品質は、読み上げる内容や求める声によっても変わるため、自分の用途で試してみるのがいちばん確実です。

文章で声を作る「ボイスデザイン」の仕組み

図6:ボイスデザインの流れ
図6:ボイスデザインの流れ(タップすると拡大できます)

ボイスデザインは、声の年齢、声質、なまり、話し方などを文章で説明して、オリジナルの声を作る機能です。Flash TTSとFlash-Lite TTSの両方で使えます。

APIドキュメントでは、次の流れで使うと説明されています。

  • 声の説明文を添えて、声を作るリクエストを送る
  • APIが声を生成してプロジェクトに保存し、声のIDと試聴用のサンプル音声を返す
  • 以降は、声の名前の代わりにこのIDを指定して読み上げる

説明文のコツとして、APIドキュメントでは「1〜2文の明確な説明」をすすめています。たとえば「中西部のなまりが少しある、30代のはつらつとしたスポーツ実況アナウンサーの女性」のような書き方です。Googleの発表では、メルボルンの元気なDJや日本の竜といった例も紹介されています。

保存できる声は、ボイスデザインとボイスレプリケーションを合わせて1つのプロジェクトにつき200件までで、保存期間は1年です。Google AI Studioでも、画面上で声を作って試すことができます。

声を複製する「ボイスレプリケーション」と同意のルール

図7:ボイスレプリケーションの流れと、必要な同意
図7:ボイスレプリケーションの流れと、必要な同意(タップすると拡大できます)

ボイスレプリケーションは、実在する人の声の録音から、同じ声を再現する機能です。いわゆるボイスクローンにあたります。Gemini APIのドキュメントでは、Flash TTSとFlash-Lite TTSの両方が対応していると説明されています。

必要なもの

  • 声の見本となる録音:Googleの発表では「30秒の音声サンプル」から再現できるとしています。APIドキュメントでは、雑音の少ない自然な話し声の10〜30秒の録音を求めています。
  • 本人の同意の録音:声の持ち主が、決められた同意の文章を読み上げた録音です。英語の場合は「私はこの声の所有者であり、Googleがこの声を使って合成音声のモデルを作ることに同意します」という趣旨の文章です。同意の文章は30の言語・地域ごとに用意されています。

APIドキュメントでは、見本の録音と同意の録音は、どちらも同じ成人の話者本人による、実際の人の声の録音である必要があるとされています。

Googleは、同意の録音が見本の録音と同じ話者であることを確認してから、声を作るとしています。APIドキュメントでは、確認がうまくいくように、2つの録音を同じマイク・同じ環境で録ることをすすめています。

声の保存方法は2種類

方法 仕組み 有効期間
保存あり(初期設定) Googleがプロジェクト内に声を保存し、声のIDを返す。ボイスデザインと合わせて1つのプロジェクトにつき200件まで 保存期間1年
保存なし Googleは声のプロフィールを保存せず、暗号化された声のキー(voice key)を利用者側で保管する キーの有効期限7日

Google AI Studioでは使えない地域がある

Googleの発表では、Google AI Studioでのボイスレプリケーションは、アメリカのイリノイ州とテキサス州、EEA(欧州経済領域)、イギリス、スイス、インドでは利用できません。日本は、このAI Studioの提供対象外の地域には含まれていません。

演技の指示と音声タグ、2人の会話の作り方

図8:台本に演技の指示と音声タグを入れる例
図8:台本に演技の指示と音声タグを入れる例(タップすると拡大できます)

Gemini 3.8のTTSでは、演技の指示と台本中の音声タグを組み合わせて、声の演技をコントロールできます。APIでは、感情や話し方などの指示は読み上げる本文と分け、speech_metadataに指定します。

音声タグで、笑いやため息を入れる

文章の中に山かっこ(< >)で囲んだタグを入れると、その位置に笑いや息づかいなどの非言語音や間を入れられます。APIドキュメントでは <laugh>(笑う)、<sigh>(ため息)、<cough>(せき)、<breath>(息づかい)、<short pause>(短い間)などが例として挙げられています。Googleの発表では <laughs>、<sigh>、<gasp>(息をのむ)という書き方で紹介されているため、実際に使うときはAPIドキュメントの書き方に合わせましょう。

また、Googleの発表では、|mhm| や |yeah| のように縦線で囲んで、あいづちを入れられることも紹介されています。

1行ずつ、演技の指示を出す

セリフごとに、感情、話す速さ、方言などの指示を出せます。APIではこれらをspeech_metadataの指示として渡し、本文には読ませたいセリフと対応する音声タグを書きます。APIドキュメントでは、Flash TTSについて「ターンごとの演技の指示や、文中の声の演出に正確に従う」と説明しています。

2人の会話

定番の声を使う場合は、1回のリクエストで2人までの会話を生成できます。ボイスデザインやボイスレプリケーションで作った声どうしで会話させる場合は、話者ごとにセリフを1つずつ生成する必要があります。

どこで使える?提供状況

図9:Gemini 3.8 TTSが使える場所
図9:Gemini 3.8 TTSが使える場所(タップすると拡大できます)

Googleの発表による提供状況は次のとおりです。

使える場所 提供状況
Gemini API 2026年9月23日から順次提供(両モデル)
Google AI Studio 2026年9月23日から順次提供(両モデル)
Gemini Notebook Flash TTSを、すべての利用者向けに提供
Google Vids Flash-Lite TTSを、すべての利用者向けに提供
Gemini Enterprise APIで近日提供予定

開発者はGemini APIとGoogle AI Studioから、一般の利用者はGemini NotebookやGoogle VidsといったGoogleの製品を通じて、新しい声に触れることになります。

Googleの発表では、これらのモデルを取り入れている企業としてFigma、HeyGen、Linguana、Wondercraft、99.co、Ollangが、開発者向けのプラットフォームとしてAgora、LiveKit、Pipecat、Vercelが挙げられています。

Gemini 3.8のTTSを使い始める手順

図10:使い始めるまでの4ステップ
図10:使い始めるまでの4ステップ(タップすると拡大できます)

まずはGoogle AI Studioで試す

プログラミングをしない人は、Google AI Studioで試すのがいちばん簡単です。Googleアカウントでログインし、音声生成のモデルとしてGemini 3.8 Flash TTSまたはFlash-Lite TTSを選び、読み上げたい文章と声を指定するだけで音声を作れます。ボイスデザインも、AI Studioの画面上で試せます。

Gemini APIで組み込む

自社のサービスに組み込む場合は、次の流れになります。

  • Google AI StudioでAPIキーを取得する
  • モデルID(gemini-3.8-flash-tts または gemini-3.8-flash-lite-tts)を指定する
  • 読み上げる文章と、声(定番の声の名前、または作った声のID)を指定してリクエストを送る
  • 返ってきた音声(WAV形式、またはストリーミングの場合は24kHz・モノラル・16ビットの音声データ)を保存・再生する

APIの書き方は更新されることがあるため、実際のコードは公式ドキュメント「Text-to-speech generation」を確認してください。

安全対策と、使う前に知っておきたい注意点

図11:Gemini 3.8 TTSの安全対策
図11:Gemini 3.8 TTSの安全対策(タップすると拡大できます)

Googleの安全対策

  • 電子透かし(SynthID):Googleの発表では、Geminiの音声モデルが生成したすべての音声に、AIが作ったことを示す電子透かし「SynthID」が埋め込まれます。
  • 本人の同意の確認:声を複製するには、声の持ち主本人の同意の録音が必要で、見本の声と同じ人かどうかが確認されます。
  • コンテンツ認証情報(C2PA):声の複製には、コンテンツの来歴を示すC2PAの認証情報も付けられます。
  • 地域の制限:Google AI Studioでの声の複製は、一部の国や地域では利用できません。

使う側が気をつけたいこと

  • 他人の声を、本人の同意なく複製しない
  • 無料枠では入力内容が製品の改善に使われるため、機密の原稿は有料枠で扱う
  • 2027年1月1日から料金が2倍になることを、予算に織り込んでおく
  • AIが生成した音声であることを、必要に応じて視聴者に伝える

どんな使い方ができる?活用例

図12:用途別のおすすめモデル
図12:用途別のおすすめモデル(タップすると拡大できます)

Googleの発表やAPIドキュメントで挙げられている用途をもとに、活用例をまとめます。

用途 おすすめのモデル 理由
オーディオブック、朗読 Flash TTS 長い音声でも声の質と間を保ち、演技の表現が豊か
ゲームのキャラクターの声 Flash TTS ボイスデザインでキャラクターの声を作り、細かく演技を指示できる
ポッドキャスト、2人の対談番組 Flash TTS 1つの台本から2人の掛け合いを生成できる
動画の吹き替え、多言語化 Flash-Lite TTS 100以上の言語に対応し、大量の音声を低コストで作れる
電話やアプリの音声エージェント Flash-Lite TTS 遅延が小さく、コスト効率がよい
社内研修の動画、マニュアルの読み上げ Flash-Lite TTS 大量の音声を安く、安定した品質で作れる

よくある質問(FAQ)

Q1. Gemini 3.8 Flash TTSとは何ですか?

Googleが2026年9月23日に発表した、文章を読み上げ音声に変えるAIモデルです。細かな演出やキャラクターづくりに向いており、オーディオブックやゲーム、ポッドキャストなどでの利用が想定されています。モデルIDは gemini-3.8-flash-tts です。

Q2. Flash TTSとFlash-Lite TTSの違いは何ですか?

Flash TTSは声の忠実さや演技のニュアンスを重視したモデルで、130言語に対応しています。Flash-Lite TTSは処理量、低い遅延、コスト効率を重視したモデルで、101言語に対応しています。出力音声の料金は、Flash TTSが100万トークンあたり9ドル、Flash-Lite TTSが6ドルです(2026年12月31日まで)。

Q3. Gemini 3.8のTTSは無料で使えますか?

Gemini APIの無料枠で試せます。ただし、無料枠で入力した内容はGoogleの製品改善に使われます。有料枠の料金は、2026年12月31日まではFlash TTSが入力0.50ドル・出力9ドル、Flash-Lite TTSが入力0.50ドル・出力6ドルです(いずれも100万トークンあたり)。

Q4. 2027年から料金は変わりますか?

変わります。料金ページでは、2027年1月1日から入力が1.00ドル、出力がFlash TTSで18ドル、Flash-Lite TTSで12ドルと、それぞれ2倍になるとされています(100万トークンあたり)。

Q5. 日本語は使えますか?

使えます。Googleの発表によると、人が音声を聞き比べて評価する「Voice Arena」で、日本語を含む主要言語で上位を獲得しています。言語は自動で判別されます。

Q6. 自分の声や他人の声を複製できますか?

ボイスレプリケーション機能で、短い録音から声を再現できます。ただし、見本の録音と、決められた同意の文章を読み上げた録音の両方が、同じ成人の話者本人の声である必要があり、同じ人かどうかが確認されます。なお、Google AI Studioでの声の複製は、アメリカのイリノイ州とテキサス州、EEA、イギリス、スイス、インドでは利用できません。

Q7. 何人の会話を作れますか?

定番の声を使う場合、1回のリクエストで最大2人までの会話を生成できます。自分で作った声どうしの会話は、話者ごとにセリフを1つずつ生成します。

Q8. 一度にどれくらいの長さの音声を作れますか?

1回あたりの最大の音声時間は、Googleは明示していません。出力の上限は16,384トークンで、音声は1秒あたり25トークンとして数えるため、単純に換算すると約655秒(11分弱)ですが、これは理論上の目安です。長い音声は分けて生成しましょう。GoogleはFlash TTSについて、何時間もの音声でも声の質を保てるとしています。

Q9. AIが作った音声だとわかる仕組みはありますか?

あります。Googleの発表では、Geminiの音声モデルが生成したすべての音声に、電子透かし「SynthID」が埋め込まれます。声の複製には、C2PAのコンテンツ認証情報も付けられます。

Q10. 前のGemini 3.1 Flash TTSとは何が違いますか?

Gemini APIドキュメントの対応表では、ボイスデザインとボイスレプリケーションは3.8のモデルで使える機能とされています(3.1 Flash TTSは非対応)。Googleは、長い音声や2人の掛け合いの台本の扱いも大きく改善したとしています。出力音声の料金も、3.1 Flash TTSの100万トークンあたり20ドルから、Flash TTSで9ドル、Flash-Lite TTSで6ドルに下がっています(2026年12月31日まで)。Flash-Lite TTSは、3.1 Flash TTSの後継として推奨されています。

まとめ

  • Gemini 3.8 Flash TTSとFlash-Lite TTSは、Googleが2026年9月23日に発表した最新の音声生成モデル
  • Flash TTSは演技の質を重視(130言語)、Flash-Lite TTSは量とコストを重視(101言語)
  • 文章で声を作る「ボイスデザイン」と、録音から声を再現する「ボイスレプリケーション」に両方とも対応
  • 出力音声の料金は100万トークンあたりFlash TTSが9ドル、Flash-Lite TTSが6ドルで、2027年1月1日から2倍に
  • 日本語に対応し、Voice Arenaの日本語を含む主要言語で上位
  • 声の複製には同じ成人の話者本人による同意の録音が必要で、AI Studioでは一部の地域で使えない
  • すべての生成音声に電子透かし「SynthID」が入る

表現力の高い声を、誰でも手軽に、しかも低コストで作れる時代になりました。まずはGoogle AI Studioで、自分の文章を読み上げさせてみるところから始めてみてください。

出典

本記事は、以下のGoogleの公式情報に基づいています(2026年9月24日確認)。モデルの仕様、料金、提供状況は変更される可能性があるため、最新の情報は公式サイトで確認してください。

活動の日々

BLOG

PAGE TOP