OmochiXを検索

Esc で閉じる

AIニュース

Google「Gemini 3.8 Flash TTS」正式公開。声を“読む”AIから“演じる”AIへ

GOOGLE / GEMINI AUDIO / 2026.09.23 Gemini 3.8 Flash TTS正式公開。 声を「読む」AIから「演じる」AIへ 声質、感情、速度、アクセント、方言まで自然言語で指示。 Go […]

OmochiX 公開 更新 約9分で読めます
Gemini img
GOOGLE / GEMINI AUDIO / 2026.09.23

Gemini 3.8 Flash TTS正式公開。
声を「読む」AIから「演じる」AIへ

声質、感情、速度、アクセント、方言まで自然言語で指示。 Googleの新しいGemini音声モデルが、 ポッドキャスト、オーディオブック、 音声AIエージェントの制作を大きく変えます。

Googleは新世代の音声生成モデル Gemini 3.8 Flash TTSと Gemini 3.8 Flash-Lite TTS を正式版として公開しました。 Gemini APIでは2026年9月22日にGAとなり、 Googleは翌23日に新モデルの詳細を公式ブログで発表しています。
MODEL Gemini 3.8 Flash TTS
FAST MODEL Flash-Lite TTS
VOICE LIBRARY 150+ Voices
LANGUAGES 100以上に対応

2つのGemini TTSモデルを正式提供

FLAGSHIP / CREATIVE Gemini 3.8 Flash TTS

高品質な音声表現、 細かな演技、 地域ごとの方言、 長時間のマルチターン音声などを重視した フラッグシップ音声生成モデル。

FAST / COST EFFICIENT Gemini 3.8 Flash-Lite TTS

高速かつ効率的な音声生成を重視。 大量コンテンツ制作、 読み上げ、 リアルタイム音声エージェントなど 高スループット用途向け。

GoogleはFlash TTSを 「スタジオ品質の音声表現」を重視するモデルとして、 Flash-Lite TTSを 高速・大量処理向けモデルとして位置づけています。

自然言語だけで声の“演技”を指示できる

Gemini TTSの大きな特徴は、 単純にテキストを音声化するだけではありません。

自然言語で 声のスタイル、感情、アクセント、速度、トーン などを指定できます。

EMOTION 感情 喜び、緊張、落ち着きなど 声の表情を調整。
PACE 話す速度 ゆっくり、 早口などテンポを指定。
STYLE 話し方 囁く、力強く、 フォーマルなどを指示。
DIALECT アクセント・方言 地域的な話し方も 音声表現へ反映。
ACTING 演技 台詞ごとに 表情や演出を変更。
MULTI SPEAKER 複数話者 会話形式の音声コンテンツにも対応。

笑い・ため息・咳まで音声演出に組み込める

Gemini TTSでは、 通常の文章だけでなく、 音声中の細かな出来事を 指定することもできます。

たとえば、 笑い声、ため息、咳、 呼吸、短い間など、 会話に含まれる細かな音声表現を 音声へ組み込めます。

TTSとGemini Liveは用途が違う Gemini TTSは、 指定した文章を正確に読みながら 声や演技を細かく制御する用途に向いています。 一方、Gemini Live APIは、 より自由なリアルタイム会話や マルチモーダルなやり取りを目的としています。

Voice Designで「存在しない声」を作れる

新モデルでは Voice Design にも対応しています。

用意された声を選ぶだけではなく、 自然言語で声の人物像を指定し、 オリジナルの音声キャラクターを 作成できます。

たとえば、

01 声の人物像を指定
02 AIが声を設計
03 名前付き音声として保存
04 複数コンテンツで再利用

という使い方が可能になります。

Voice Replicationにも対応

Gemini 3.8 TTSでは、 既存の声を再現する Voice Replication にも対応します。

音声複製には同意確認 GoogleはVoice Replicationについて、 音声所有者の同意確認を含む仕組みとして提供しています。 他人の声を無断で複製するための機能として 提供されているわけではありません。

150以上の音声を使えるVoice Library

Googleは新しい Extended Voice Library も提供します。

APIのVoicesエンドポイントから、 150以上のプリセット音声や ユーザーが作成したカスタム音声を 検索・利用できます。

これにより、 用途ごとに毎回声を作り直すのではなく、 ブランド用ナレーター、 キャラクター、 社内音声アシスタントなどを 継続して利用しやすくなります。

100以上の言語に対応、日本語も対象

Gemini 3.8 Flash-Lite TTSは、 入力言語を自動判定し、 100以上の言語に対応しています。

Googleの公式ドキュメントには 日本語 も対応言語として掲載されています。

多言語展開する動画、 オーディオブック、 教育コンテンツ、 グローバルな音声サービスなどでも 利用しやすい構成です。

Googleの各サービスへ広がる

Googleによると、 新しいGemini TTSは以下の環境で利用できます。

DEVELOPER Google AI Studio ブラウザから音声やスタイルを 試すことができます。
API Gemini API アプリやサービスへ 音声生成を組み込み。
BUSINESS Gemini Enterprise 企業向けAI環境でも 音声活用へ。
KNOWLEDGE Gemini Notebook 資料や情報を 音声コンテンツへ。
VIDEO Google Vids AI動画制作の ナレーション用途にも展開。

音声AIエージェントにも大きな影響

Flash-Lite TTSは、 大量の音声生成だけでなく リアルタイム音声エージェント を意識したモデルです。

AIエージェントが会話内容を考え、 TTSモデルが人間らしい声として出力することで、 電話対応、 カスタマーサポート、 ナビゲーション、 教育AIなどへ利用できます。

01 / LISTEN ユーザーの声を認識
02 / THINK AIが回答を生成
03 / ACT 必要な処理を実行
04 / SPEAK TTSで自然に返答

OmochiX視点:声はAIの「UI」になっていく

OMOCHIX VIEW

AIの進化はこれまで、 テキスト回答の精度を中心に語られてきました。

しかし音声モデルが進化すると、 ユーザーがAIを操作する方法そのものが変わります。

Voice Designによって AIごとに固有の声を持たせ、 感情や話し方まで設計できれば、 声そのものがAIサービスのUIやブランドになる 可能性があります。

特に音声エージェントでは、 「何を答えるか」だけでなく 「どう話すか」 が体験品質を大きく左右します。

AI動画、AIキャラクター、 電話対応AI、バーチャルアシスタントなど、 生成AIの次の競争領域では 音声の重要性がさらに高まりそうです。

まとめ

Googleは Gemini 3.8 Flash TTSと Gemini 3.8 Flash-Lite TTSを 正式公開しました。

新モデルでは、 感情、速度、トーン、方言などを 自然言語で制御できるほか、 Voice Design、 同意確認付きVoice Replication、 150以上の音声ライブラリにも対応します。

Flash-Liteは 大量生成や音声AIエージェントなど、 速度と効率を重視する用途にも向いています。

AI音声は単なる 「文章読み上げ」から、 キャラクターやブランドを持ち、 人間と自然に会話するインターフェース へ進み始めています。

あわせて読みたい

一次情報

PRIMARY SOURCE / GOOGLE
Gemini 3.8 text-to-speech says hello
Google公式発表・2026年9月23日
Google公式ページを見る →
GEMINI API / RELEASE NOTES
Gemini 3.8 Flash TTS and Flash-Lite TTS GA
Gemini API公式リリースノート・2026年9月22日
Gemini APIリリースノートを見る →
DEVELOPER DOCUMENTATION
Text-to-speech generation
音声生成、話者設定、スタイル制御、対応言語などの 開発者向け公式ドキュメント。
Gemini TTSドキュメントを見る →

NEXT STEP

次に知りたいAI情報へ。

自分に合うAIツールを探す 最新のAIニュースをもっと見る

OmochiXをフォロー

最新のAIニュースや活用情報をSNSでも配信しています。