Gemini TTSは、Googleが2026年9月に新モデルを出した読み上げAIで、入力した文章を自然な声に変えてくれます。動画のナレーションをAIの声で作りたいけれど、無料で使えるのか、PCに何が必要なのか分からないという方も多いはずです。
Googleは米国時間の9月23日に、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSの2つを発表しました。開発者向けのGoogle AI Studioなら、ブラウザからすぐに試せます。
この記事では、Gemini TTSでできること、無料枠の範囲と料金の目安、使い方、声の複製の注意点、必要なPCまでを順に解説します。料金などの数値は、2026年9月27日にGoogle公式の料金ページとドキュメントで確認したものです。
- Gemini TTSはAI Studioの無料枠で試せて、高性能なPCやGPUは不要
- 高品質なFlash TTSと、速くて料金が安いFlash-Lite TTSの2種類。どちらも日本語に対応
- 有料の料金は出力音声1時間あたり約0.81ドル(Flash TTS)が目安。2027年1月から2倍に
- 無料枠の入力は製品改善に使われるので、個人情報は入れない。利用は18歳以上
- 声の複製は、本人の声か使う権利のある声だけに限られる
Gemini TTSとは?文章を自然な声に変えるGoogleの読み上げAI
Gemini TTSとは、入力した文章をGoogleのAIが自然な声で読み上げ、音声ファイルにする機能です。TTSはText-to-Speechの略で、文章を音声に変える技術を指します。
音声を作る計算は、Googleのクラウド上のサーバーで行われます。そのため、仕上がりは手元のPCの性能にほとんど左右されません。
Googleは2026年9月23日(米国時間)に公式ブログで2つのモデルを発表し、同日から順次提供を始めました。日本では窓の杜が9月24日に、開発者向けの提供開始を報じています。
Gemini 3.8 Flash TTSとFlash-Lite TTSの違い
新しいGemini TTSは2種類です。声の仕上がりを重視するならGemini 3.8 Flash TTS、たくさんの音声を速く安く作るならGemini 3.8 Flash-Lite TTSが向いています。
| 比べるポイント | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| 向く用途 | スタジオ品質の声、表現豊かな演技 | 大量の音声づくり、リアルタイムの音声応答 |
| 対応言語 | 130以上(日本語を含む) | 100以上(日本語を含む) |
| 出力の料金(2026年末まで) | 100万トークンあたり$9.00 | 100万トークンあたり$6.00 |
| 開発者向けの提供先 | Gemini API・Google AI Studio | Gemini API・Google AI Studio |
| 一般向けの提供先 | Gemini Notebook | Google Vids |
公式のモデル一覧では、どちらも安定版として掲載されています。声の設計はFlash TTSの説明に挙がっている機能で、声の複製はどちらの説明にも含まれています。企業向けのGemini Enterpriseには「近日提供」とされています。
Gemini Notebookは、2026年7月にNotebookLMから名前が変わったGoogleのサービスです。Google Vidsの無料で使える範囲は、Google Vidsは無料?AI動画の回数制限・使い方で詳しく解説しています。
Gemini TTSでできること
Gemini TTSは、ただ文章を読み上げるだけではありません。公式ブログとドキュメントで紹介されている主な機能は次のとおりです。
- 声の設計:役柄やアクセント、声の特徴を文章で指定して、声を一から作る
- 声の複製(ボイスクローン):30秒の音声サンプルから、その人の声を再現する。作った声は保存して管理できる
- 2人の掛け合い:1つの台本で、2人が会話する音声を作れる
- 1行ごとの演技指示:ト書きのような指示で、セリフごとに感情や話し方を変える
- 言葉以外の音:笑い声や相づち、間を台本の中に入れられる
声の種類について、公式ブログは「2,000以上の音声」と紹介しています。一方、APIで名前を指定して選べるプリセットの声は、公式ドキュメントでは30種類です。
30種類の声を土台に、声の設計でいくらでも広げられる、と考えると分かりやすいでしょう。
使い道としては、動画のナレーション、2人で話すポッドキャスト風の音声、ブログ記事や資料の読み上げなどが考えられます。

プリセットの声には、KoreやPuck、Charonのような名前が付いています。まずは数種類を聞き比べて、台本に合う声を探してみてください。
Gemini TTSは無料で使える?料金と無料枠の範囲
Gemini TTSは、Google AI Studioの無料枠なら料金がかからずに試せます。Gemini APIの料金ページでは、2つのモデルとも無料枠の入力と出力が「Free of charge(無料)」です。
ただし、無料枠には使える量の上限があります。たくさんの音声を作るなら、有料枠の料金も確認しておきましょう。
無料枠で試すときの注意点
無料枠は手軽な反面、データの扱いが有料枠と違います。試す前に、次の3点を押さえておきましょう。
- 入力は製品改善に使われる:料金ページには、無料枠で送った内容がGoogleの製品改善に使われると書かれています。有料枠の内容は使われません
- 人が読む場合がある:利用規約では、無料のサービスは人間のレビュアーが入力と出力を読む場合があるとしています
- 利用は18歳以上:Gemini API(Google AI Studioを含む)を使えるのは18歳以上と定められています
規約は、機密情報や個人情報を送らないよう求めています。台本に個人情報や社外秘の内容を入れないことを、無料枠の基本ルールにしておくと安心です。
1日に使える回数は、公式ドキュメントに具体的な数字がありません。上限はAI Studioの画面で確認するよう案内されていて、APIキーごとではなくプロジェクト単位でかかります。
1日の上限は、太平洋時間の午前0時(日本時間では夕方)にリセットされます。上限の値は保証されたものではなく、変わることがある点も覚えておきましょう。
有料の料金と1時間あたりの目安
有料枠の料金は、AIが文章や音声を数える単位「トークン」で決まります。Gemini TTSが出力する音声は、1秒あたり25トークンとして数えます。トークンの仕組みはAIのトークンとは?料金が決まる仕組みで詳しく解説しています。
| Gemini TTSのモデルと期間 | 入力(テキスト) | 出力(音声) | バッチの出力 |
|---|---|---|---|
| Flash TTS(2026年12月31日まで) | $0.50 | $9.00 | $4.50 |
| Flash TTS(2027年1月1日から) | $1.00 | $18.00 | $9.00 |
| Flash-Lite TTS(2026年12月31日まで) | $0.50 | $6.00 | $3.00 |
| Flash-Lite TTS(2027年1月1日から) | $1.00 | $12.00 | $6.00 |
2027年1月1日からは、入力も出力も今の2倍の料金になります。長く使う予定なら、予算は2027年以降の料金で見積もるのがおすすめです。
急ぎでない処理をまとめて受け付ける「バッチ」を使うと、入力・出力とも標準の半額になります。大量の音声を一度に作るときに向いています。
公式の単価と「音声1秒=25トークン」から、音声の長さごとの料金を計算すると次のようになります。1分の音声は1,500トークンです。
| Gemini TTSのモデルと期間 | 1分 | 10分 | 60分 |
|---|---|---|---|
| Flash TTS(2026年末まで) | 約$0.0135 | 約$0.135 | 約$0.81 |
| Flash-Lite TTS(2026年末まで) | 約$0.009 | 約$0.09 | 約$0.54 |
| Flash TTS(2027年から) | 約$0.027 | 約$0.27 | 約$1.62 |
| Flash-Lite TTS(2027年から) | 約$0.018 | 約$0.18 | 約$1.08 |
台本を送る入力の料金は、これとは別にかかります。料金は変わることがあるので、最新はGoogle公式の料金ページで確認してください。
Gemini TTSの使い方|Google AI Studioで試す手順
Gemini TTSをいちばん手軽に試せるのは、Googleの開発者向けサイト「Google AI Studio」です。プログラムを書かなくても、ブラウザ上で台本を入れて音声を作れます。
AI Studioで音声を作る手順
ブラウザでGoogle AI Studio(aistudio.google.com)を開き、Googleアカウントでログインします。利用できるのは18歳以上です。
公式ドキュメントで案内されている音声生成の画面(aistudio.google.com/generate-speech)を開きます。
Gemini 3.8 Flash TTSかFlash-Lite TTSを選び、読み上げに使う声を決めます。2人の掛け合いにする場合は、話し手ごとに声を割り当てます。
台本を入力して音声を生成し、再生して確かめます。読み間違いや間の取り方が気になるところは、台本や指示を直して作り直しましょう。
画面の名前や配置は、アップデートで変わることがあります。見当たらないときは、Gemini APIの公式ドキュメントにある音声生成のページから、最新の入り口を確認してください。
自然に読ませるコツ
Gemini TTSは、読み上げる台本と話し方の指示を分けて伝えると、狙いどおりの声になりやすくなります。公式ドキュメントでは、感情や話し方、抑揚、速さ、声の大きさを、台本とは別の「スタイル」の指定でまとめて伝える方法が紹介されています。
- 台本と指示を分ける:「明るく、少しゆっくり」などの指示は、読み上げる文章とは別に書く
- ため息や間はタグで入れる:ため息などの一瞬の声や間は、台本の該当箇所に山かっこのタグで入れる
- 固有名詞と数字は聞き直す:人名や製品名、数字は読み方が意図とずれることがあるので、生成後に確認する
- 掛け合いは2人まで:プリセットの声を使う掛け合いは、1回のリクエストで最大2人まで



最初は2〜3行の短い台本で声と速さを決めてから、本番の長い台本に進むと、無料枠を無駄にしにくくなります。
Gemini TTSの音声は商用利用できる?声の複製と規約の注意点
よくある疑問:Gemini TTSで作ったナレーションを、YouTube動画や仕事に使ってもいいの?
気になるのは、作った音声をどこまで使えるかですよね。ここでは、Gemini APIの追加利用規約(2026年4月28日最終更新)で確認できることを整理します。
生成した音声の扱い
規約で確認できるのは、次の3点です。
- Googleは、生成されたコンテンツの所有権を主張しない
- ただし、ほかの人にも同じか似た内容を生成する場合がある
- 生成物は、適用される法令に従って使う必要がある
商用で使えるかどうかは、用途や投稿先のサービスの条件によっても変わります。公開や販売の前に、最新の規約を自分で確認しておきましょう。
声の複製で守ること
声の複製は、30秒の音声サンプルから同じ声を再現できる機能です。便利な分、使い方には厳しいルールがあります。
- 使える声:本人の声か、使う権利を持っている声だけ
- 同意の録音:声の持ち主が同意する音声の録音が必要で、サンプルの話者と一致しないと作れない
- 透かし:作った音声にはすべてSynthID(AIが作った音声だと後から確かめられる電子透かし)が入り、複製した声にはC2PAという来歴情報も付く
- 使えない地域:イリノイ州・テキサス州・EEA・英国・スイス・インドでは声の複製を使えない
家族や友人、有名人などの声を、本人の同意なく複製するのはやめましょう。なりすましや権利の侵害につながるおそれがあるためです。
なお、日本は使えない地域の一覧には入っていません。ただし、実際に使えるかは提供状況で変わるため、AI Studioの画面で確認してください。
Gemini TTSに必要なPCは?ローカルの音声合成との違い


Gemini TTSはクラウドで音声を作るので、高性能なPCやGPUは必要ありません。ブラウザが動いてインターネットにつながれば、一般的なノートPCでも試せます。
一方で、上のイメージ図の右側のように、音声合成を自分のPCで動かす方法もあります。どちらが合うかは、ネット接続やデータの扱い、作る量で変わります。
| 比べるポイント | Gemini TTS(クラウド) | ローカルの音声合成(自分のPC) |
|---|---|---|
| 処理する場所 | Googleのサーバー | 自分のPC |
| GPU | 不要 | ソフトによってはあると快適 |
| 料金 | 無料枠あり。有料枠は使った分だけ | ソフト代と電気代(無料のソフトもある) |
| ネット接続 | 必要 | 導入後は不要なことが多い |
| 台本の扱い | Googleに送信される | 手元のPCから出ない |
| 多言語 | 100以上の言語に対応 | ソフトによる |
Gemini TTSが向く人
- GPUのないノートPCでも、質の高い声を作りたい人
- 日本語だけでなく、英語など多言語のナレーションが必要な人
- 少ない量を、ソフトのインストールなしですぐ試したい人
自分のPCで動く音声合成が向く人
- ネットにつながない環境でも使いたい人
- 台本を外部のサービスに送りたくない人
- 大量の音声を、使った分の料金を気にせず作り続けたい人
自分のPCで動く音声合成ソフトの種類や必要なスペックは、音声合成AIは無料で使える?PCで動かす方法と必要スペックで解説しています。
作った音声を動画のナレーションに使う流れ
公式ドキュメントによると、Gemini TTSの標準の出力はWAV形式(24kHz・モノラル・16bit)です。WAVは多くの動画編集ソフトで読み込めるので、映像に重ねればナレーションになります。
つまり、PCの性能が問われるのは、音声づくりよりも動画編集の側です。無料の動画編集ソフトで仕上げるなら、AviUtl2の推奨スペックも参考にしてください。



声づくりはクラウド、編集は手元のPCと役割を分けると、今のPCのままでもナレーション付きの動画を作りやすくなります。
まとめ:Gemini TTSは無料枠で声を試してから使い方を決めよう
最後に、Gemini TTSを使い始める前に押さえておきたいポイントを振り返ります。
- 声の品質を重視するならFlash TTS、量と速さを重視するならFlash-Lite TTS
- まずAI Studioの無料枠で、短い台本から声と話し方を試す
- 長く使うなら、2027年からの料金で1時間あたりの予算を見積もる
- 商用で使う前に、最新の規約と投稿先の条件を確認する
- 台本を外に出したくない、大量に作るならローカルの音声合成も比べる
Gemini TTSは、PCの性能を気にせず高品質な声を試せるのが大きな魅力です。まずは無料枠で数行の台本を読み上げさせて、動画づくりや読み上げにどう使えるか確かめてみてください。
- Gemini TTSは無料でどこまで使えますか?
-
Google AI Studioの無料枠では、Gemini 3.8 Flash TTSとFlash-Lite TTSのどちらも料金がかかりません(2026年9月27日確認)。1日に使える回数は公式ドキュメントに数字がなく、AI Studioの画面で確認する仕組みです。
- Geminiアプリでも使えますか?
-
2026年9月27日時点で、一般向けの提供先として発表されているのは、Flash TTSがGemini Notebook、Flash-Lite TTSがGoogle Vidsです。Geminiアプリのチャットで使えるとは発表されていません。
- 日本語の読み上げに対応していますか?
-
対応しています。公式ドキュメントの対応言語表では、Flash TTSとFlash-Lite TTSのどちらにも日本語が入っています。人名や数字は、生成後に聞いて確かめると安心です。
- 作った音声をYouTube動画に使えますか?
-
Gemini APIの利用規約では、Googleは生成されたコンテンツの所有権を主張しないとしています。ただし法令に従って使う必要があるため、収益化する動画などに使う前に最新の規約を確認してください。
- GPUのないPCでも使えますか?
-
使えます。Gemini TTSはGoogleのサーバーで音声を作るため、ブラウザが動いてインターネットにつながるPCなら試せます。GPUがあると快適になるのは、音声合成ソフトを自分のPCで動かす場合です。
関連記事












