Irodori-TTS-v4-Largeは、Aratakoが公開した日本語の音声合成モデルです。文章を読み上げるだけでなく、声の雰囲気を文章で指定したり、許可を得た参照音声から話者の特徴を引き継いだりできます。
注目点は、約32.9億パラメーターへの大型化と、声の指定への追従性です。一方、読み間違いの評価ではSmallが優位な項目もあります。この記事では公式資料から、特徴・性能・量子化版・必要なPC・導入時の注意を整理します。
- Irodori-TTS-v4-Largeは日本語向けの音声合成モデル
- 文章・参照音声・声の説明を組み合わせて声を作れる
- 大型化で声の設計を強化。ただし読み精度は別に比較
- 量子化版は公開済み。ファイル容量と必要VRAMは別
- コードはMIT、LargeのモデルはGemma条件も確認
Irodori-TTS-v4-Largeとは?日本語の声を作るAI
会話AIではなく、文章を音声へ変換するモデル
TTSはText-to-Speechの略で、文章から音声を作る技術です。Irodori-TTS-v4-Largeは日本語入力向けで、48kHzの波形へ復元する仕組みを使います。質問への回答を考えるチャットモデルとは役割が異なります。
たとえば解説動画のナレーション、アプリの案内、許可を得た声を使う読み上げなどが候補です。記事を要約する処理と、その文章を読む処理は別なので、文章の正しさは音声化する前に確認しましょう。
大きいモデルだから、すべての読み上げでSmallより良いとは限らない点が重要です。声の表現、読みの正確さ、処理時間、手元のPCでの動作を、それぞれ評価する必要があります。
出典:Irodori-TTS-v4-Large公式モデルカード(2026年9月30日確認)。
声の作り方は3つの入力で考える
| 入力 | 役割 | 使い方の例 |
|---|---|---|
| 読み上げる文章 | 何を話すかを指定 | 日本語の短い説明文 |
| 参照音声 | 話者の声の特徴を指定 | 自分の声や、使用許可を得た録音 |
| 声の説明文 | 雰囲気・感情・話し方を指定 | 落ち着いた声で、ゆっくり明瞭に話す |
参照音声なしでも、声の説明からVoice Designを試せます。参照音声と説明を組み合わせる場合は、誰の声かと、どう話してほしいかを分けて指定します。実在の人に似せる目的なら、録音が手元にあるだけでは十分な許可になりません。
絵文字による話し方や非言語音の制御にも対応します。ただし、任意の絵文字が必ず意図どおりの効果音になるわけではありません。配布元の注釈一覧を確認し、短い文章で出力を聞いてから本番へ使うと判断しやすくなります。
出典:対応する絵文字と音声表現の一覧(2026年9月30日確認)。
Irodori-TTS-v4-Largeで変わった構成
約7.66億から約32.9億パラメーターへ
| 比較項目 | v4-Small系 | v4-Large |
|---|---|---|
| 規模 | 約7.66億パラメーター | 約32.9億パラメーター |
| 文章・説明のエンコーダー | ModernBERT-ja系 | T5Gemma 2の微調整済みエンコーダー |
| 声の指定 | 文章・参照音声・説明 | 同じ3種類を統合し、構成を大型化 |
| 参照音声の合計上限 | 最大120秒 | 最大120秒 |
| 主な注目点 | 比較的軽量な系列 | 声の説明への追従性と話者類似度 |
エンコーダーは、文章や声の説明を内部表現へ変換する部分です。LargeはT5Gemma 2由来の文章・説明エンコーダーを共有し、音声を作るDiffusion Transformerも24層・2,048次元へ大型化しています。
発話の長さを予測する部分は、主要なモデルを学習した後に、他のパラメーターを固定して別途学習しています。これはv4.1-Smallで採られた手法に沿う更新ですが、「Large」という名前だけで処理速度まで優位とは言えません。
出典:Largeの構成とv4系からの変更点(2026年9月30日確認)。
性能比較:声の設計と読み精度を分ける
声の説明への追従は、公式の内部評価で改善
| Voice Designの内部評価 | v4-Small | v4-Large |
|---|---|---|
| 説明への一致度の平均/5点 | 4.2339 | 4.2991 |
| 低い評価の1~2点 | 16.78% | 14.63% |
| 高い評価の4~5点 | 74.12% | 76.24% |
配布元は、Coco-Nutの公開された声の説明を使い、モデルごとに8,670クリップを生成して比較しています。判定はGemini 3.6 Flashによる自動評価で、人間が聞いた好みや自然さの点数ではありません。
平均値の差は0.0652点です。指定した声の特徴への追従が改善したという範囲で読むべきで、すべての文章で聞きやすくなった、あるいは人間の声と区別できない、という証明ではありません。
出典:LargeのVoice Design比較結果(2026年9月30日確認)。
出典:声の説明への一致度を測る評価方法と限界(2026年9月30日確認)。
読み間違いの評価ではv4.1-Smallが優位
| 同じ評価版での読み比較 | v4.1-Small | v4-Large |
|---|---|---|
| 常用漢字読みの正解率 | 93.42% | 92.80% |
| JSUT BASIC5000のSentence Kana-CER | 3.43% | 3.67% |
上は配布元の5シード評価の平均です。CERは文字の誤り率で、低い方が良い指標です。Largeは声の指定を強化する一方、これらの読みの指標ではv4.1-Smallよりわずかに悪い結果になっています。
常用漢字の比較はParakeet Editionという評価版です。古いSmallモデルカードの元の評価版と、そのまま数字を並べてはいけません。評価版、文章、参照条件、生成ステップをそろえた比較かを確認してください。
この記事の数字は配布元の評価で、PCコンパスの実測ではありません。人名、地名、型番、英字の略称を使うナレーションでは、数字よりも自分の原稿を聞き、読み違いを直す工程が重要です。
出典:常用漢字・JSUTの評価条件と結果(2026年9月30日確認)。
声のクローンは、参照音声の長さと質が重要
Irodori-TTS-v4-Largeの参照音声は合計最大120秒です。配布元は、同じ話者の短い録音を複数使い、可能なら比較的きれいな音声を約30秒以上用意する方法を勧めています。
話者の類似度の評価では、短い1クリップより約30秒の条件で大きく改善しました。ただし、同じ話者の複数の短い発話を組み合わせた評価です。連続した長い1本の録音は入力できますが、同じ改善幅は検証されていません。
類似度の指標は、聞いた人全員が同一人物だと思う割合ではありません。話者認識の特徴量を使う比較と、人間が感じる自然さ・本人らしさ・聞きやすさを分けて扱いましょう。
出典:参照音声の組み合わせと話者類似度の評価方法(2026年9月30日確認)。
PCコンパス最初は同じ短い原稿で、参照なし・許可を得た参照音声あり・声の説明ありを聞き比べると、何を追加すると変わるか分かりやすくなります。
量子化版と、必要なGPU・VRAMの考え方
量子化版は公開済み。容量は必要VRAMではない
9月30日時点で、Irodori-TTS-v4-Large-Quantizedのファイルが公開されています。基本モデルの説明に「予定」という表記が残っていても、量子化版の現在のモデルカードとファイル一覧を別に確認するのが確実です。
| 公開されている主な量子化版 | 重みファイル容量 | 公式のGPU条件 |
|---|---|---|
| INT8 weight-only | 3,662MiB | NVIDIA CUDA |
| INT4 weight-only | 2,818MiB | Ampere以降、計算能力8.0以上 |
| FP8 weight-only | 3,665MiB | Ada・Hopper・Blackwell、計算能力8.9以上 |
量子化は、モデルの重みを少ないビット数で保存して容量を減らす方法です。すべての層が同じ精度になるわけではなく、Largeの一部の層などはBF16のまま残ります。最小ファイルが、あらゆるGPUで最速とは限りません。
2,818MiBのファイルだから、3GBのVRAMで動くとは判断できません。 実行時には音声コーデック、中間データ、参照音声、生成する長さなどのメモリも必要です。ダウンロード容量と実行時の必要量は別です。
出典:量子化版の容量・精度・GPU条件(2026年9月30日確認)。
公式の最小VRAMを推測で作らない
基本モデルのmodel.safetensorsは約13.2GBです。ただし、これも保存ファイルの容量です。今回確認した配布資料は、どの設定でも動く最小VRAMや、各GPUの生成速度を保証していません。
購入を考える場合は、まず量子化方式、GPUの対応世代、生成する音声の長さを決め、既存PCや利用可能な環境で試してください。「8GBなら必ず動く」「24GBが絶対必要」といった断定は、実測条件なしではできません。
出典:基本モデルの重みファイル(2026年9月30日確認)。
Windows・AMD・Intel・Macで同じように使える?
開発リポジトリは、Linux・WindowsのCUDA、Linux・WSLのROCm、Linux・WindowsのIntel XPU、CPUやMac向けの導入先を案内しています。ただし、これらの入口があることと、Largeの全量子化版が動作確認済みであることは別です。
Large量子化版の実行検証はNVIDIA CUDAです。CPU・ROCm・Intel XPUは利用できる演算処理に依存し、このリリースでは未検証とされています。NPUを搭載するAI PCだから、そのNPUでこのモデルを実行できるとも限りません。
メインメモリとSSDには、環境の依存ファイル、モデル、音声コーデック、生成したWAVの余裕も必要です。公式の必要容量が一律にないため、購入前に利用する構成と保存先の空きを確認しましょう。
出典:実行環境の導入先(2026年9月30日確認)。
出典:Large量子化版の検証範囲(2026年9月30日確認)。
Irodori-TTS-v4-Largeの導入と、最初の確認
まずデモを確認してから、手元で試す
開発者によるLargeのデモページが公開されています。待ち時間や稼働状態は変わるため、ページを開いて実際の表示を確認してください。外部サービスの試用には、機密の原稿や無断で取得した録音を送らないようにしましょう。
出典:開発者のIrodori-TTS-v4-Largeデモ(2026年9月30日確認)。
Gitとuv、Python 3.10以上、使うGPUの対応を確認します。コードとモデルの条件を分け、保存先の空き容量を確認してから導入します。
NVIDIA環境の公式例はuv sync –extra cu128です。CPU・ROCm・XPUの導入先を同時に混ぜず、使う環境に対応したものを1つ選びます。
基本版はAratako/Irodori-TTS-v4-Largeです。INT8版を使うならAratako/Irodori-TTS-v4-Large-Quantized/int8-weight-onlyを指定し、model-precisionをbf16にします。
最初はno-refを使い、自分で用意した短い日本語の文章を生成します。モデルが自動取得される場合の容量と通信に注意し、出力音声を聞いてから参照音声や声の説明を加えます。
推論は公式のinfer.pyを使い、同期済み環境ではuv run –no-syncから実行する案内です。モデルIDを省略したWeb UIの初期値はSmallなので、Largeを使っているか出力ログと設定を確認してください。
この記事ではモデルを手元へ導入して速度や音質を実測していません。導入例は配布元の手順に基づく案内です。環境によって依存関係が変わるため、導入時の最新版READMEとエラー表示を確認してください。
出典:導入・推論・Voice Designの公式手順(2026年9月30日確認)。
出典:Pythonと依存関係の指定(2026年9月30日確認)。
動画へ使う前に確認したい5項目
- 読み:固有名詞・数字・英字の略称が正しいか
- 話し方:説明どおりの速さ・感情・声量になっているか
- 音:欠けた発話、異常なノイズ、意図しない音がないか
- 再現性:同じ条件で複数回生成して差を確認したか
- 利用条件:録音の同意と、公開先で必要な表示を確認したか
説明文は最初から細かく詰め込まず、「落ち着いて、ゆっくり、明瞭に」のように少数の特徴から試すと比較できます。原稿は短い単位で音声化し、継ぎ目や抑揚を聞いてから長いナレーションへ広げる方法が実用的です。



生成に成功したことと、公開できる音声になったことは別です。原稿と音声を見比べ、聞き直して直す時間も制作工程へ入れておきましょう。
ライセンス・声の同意・透かしの注意
コードのMITと、Largeモデルの条件は異なる
リポジトリのコードはMITですが、LargeのモデルはGemma条件の対象です。T5Gemma 2由来のエンコーダーを使うため、Gemma利用規約と禁止用途、配布元の追加の倫理上の条件も確認する必要があります。
「コードがMITだから、モデルも自由に再配布できる」とは判断しないでください。商用利用、配布、公開サービスへ組み込む場合は、実際に使うモデル・派生物の条件と、自分の用途を照らして確認します。
出典:Largeに同梱されたGemma利用規約(2026年9月30日確認)。
出典:Largeに同梱された禁止用途(2026年9月30日確認)。
録音が公開されていても、声の複製の許可とは別
量子化版のモデルカードは、本人の明示的な同意なしに声を複製したり、人物になりすましたりする利用を禁止しています。誤解を誘う合成音声や偽情報にも使わないでください。公開された動画から録音できることと、複製への同意は別です。
参照なしで作った声が偶然実在の人へ似る可能性も、配布元は注意点として挙げています。特定の人物の公式音声と誤解される表現を避け、必要に応じて合成音声であることを説明しましょう。
出典:声の同意と追加の倫理上の制限(2026年9月30日確認)。
透かしは、権利確認の代わりにはならない
Irodori-TTSはSilentCipherによる音声透かしを統合しています。リポジトリでは、必要な依存関係とモデルが利用できるときに自動適用する案内です。出力に必ず透かしが入り、誰でも検出できると断定はできません。
透かしがあっても、音声の利用同意や、原稿の権利、公開先の規則を満たす必要があります。安全に使うには、同意の記録、生成条件、元原稿、最終的に公開した音声をまとめて残しておくと管理しやすくなります。
出典:透かし処理の適用条件(2026年9月30日確認)。
あわせて読む:NPUとAI PCの役割を整理する
あわせて読む:用途に合わせたPCの選び方
よくある質問
- Irodori-TTS-v4-Largeは日本語以外も読めますか?
-
配布元は日本語入力向けと案内しています。多言語対応モデルとして扱わず、英字や略称を含む原稿も実際の音声を確認してください。
- LargeはSmallより読み間違いが少ないですか?
-
一律には言えません。公式の同じ評価版では、v4.1-Smallの読みの指標がわずかに良い結果です。声の設計と読み精度は別々に比較してください。
- 量子化版のファイル容量が必要VRAMですか?
-
違います。実行時にはコーデックや中間データなども必要です。生成時間や参照音声の条件が変わるため、ファイル容量だけで購入を決めないでください。
- 参照音声がなくても使えますか?
-
参照なしの生成と、声の説明によるVoice Designに対応します。本人の同意なく特定人物を複製する用途は避け、生成した音声を確認して使ってください。
まとめ:声の表現と、手元の環境から選ぶ
- Irodori-TTS-v4-Largeは声の設計を強化した日本語TTS
- 読みの正確さはSmallと同じ原稿で比較する
- 量子化方式とGPUの対応を確認。最小VRAMは断定しない
- モデルの条件、声の同意、最終音声の確認を優先
まず短い日本語の原稿で、読み、声、制作時間を確認しましょう。声の表現に価値を感じるか、今のPCで扱えるかを分けて判断すると、Irodori-TTS-v4-Largeを自分の制作へ取り入れやすくなります。









