ChatGPTで音声ファイルを文字起こしできるようになりました。録音した音声ファイルを添付すると、文字起こしのほか、要約や内容への質問もできます。
OpenAIの公式リリースノートは2026年10月6日の項目です。この記事では10月10日に確認した公式ヘルプをもとに、対象プラン・対応形式・容量・手順・注意点を整理します。
PCコンパス編集部では実際に試していないため、公式情報と報道で確認できた内容だけを書きます。
- ChatGPTで音声ファイルを文字起こしできる。有料プランとワークスペース向けで、無料版は対象外
- 対応形式は9種類で、容量は1つあたり512MBまで。再生時間の上限は公式に記載なし
- 映像付きのMP4・WebM(動画扱い)は対象外。音声だけにしてから添付する
- 文字起こしには誤りがあり得る。固有名詞・数字・日付は元の録音で確認する
- 記録モードやPCで動かすWhisperとは役割が違うので、場面で使い分ける
ChatGPTで音声ファイルを文字起こしできる?有料プランが対象で無料版は対象外

イメージ図
ChatGPTで音声ファイルを文字起こしするには、有料のサブスクリプションかワークスペースが必要です。OpenAIの公式ヘルプには、無料プランでは現時点で利用できないと書かれています(2026年10月10日確認)。
ChatGPTの音声ファイル対応でできること
公式リリースノートによると、ChatGPTに音声ファイルを渡してできることは次の3つです。
- 文字起こし:録音の内容を文章にする
- 要約:会議・インタビュー・講義の録音から、決定事項・未決事項・次のステップなどを整理する
- 質問:締め切りについて何と言っていたか、のように内容を尋ねる
対象プランと無料版の扱い
対象プランを、公式ヘルプとChatGPTの料金ページで確認できた範囲でまとめました。
| プラン | 音声ファイルのアップロード(10月10日時点) |
|---|---|
| 無料版 | 対象外(現時点で利用できない) |
| Enterpriseを含む有料プラン | 対象 |
| ワークスペース(会社やチームで契約する環境) | 対象 |
| Go | 公式に個別の記載なし(未確認) |
ワークスペースの設定、地域、アプリのバージョンなどで、利用できるかが変わる場合があると公式リリースノートは述べています。Go・Plus・Proといった個別のプラン名の列挙はありません。
よくある疑問:Goプランでも、ChatGPTで音声ファイルを文字起こしできますか?
公式に個別の記載はなく、料金ページの機能比較表にも音声ファイル専用の行がないため、判断できません。自分のアカウントで添付できるかを確かめるのが確実です。
いつ始まった?公式の日付と報道日の整理
日付は3つに分けて整理します。公式リリースノートの項目は2026年10月6日、国内の報道はギズモード・ジャパンが10月8日、Impress WatchとITmedia NEWSが10月9日、この記事の確認日は10月10日です。
公式は全員に同じ日から反映されるとは述べていません。自分のアカウントで利用できるかは、実際に音声ファイルを添付できるかで確かめましょう。
ChatGPTで音声ファイルを文字起こしできる対応形式と上限|512MBは約何分?

イメージ図
対応する9つの形式
ChatGPTに添付できる音声ファイルの対応形式は、公式ヘルプによると次の9種類です。
WAV/MP3(MPEG)/OGG(OGA)/WebM(音声のみ)/PCM/FLAC/AAC/M4A/MP4(音声のみ)
名前の末尾の「.mp3」「.m4a」のような部分は拡張子(=形式を示す文字)で、対応形式かを見分ける目安になります。
動画扱いのMP4・WebMは使えない
映像が入ったMP4・WebMは、動画と判定されるため対象外です。音声のみのMP4・WebMなら添付できます。どの形式でも、音声として読み取れるデータが入っていることが条件です。
たとえばZoomの公式ヘルプでは、保存される形式にMP4(映像と音声)とM4A(音声のみ。既定名はaudio+数字.m4a)があると説明されています。M4Aがあれば、そちらを添付しましょう。
512MBの目安と長い録音の扱い
容量の上限は、音声ファイル1つあたり最大512MBです。これは容量の上限で、再生時間の上限ではありません。再生時間の上限は、公式ヘルプに記載がありません(10月10日時点)。
512MBが何分に当たるかは、編集部の仮定計算です。1MBを100万バイトとして概算した数字で、公式の数字でも実測でもありません。
| 形式の例(仮定) | 1秒あたりの容量 | 512MBに収まる長さの目安 |
|---|---|---|
| MP3(128kbps) | 約16KB | 約9時間(約32,000秒) |
| WAV(44.1kHz・16bit・ステレオ) | 約176KB | 約48分(約2,903秒) |
ビットレート(=音の細かさを表す数字)が大きいほど容量が増えます。形式や設定で大きく変わるため、あくまで目安として見てください。
長い録音は、Data Analysis(データ分析)が利用できる場合に小さな区間へ分けて処理されることがあります。処理は最善を尽くす方式(ベストエフォート)で、非常に長い録音は、時間内に終わらず失敗(タイムアウト)することがあります。
ChatGPTで音声ファイルを文字起こしする手順|添付から確認まで
録音の形式が9種類のどれかを確認し、容量が512MB以内かを見ます。映像が入ったMP4・WebMは、音声のみのものに替えておきます。
入力欄の「+」から「写真やファイルを追加」を選び、音声ファイルを指定します。この操作名はギズモード・ジャパンの報道に基づくもので、表記はアプリの更新で変わる場合があります。
「文字起こしして」「決定事項を要約して」のように、やりたいことを1文で書いて送信します。
文字起こしの結果を読み、気になる点は同じ会話の中で追加の質問をします。
固有名詞・数字・日付は、元の録音を聞いて確かめます。公式も、重要な点は元の録音と照合するよう案内しています。

初めてなら、数分の短い録音で試すのがおすすめです。
そのまま使える指示文の例
次の3つは編集部が考えた例文です。公式の文言ではないので、録音に合わせて書き直してください。
- 文字起こしだけ:添付した音声ファイルを、話した順に文字起こししてください。
- 要約:決定事項・未決事項・次にやることに分けて、箇条書きで要約してください。
- メール下書き:この会議の内容をもとに、参加者へのフォローアップメールの下書きを書いてください。
読み込めないときの確認
音声アップロードがうまくいかないときは、上から順に確認します。
- 対応する9種類の形式か。音声として読み取れるデータが入っているか
- 動画と判定されるMP4・WebMではないか(音声のみに替える)
- 容量が512MBを超えていないか
- 無料版ではないか(現時点で対象外)
- アプリやブラウザが最新か(クライアントのバージョンで異なる場合がある)
アプリとWeb版の違いが気になる方は、ChatGPTのデスクトップアプリとWeb版の違いの記事も参考にしてください。
ChatGPTの音声ファイル文字起こしの精度と注意点|原音と照合する


イメージ図
誤りが出やすい箇所と話者識別
公式ヘルプは、文字起こしに誤りが含まれる場合があると説明しています。話者識別、つまり誰が話したかの見分けも、信頼できない場合があります。
人名・会社名・数字・日付は、必ず元の録音で確認しましょう。言語によって性能が異なる場合がある点も、公式が注意しています。
ギズモード・ジャパンの記者は、ある本の一節を読み上げて試し、誤りは1か所だけだったと書いています。これは記者1人の体験談で、どんな録音でも同じ精度になる保証ではありません。
録音の同意と機密情報
他人の声が入った録音は、相手の同意を得たうえで扱い、文字起こしの結果も無断で共有しないようにしましょう。
会社の会議や顧客との通話には、機密情報が含まれることがあります。AIサービスに送ってよいかは、社内ルールで確認してください。個人情報の扱いの基本はAIチャットと個人情報の安全対策で解説しています。



社外に出せない会議の録音は、送ってよいかを確認してからにしましょう。
公式に書かれていないこと(10月10日時点)
次の点は、公式ヘルプや料金ページで見つかりませんでした。確認できたことと分けて整理します。
- Goプランが音声アップロードの対象かどうか(公式は「有料プラン」とだけ記載)
- 音声の再生時間の上限。ドキュメント向けの回数・容量の上限が音声に当てはまるかも不明
- 音声の保存期間・削除方法・モデル改善への利用(該当の説明はドキュメントと画像が対象)
- Web版やWindowsアプリでの対応状況(環境別の記載なし。ギズモード・ジャパンの記事はiPhoneとMacのアプリに言及)
ChatGPTの音声ファイルと記録モード・Whisperの違い|どれを選ぶ?


イメージ図
記録モードとの違い
編集部の整理では、記録モードは会議などをその場で録音する機能、音声ファイルのアップロードは録音済みの音声ファイルを渡す機能です。役割が違います。
料金ページの機能比較表では、記録モードは無料版とGoが「いいえ」、PlusとProが「はい」です(2026年10月10日確認)。音声ファイルのアップロードとは対象プランの示し方が違い、同じ条件とは限りません。
PCで動かすWhisperとの違い
Whisperは、OpenAIが公開している汎用の音声認識モデルで、自分のPCでも動かせます。ChatGPTの音声ファイルは、アプリやブラウザから送って処理するため、手元のGPUは使いません(編集部の整理)。
Whisperは、モデルが大きいほどVRAM(=GPUの専用メモリ)が必要です。詳しい動かし方は文字起こしAI「Whisper」に必要なPCスペックの記事で解説しています。
状況別の選び方
| 方式 | こんなとき | 条件・手間・データの置き場所 |
|---|---|---|
| ChatGPTの音声ファイル | 録音済みの音声を手早く文字にして要約したい | 有料プランとワークスペースが対象。ChatGPTに送って処理する |
| 記録モード | 会議をその場で記録したい | Plus・Proが「はい」、無料版・Goが「いいえ」(料金ページ) |
| PCで動かすWhisper | 音声を社外に出したくない。大量に処理したい | モデルにより約1〜10GBのVRAMが必要。導入の手間は自分で負う |
まず録音済みの短い音声をChatGPTで試し、社外に出せない録音だけPCのWhisperに回す分け方が分かりやすいです。
文字起こし専用のクラウドサービスもありますが、料金や対応は各社で違うため、この記事では比較していません。
まとめ:ChatGPTで音声ファイルを文字起こしする前に確認したいこと
- 録音済みの音声を手早く文字にしたいときは、ChatGPTの音声ファイル対応が向いている
- その場で記録したいなら記録モード、社外に出せない録音ならPCのWhisperを検討する
- Go・再生時間・保存と学習・Web版は公式に記載なし。10月10日時点の確認として読む
- 議事録やメールに使う前に、必ず元の録音と照合する
まずは短い録音を1つ添付して、自分のアカウントで音声ファイルを文字起こしできるかを確かめましょう。声で会話する機能はChatGPTの音声会話(Voice)の使い方で解説しています。
更新履歴:2026年10月10日 公開(公式情報は10月10日に確認。最新は公式ヘルプでご確認ください)
ChatGPTの音声ファイル文字起こしでよくある質問
- ChatGPTの音声ファイル文字起こしは無料版でも利用できますか?
-
いいえ。公式ヘルプでは、無料プランでは現時点で利用できないとされています(2026年10月10日確認)。有料プランとワークスペースが対象です。
- 音声ファイルは何分まで文字起こしできますか?
-
公式ヘルプに再生時間の上限は書かれていません。容量は1つあたり512MBまでで、長い録音は分割して処理されたり、タイムアウトしたりする場合があります。
- 動画のMP4は利用できますか?
-
映像が入った動画扱いのMP4・WebMは対象外です。音声のみのMP4・WebMなら添付できます。
- 話者は分けてくれますか?
-
公式ヘルプは、話者識別が信頼できない場合があると説明しています。誰の発言かは、元の録音で確かめてください。
- 録音は保存されたり、学習に使われたりしますか?
-
公式ヘルプの保存・削除・モデル改善に関する部分は、ドキュメントと画像が対象で、音声の明記は見つかっていません(10月10日時点)。設定画面と公式ヘルプの最新情報を確認してください。
- 英語など日本語以外の録音でも文字起こしできますか?
-
公式ヘルプは、言語によって性能が異なる場合があると説明しています。日本語以外の対応言語の一覧は、10月10日時点で確認できていません。









