Whisper APIの料金はいくら?モデル別の価格・コスト試算・他サービス比較を解説
2026年9月15日
著者:NEXT SCALE編集部
監修者:石丸真平

「Whisper APIを使って文字起こしをしたいが、料金がどのくらいかかるのかわからない」「他の音声認識サービスと比べてコスト面はどうなのか」。OpenAIのWhisper APIの導入を検討するにあたって、料金体系を正確に把握しておきたい方は多いのではないでしょうか。
Whisper APIは、OpenAIが提供するクラウド型の音声認識APIで、音声ファイルをアップロードするだけで高精度な文字起こしが可能です。料金は従量課金制で、音声1分あたり0.006ドル(約0.9円)からという設定になっています。
一方で、Whisperにはオープンソース版(無料)やサードパーティのホスティングサービスなど、複数の利用方法があり、それぞれ料金体系が異なります。用途や利用量に応じて最適な方法を選ぶことで、コストを大幅に抑えることも可能です。
この記事では、Whisper APIのモデル別の料金、利用量ごとのコスト試算、他の音声認識サービスとの料金比較、そしてコストを抑えるための方法まで、料金に関する情報を網羅的にまとめています。
| 確認したいポイント | 結論 | 詳細 |
| Whisper APIの料金は? | 1分あたり0.003〜0.006ドル | whisper-1とgpt-4o-transcribeが$0.006/分、gpt-4o-mini-transcribeが$0.003/分です(2026年時点) |
| 無料で使う方法はあるか? | ローカル実行なら無料 | WhisperはオープンソースのためローカルPCで実行すれば無料です。ただしGPU環境の準備が必要です |
| 他サービスと比べて安いか? | バッチ処理ではかなり安い | Google Cloud STTやAmazon Transcribeと比較して、バッチ処理の文字起こしではWhisper APIの価格が有利です |
| コストを抑える方法は? | 用途に合った方法を選ぶ | 少量ならAPI直接利用、大量処理ならローカル実行やGroq等のサードパーティ利用が費用対効果が高いです |
この記事でわかること
・Whisper APIの料金体系とモデル別の価格
・利用量ごとのコスト試算(月10時間〜100時間)
・Whisperを無料で使う方法(ローカル実行・Google Colab)
・他の音声認識サービスとの料金・機能比較
・コストを最適化するための選び方と活用のポイント
| \ AI導入・業務自動化のご相談はネクストスケールへ / ▶ 相談予約はこちら |
Whisper APIとは?特徴と料金の概要
料金の詳細に入る前に、Whisper APIがどのようなサービスで、どんな特徴を持つのかを簡単に整理しておきましょう。
Whisperの概要と利用形態
Whisperは、OpenAIが開発した自動音声認識(ASR)モデルです。68万時間以上の多言語音声データで学習されており、日本語を含む100以上の言語に対応しています。雑音や訛り、専門用語にも比較的強い耐性を持つことが特徴です。
Whisperには大きく分けて2つの利用形態があります。1つはOpenAIのクラウドAPIを通じて利用する方法(有料・従量課金)、もう1つはオープンソースのモデルをダウンロードしてローカル環境で実行する方法(無料・GPU推奨)です。
API版はプログラミングの最低限の知識があれば、数行のコードで利用開始でき、環境構築の手間がかかりません。一方、ローカル版はGPU搭載のPCが必要ですが、ランニングコストがゼロで大量の音声処理に向いています。
Whisper APIで利用できるモデル
OpenAIのWhisper APIでは、複数のモデルが提供されています。2026年時点で利用可能な主なモデルは以下のとおりです。
whisper-1:初期から提供されているWhisperモデルです。安定した精度で幅広い用途に使えます。
gpt-4o-transcribe:GPT-4oベースの文字起こしモデルです。whisper-1と同等の料金で、より高い精度が期待できます。
gpt-4o-mini-transcribe:軽量版のモデルで、料金がwhisper-1の半額です。精度はやや下がりますが、コスト重視の用途に適しています。
最新の料金やモデルの仕様は、OpenAIの公式料金ページで確認できます(参考:OpenAI API Pricing)。
Whisper APIのモデル別料金と課金の仕組み
Whisper APIの料金は従量課金制で、音声の長さ(分単位)に応じて課金されます。ここではモデル別の料金と、課金の仕組みを詳しく解説します。
モデル別の料金一覧
| モデル名 | 1分あたりの料金 | 1時間あたりの料金 | 特徴 |
| whisper-1 | $0.006(約0.9円) | $0.36(約55円) | 標準モデル。安定した精度 |
| gpt-4o-transcribe | $0.006(約0.9円) | $0.36(約55円) | 高精度モデル。GPT-4oベース |
| gpt-4o-mini-transcribe | $0.003(約0.46円) | $0.18(約28円) | 軽量・低コスト。精度はやや劣る |
※日本円の換算は1ドル=約153円(2026年時点の目安)で計算しています。為替レートの変動により実際の金額は異なります。
課金の仕組みと注意点
Whisper APIの課金は、アップロードした音声ファイルの長さ(分単位)に基づいて計算されます。ファイルサイズではなく、音声の実際の長さが課金の基準となる点に注意してください。
たとえば、10分の会議音声をアップロードした場合、whisper-1では0.006ドル×10分=0.06ドル(約9.2円)が課金されます。無音部分が含まれていても、音声ファイルの総時間に対して課金されるため、事前に不要な無音部分をトリミングしておくとコスト削減につながります。
APIの利用にはOpenAIのアカウント登録とAPIキーの取得が必要で、支払いはクレジットカードによる後払いです。利用額の上限(Usage Limit)を設定しておくと、想定外のコスト発生を防げます。
利用量ごとのコスト試算
Whisper APIの料金がどの程度になるか、利用シーン別にコストを試算してみましょう。
月間利用量別のコスト比較
| 月間利用量 | whisper-1の月額 | gpt-4o-mini-transcribeの月額 | 想定される利用シーン |
| 月10時間 | $3.6(約550円) | $1.8(約275円) | 週2〜3回の社内会議の文字起こし |
| 月50時間 | $18(約2,750円) | $9(約1,380円) | 毎日の会議+インタビューの文字起こし |
| 月100時間 | $36(約5,500円) | $18(約2,750円) | コールセンターの通話録音の分析 |
| 月500時間 | $180(約27,500円) | $90(約13,800円) | 大規模な音声データの一括処理 |
このように、Whisper APIは月100時間の文字起こしでも約5,500円と、市販の文字起こしSaaSサービス(月額数千円〜数万円)と比較しても遜色ないか、むしろ安価に運用できるケースが多いです。
他の文字起こしサービスとのコスト比較
Whisper APIと同様にクラウド型で利用できる主要な音声認識サービスの料金を比較します。
| サービス名 | 1分あたりの料金 | 1時間あたりの料金 | 特徴 |
| OpenAI Whisper API(whisper-1) | $0.006 | $0.36(約55円) | 高精度、100言語対応、バッチ処理向き |
| Google Cloud Speech-to-Text | $0.006〜$0.024 | $0.36〜$1.44 | リアルタイム対応、話者分離あり |
| Amazon Transcribe | $0.024 | $1.44(約220円) | AWS連携が強み、カスタム語彙対応 |
| Azure AI Speech | $0.016 | $0.96(約147円) | リアルタイム対応、話者分離あり |
バッチ処理(録音済み音声の一括文字起こし)においては、Whisper APIの料金は他サービスと同等か、それ以下の水準です。ただし、リアルタイムの文字起こしや話者分離(誰が話したかの識別)が必要な場合は、Google Cloud STTやAzure AI Speechが適しています。Whisper APIは基本的にバッチ処理向きの設計であり、リアルタイム処理には別のAPIが必要になる点に注意してください。
| \ AI導入・業務自動化のご相談はネクストスケールへ / ▶ 資料請求はこちら |
Whisperを無料・低コストで使う方法
Whisper APIの料金は十分に安価ですが、さらにコストを抑えたい場合や、大量の音声を処理したい場合には、別の利用方法を検討する価値があります。
方法1:ローカル環境で実行する(無料)
WhisperはOpenAIがオープンソースとして公開しているため、モデルをダウンロードしてローカルPCで実行すれば、利用料金はかかりません。ただし、GPUを搭載したPCが推奨されます。
NVIDIA製のGPU(VRAM 8GB以上を推奨)を搭載したPCであれば、Whisper Large V3やLarge V3 Turboといった高精度モデルをローカルで実行できます。Apple Silicon(M1/M2/M3/M4)搭載のMacでは、mlx-whisperというライブラリを使うことで高速に動作します。
ローカル実行の主なメリットは、ランニングコストがゼロであること、音声データを外部に送信しないためセキュリティが高いこと、ファイルサイズの上限がないことです。デメリットは、初期のセットアップにPythonの知識が必要であること、CPU環境では処理が遅くなることです。
方法2:Google Colaboratoryで実行する(無料枠あり)
自分のPCにGPUがない場合は、Google Colaboratory(Colab)を使ってクラウド上のGPU環境でWhisperを実行する方法があります。Google Colabの無料プランでも一定時間のGPU利用が可能です。
Colabのノートブックに数行のコードを入力するだけでWhisperをインストール・実行でき、プログラミング初心者でも比較的取り組みやすい方法です。ただし、無料プランではGPU利用時間に制限があるため、大量の音声処理には有料プラン(Colab Pro:月額約1,600円)の検討が必要です。
方法3:サードパーティのホスティングサービスを使う
OpenAI API以外にも、Whisperモデルをホスティングしているサードパーティのサービスがあります。たとえば、GroqはWhisper Large V3 Turboを1時間あたり約0.04ドル(約6円)で提供しており、OpenAI APIの約9分の1のコストで利用できます。
APIの使い方はOpenAI APIと似ており、少ないコード変更で切り替えが可能です。大量の音声をコスト重視で処理したい場合には、有力な選択肢となります。ただし、サービスの安定性やサポート体制はOpenAIと比較すると限定的な場合があるため、本番運用前に検証しておくことをおすすめします。
Whisper APIの料金を最適化するための4つのポイント
Whisper APIのコストを適切に管理するために、実務で役立つ最適化のポイントを紹介します。
ポイント1:用途に合ったモデルを選ぶ
すべての音声に高精度モデルを使う必要はありません。社内メモや議事録のドラフトであれば、gpt-4o-mini-transcribe($0.003/分)で十分なケースが多いです。公開用のコンテンツや正確性が求められる文字起こしにのみ、whisper-1やgpt-4o-transcribeを使うという使い分けがコスト削減に効果的です。
ポイント2:不要な無音部分を事前にカットする
Whisper APIは音声ファイルの総時間に対して課金されるため、会議の冒頭・末尾の無音部分や長い休憩時間が含まれていると、無駄なコストが発生します。ffmpegなどのツールで無音部分をカットしてからアップロードしましょう。
ポイント3:Usage Limitを設定して予算超過を防ぐ
OpenAIのダッシュボードで月額の利用上限(Usage Limit)を設定しておくと、想定外の利用量による予算超過を防げます。特に開発段階では、テストで大量のリクエストを送ってしまうことがあるため、上限設定は必須です。
ポイント4:大量処理はローカル実行やGroqを検討する
月間100時間を超えるような大量の音声処理が必要な場合は、OpenAI APIよりもローカル実行やGroqのほうがコスト効率が高くなります。月間500時間の処理であれば、OpenAI API(約27,500円)に対し、ローカル実行(電気代のみ)やGroq(約3,000円程度)と大幅なコスト差が出ます。
AIツールの選定や導入全般については、AIツール比較|法人利用で見るべき7つの軸の記事も参考にしてください。また、AI活用による業務効率化を幅広く検討したい場合は業務効率化アイデア55選もおすすめです。
| \ AI導入・業務自動化のご相談はネクストスケールへ / ▶ 相談予約はこちら |
Whisper APIの導入判断と注意点
Whisper APIはコストパフォーマンスに優れた音声認識サービスですが、導入にあたってはいくつかの注意点があります。
注意点1:リアルタイム文字起こしには対応していない
Whisper API(whisper-1)は、録音済みの音声ファイルをアップロードして処理するバッチ処理向けの設計です。会議中にリアルタイムで字幕を表示するような用途には、OpenAIのRealtime APIやDeepgram、Google Cloud STTなど、リアルタイム対応のサービスを検討する必要があります。
注意点2:ファイルサイズに上限がある
Whisper APIでアップロードできるファイルサイズの上限は25MBです。長時間の音声ファイルはこの上限を超える場合があるため、事前に分割するか、音声の圧縮(mp3やopus形式への変換)を行う必要があります。
注意点3:話者分離(ダイアリゼーション)は非対応
Whisper APIには、「誰が話したか」を識別する話者分離機能は搭載されていません。議事録作成で発言者を区別したい場合は、Azure AI SpeechやAmazon Transcribeの話者分離機能を利用するか、Whisperの出力結果にあとから手動で発言者を割り当てる必要があります。
注意点4:音声データの取り扱いポリシーを確認する
APIを通じてOpenAIに送信した音声データの取り扱いポリシーは、利用規約に従います。機密性の高い音声データ(顧客情報や個人情報を含む通話録音など)を扱う場合は、データの保持期間や利用目的をOpenAIの利用規約で確認してください。
セキュリティ上の理由で音声データを外部に送信できない場合は、ローカル環境でのWhisper実行が適しています。
AI導入やデータ活用の進め方について専門家のサポートが必要な場合は、ネクストスケールのAIコンサル・AX伴走支援のサービスもご活用ください。
| \ AI導入・業務自動化のご相談はネクストスケールへ / ▶ 資料請求はこちら |
まとめ
Whisper APIの料金は、whisper-1およびgpt-4o-transcribeが1分あたり0.006ドル(約0.9円)、gpt-4o-mini-transcribeが0.003ドル(約0.46円)の従量課金制です。1時間の音声を文字起こししても約28〜55円と、非常にリーズナブルな料金設定となっています。
さらにコストを抑えたい場合は、オープンソース版をローカル環境で実行する(無料)、Google Colaboratoryを使う(無料枠あり)、Groq等のサードパーティのホスティングを利用する(OpenAI APIの約9分の1)といった選択肢があります。
導入にあたっては、リアルタイム処理には非対応であること、ファイルサイズに25MBの上限があること、話者分離機能がないこと、音声データの取り扱いポリシーの確認が必要であることを押さえておきましょう。
Whisper APIは、録音済み音声のバッチ文字起こしにおいて、精度と価格のバランスが優れたサービスです。用途と利用量に応じて最適な利用方法を選び、コスト効率の高い音声認識環境を構築してください。
AIコンサル・AX伴走支援サービスご紹介資料
この資料でこんなことがわかります!
- 社外AI役員とは
- 支援内容
- 導入の進め方
- 導入実績・効果
\3ステップで簡単入力/
この記事の監修者
株式会社ネクストスケール 代表取締役




