Whisperで文字起こし 無料での使い方・モデルの選び方・API料金・活用事例を解説【2026年】
2026年9月15日
著者:NEXT SCALE編集部
監修者:石丸真平

会議の議事録作成、インタビュー音声の書き起こし、動画への字幕追加。これらの「音声をテキストに変換する」作業に多くの時間を取られていないでしょうか。手動での文字起こしは、1時間の音声に対して3〜4時間かかるとも言われており、多くのビジネスパーソンにとって大きな業務負担になっています。この単純だが時間のかかる作業を自動化できれば、業務全体の効率が大きく改善されます。
この課題を解決する手段として注目されているのが、OpenAIが開発した音声認識AI「Whisper(ウィスパー)」です。Whisperはオープンソースで提供されており、ローカル環境で動かせば完全無料で利用できます。日本語の文字起こし精度は単語誤り率わずか4.9%と、商用サービスに引けを取らない実用レベルを実現しています。文字起こしの専門サービスに外注するとコストが高く、社内で手動対応するにはリソースが足りないという悩みを、Whisperは技術面・コスト面の両方から解決してくれます。
一方で、「Whisperの使い方が分からない」「どのモデルを選べばいいのか」「APIを使う場合の料金はいくらか」といった疑問を抱えている方も多いのではないでしょうか。本記事では、Whisperの仕組みからモデルの選び方、無料で使う方法、API版の料金、ビジネスでの活用事例まで、文字起こしの導入に必要な情報を一通り整理しています。
| 確認したいポイント | 結論 | 詳細 |
| Whisperとは何か? | OpenAIが開発した無料で使える高精度の音声認識AI | 68万時間の多言語音声データで学習されており、日本語を含む99言語に対応しています |
| 無料で使えるのか? | ローカル環境で実行すれば完全無料 | オープンソース(MITライセンス)のため商用利用も無料。API版は1分あたり約0.9円の従量課金です |
| 日本語の精度はどうか? | 商用サービスに匹敵する高い精度 | 大規模モデルでの日本語の単語誤り率は4.9%と、高い精度です |
| どんな場面で使えるか? | 議事録・字幕・インタビュー書き起こし等 | 会議の自動文字起こしや動画の字幕生成、コールセンターの通話記録など幅広い業務に活用できます |
この記事でわかること
・Whisperの仕組みと、他の文字起こしツールとの違い
・5つのモデルサイズの特徴と、用途に合った選び方
・ローカル環境で無料で使う方法と、ブラウザで試す方法
・API版の料金体系と、コストを抑えた運用方法
・議事録作成・字幕生成など、ビジネスでの活用事例
| Whisperを活用した文字起こしの自動化やAI導入にお悩みの方は、まずは無料相談をご利用ください。 貴社の業務フローに合ったAI活用の進め方をサポートいたします。 > 相談予約はこちら |
Whisperとは
Whisperの基本的な仕組みと特徴を整理します。なぜ無料で高精度な文字起こしが可能なのかを理解しておくことで、自社の業務に適しているかどうかを判断する材料になります。まず、Whisperがどのようなツールで、何ができて何ができないのかを正確に把握しておきましょう。
Whisperの概要と仕組み
Whisper(ウィスパー)は、OpenAIが2022年9月に公開した、オープンソースの音声認識AIです。68万時間という膨大な量の多言語音声データで学習されており、音声をテキストに変換する「文字起こし」と、音声を別の言語のテキストに変換する「音声翻訳」の2つの機能を備えています。
Whisperが他の音声認識ツールと異なる最大のポイントは、オープンソース(MITライセンス)で公開されていることです。つまり、ソースコードが一般に公開されており、誰でも無料でダウンロードして利用できます。商用利用も制限がないため、自社の製品やサービスに組み込んで使うことも可能です。
対応する音声ファイル形式は、MP3、WAV、M4A、FLAC、OGGなど一般的な形式を網羅しています。会議の録音データからYouTube動画の音声まで、特別な変換作業なしにそのまま読み込ませることができます。多くの音声認識システムは特定の言語に特化していることが多いですが、Whisperは99言語に対応しており、日本語と英語が混在する会議の録音でも、言語を自動で識別して文字起こしを行えます。グローバルなビジネスシーンや多言語のコンテンツを扱う場面では、この多言語対応が大きなメリットになります。
日本語の文字起こし精度
Whisperの日本語文字起こし精度は、大規模モデルで単語誤り率4.9%を記録しており、高い精度を誇ります。この数値は、日本語に特化した商用の文字起こしサービスと比較しても遜色のないレベルです。
ただし、文字起こしの精度は音声の品質に大きく左右されます。ノイズの少ないクリアな録音であれば高い精度が期待できますが、騒がしい環境での録音や、複数人が同時に話す場面では認識精度が低下する場合があります。また、専門用語や固有名詞(社名、人名、製品名など)は正しく認識されないケースもあるため、業務で使用する場合は文字起こし結果の目視確認が必要です。それでも、ゼロから手動で文字起こしするよりも大幅な時間短縮になるのは間違いありません。業務で使用する場合は、できるだけ高品質な録音環境を整えることが、文字起こし精度を向上させる最も効果的な方法です。
なお、Whisperには標準では話者分離(誰が話しているかを識別する機能)が搭載されていません。会議の議事録のように「Aさんの発言」「Bさんの発言」を分けて記録したい場合は、別途話者分離ツールと組み合わせて使用する必要があります。pyannote.audioやNeMoといった話者分離ツールをWhisperと連携させる方法が広く使われており、これらを組み合わせることで「誰が何を言ったか」まで自動で記録できる議事録システムを構築できます。ただし、話者分離の精度は参加人数や発話の重なりによって変動するため、重要な会議では出力結果の確認が必要です。
関連記事:AIツール比較|法人利用で見るべき7つの軸と主要ツールの違い
Whisperのモデルサイズと選び方
Whisperには精度と速度のバランスが異なる5つのモデルサイズが用意されています。用途に合ったモデルを選ぶことで、処理速度とコストを最適化できます。間違ったモデルを選ぶと、精度が不足したり処理時間が長くなりすぎたりするため、以下の比較表を参考に自社の用途に合ったモデルを選んでください。
| モデル | パラメータ数 | 必要メモリ | 処理速度 | 日本語精度 | 推奨用途 |
| tiny | 3,900万 | 約1GB | 最速 | 低い | 動作確認・テスト用 |
| base | 7,400万 | 約1GB | 速い | やや低い | 速度重視のラフな文字起こし |
| small | 2.4億 | 約2GB | 普通 | 実用レベル | 日常的な文字起こし・字幕作成 |
| medium | 7.7億 | 約5GB | やや遅い | 高い | 議事録・重要な録音の文字起こし |
| large | 15.5億 | 約10GB | 遅い | 最高(誤り率4.9%) | 高精度が求められる業務用途 |
モデル選定の基本方針
モデルの選び方はシンプルです。まずsmallモデルで実際の音声を試し、精度に不足があればmediumまたはlargeに切り替えるというアプローチが最も効率的です。
日常的な会議の文字起こしや動画の字幕作成であれば、smallモデルで十分な精度が得られるケースが多いです。処理速度もsmallモデルの方が圧倒的に速いため、大量の音声ファイルを処理する場合にはsmallモデルのコストパフォーマンスが際立ちます。実際の業務では、まずsmallモデルで文字起こしを行い、出力結果を目視で確認して精度が足りなければmediumに切り替えるという運用が効率的です。
一方、法務文書の書き起こしや医療分野の記録など、一語一句の正確性が求められる場面ではlargeモデルを使用してください。正確性が求められる文書では、文字起こしの後に必ず人の目で校正を入れる運用を前提としておくことが重要です。AIの出力をそのまま最終成果物として使用するのではなく、高品質な下書きとして活用する意識が、業務での定着につながります。tinyモデルは日本語の固有名詞が正しく認識されないケースが多く、実務での利用には適していません。動作確認やテスト用途に限定して使うのがよいでしょう。
なお、2026年時点ではlarge-v3-turboモデルも公開されています。このモデルはlargeモデルと比べて処理速度が約8倍速く、精度の低下はわずかとされているため、大量の音声を高速かつ高精度で処理したい場合の有力な選択肢です。
Whisperで無料で文字起こしする方法
Whisperを無料で使う方法を、難易度別に3つ紹介します。プログラミングの経験がない方でも始められる方法から順に解説しますので、自分のスキルレベルや用途に合った方法を選んでください。
方法1:ブラウザで試す(Hugging Face)
最も手軽にWhisperを試す方法は、Hugging Faceのデモページを利用することです。ブラウザからアクセスし、マイクで音声を録音するか、音声ファイルをアップロードするだけで文字起こしが実行されます。インストールやアカウント登録は一切不要です。
ただし、デモ版では1回あたり最大30秒の音声しか処理できないため、長時間の音声には対応できません。あくまでも「まずWhisperの精度を体験してみたい」「どの程度の品質で文字起こしできるか確認したい」という目的に適しています。実際に日本語の音声を30秒入力してみるだけでも、Whisperの認識精度の高さを実感できるはずです。固有名詞や専門用語がどの程度正確に拾えるかを確認する際にも、このデモ版が便利です。本格的な利用を始める前のファーストステップとして、ぜひ試してみてください。
方法2:Google Colabで実行する(インストール不要)
自分のパソコンに環境を構築せずにWhisperを本格的に使いたい場合は、Google Colaboratory(Colab)を利用する方法がおすすめです。Googleが提供する無料のクラウド実行環境で、ブラウザ上でPythonコードを実行できます。
Google ColabにはGPUが無料で使える枠があるため、自分のパソコンに高性能なGPUがなくても、Whisperのlargeモデルを実行できます。音声ファイルをGoogleドライブにアップロードし、数行のPythonコードを実行するだけで文字起こしが完了します。プログラミング初心者でも、コードをコピー&ペーストして実行ボタンを押すだけで動作するため、技術的なハードルは低いです。インターネット上にはGoogle Colab用のWhisperテンプレート(ノートブック)が多数公開されており、日本語で解説されたものも数多くあります。コピーして実行するだけで使い始められるため、プログラミングの経験がない方でも問題なく利用できます。
ただし、無料枠のGoogle Colabには利用時間の制限があり、長時間の連続使用はできません。また、セッションが切れるとアップロードしたデータが消えるため、重要な音声ファイルは必ず別の場所にバックアップを取っておいてください。
方法3:自分のパソコンにインストールして使う
継続的にWhisperを使う場合は、自分のパソコンにWhisperをインストールして実行する方法が最も安定しています。Python環境とWhisperライブラリをインストールし、コマンドラインまたはPythonスクリプトから実行します。
ローカル環境で実行するメリットは、処理速度の安定性と、音声データを外部に送信しないセキュリティ上の安心感です。機密性の高い音声(社内会議の録音、顧客との通話記録、採用面接の記録など)を扱う場合は、クラウドに送信せずに処理できるローカル実行が適しています。社内のセキュリティポリシーでデータの外部送信が禁止されている組織では、ローカル実行が唯一の選択肢になります。
ただし、largeモデルを快適に動かすにはNVIDIA製のGPU(VRAM 10GB以上推奨)が必要です。GPUが搭載されていないパソコンでもCPUのみで実行可能ですが、処理速度が大幅に遅くなります。たとえば、1時間の音声をlargeモデルで処理する場合、GPU環境では数分で完了する処理がCPU環境では数十分〜1時間以上かかることがあります。GPUなしの環境では、smallモデルの利用に留めるか、高速化版の「faster-whisper」や「whisper.cpp」の導入を検討してください。これらの高速化ツールは、モデルの量子化という技術によりメモリ使用量と処理時間を大幅に削減しており、GPUがないパソコンでも実用的な速度で文字起こしを実行できます。
| AI開発やDX推進に関するサービス資料をご用意しています。導入検討の参考に、まずは資料をご確認ください。 > 資料請求はこちら |
Whisper APIの料金と使い方
プログラミング環境の構築が難しい場合や、大量の音声を安定して処理したい場合は、OpenAIが提供するWhisper APIの利用が選択肢になります。API版は自分でGPU環境を用意する必要がなく、インターネット経由で高精度な文字起こしを実行できるのがメリットです。
API版の料金体系
Whisper APIの料金は従量課金制で、1分あたり0.006ドル(約0.9円)です。1時間の音声を処理した場合の料金は約0.36ドル(約54円)になります。手動で文字起こしする時間コストと比べると、圧倒的に安価です。
2026年時点では、以下のモデルがAPI経由で利用可能です。
| APIモデル名 | 料金(1分あたり) | 特徴 |
| whisper-1 | $0.006(約0.9円) | 標準モデル。large相当の精度 |
| gpt-4o-transcribe | $0.006(約0.9円) | GPT-4oベース。高精度 |
| gpt-4o-mini-transcribe | $0.003(約0.45円) | 軽量版。コスト重視向け |
API版は1回のリクエストで最大25MBのファイルを処理でき、結果はJSON形式またはテキスト形式で返されます。25MBを超える長時間の音声ファイルは、事前に分割してから送信する必要があります。Pythonのpydubライブラリなどを使えば、音声ファイルの分割は数行のコードで実現できます。大量の音声ファイルをバッチ処理する場合は、Pythonスクリプトを書いてファイルを順番に送信する運用が一般的です。API版はGPUを持たないユーザーでも高精度な文字起こしを利用でき、処理速度も安定しているのがメリットです。月間100時間の音声を処理しても料金は約36ドル(約5,400円)程度であり、専用の文字起こしサービスと比較して大幅にコストを抑えられます。
ただし、API版では音声データがOpenAIのサーバーに送信されます。機密性の高い音声データを扱う場合は、ローカル実行の方がセキュリティ上適切です。音声データの取り扱いについては、OpenAIの利用規約とプライバシーポリシーを事前に確認してください。
関連記事:LLM一覧【2026年最新】主要モデルの特徴・違い・選び方を比較して解説
Whisperのビジネス活用事例
Whisperは多くのビジネスシーンで活用されています。ここでは、導入効果が特に高く、多くの企業で実際に導入されている代表的な活用事例を紹介します。
会議の議事録作成の自動化
Whisperの最も一般的な活用事例は、会議の録音データを自動で文字起こしし、議事録の下書きを作成する用途です。オンライン会議ツール(Zoom、Teams、Google Meetなど)の録画・録音データをWhisperに読み込ませるだけで、発言内容がテキスト化されます。
文字起こしの結果をChatGPTやClaudeなどの生成AIに渡して「この文字起こしから議事録を作成してください」と指示すれば、要約・整理された議事録が自動で生成されます。手動で議事録を作成していた場合と比べて、作成時間を大幅に短縮できます。実際に、Whisperと生成AIの組み合わせにより、1時間の会議の議事録作成を15分程度で完了できるようになったという事例も報告されています。従来は議事録の作成に担当者が数時間を費やすケースも多く、この時間を本来の業務に充てられるようになる効果は非常に大きいです。
動画コンテンツへの字幕生成
YouTube動画やeラーニング教材に字幕を追加する作業も、Whisperで効率化できます。Whisperは文字起こしと同時にタイムスタンプ(各発言の開始・終了時刻)も出力できるため、字幕ファイル(SRT形式)の生成に直接利用できます。
従来は字幕の作成に1時間の動画あたり3〜5時間の手作業が必要でしたが、Whisperを使えば処理自体は数十分で完了します。出力された字幕の修正作業を含めても、全体の作業時間を半分以下に短縮できるケースが多いです。動画コンテンツを大量に制作する教育機関やメディア企業にとって、大きな効率化が見込めます。さらに、Whisperの音声翻訳機能を使えば、日本語の音声から英語の字幕を直接生成することも可能です。グローバル展開を視野に入れた動画コンテンツの多言語対応にも活用できます。
コールセンターの通話記録の自動テキスト化
コールセンターでは、顧客との通話内容を記録・分析する業務が日常的に発生します。Whisper APIを通話録音システムと連携させることで、通話内容を自動でテキスト化し、CRMに登録するワークフローを構築できます。
テキスト化されたデータは、顧客からの問い合わせ内容の傾向分析や、オペレーターの応対品質の評価にも活用できます。たとえば、「どのような質問が多いか」「顧客の不満が集中している分野は何か」といった分析を、テキスト化されたデータをもとに行うことで、サービス改善の優先度を客観的に判断できます。生成AIと組み合わせれば、通話内容の要約や感情分析(顧客が不満を感じているかどうかの判定)も自動化でき、カスタマーサポートの品質向上と業務効率化を同時に実現できます。
Whisperを使う際の注意点
Whisperを業務で活用する際に押さえておくべき注意点を整理します。著作権、音声品質、セキュリティの3つの観点から、トラブルを未然に防ぐためのポイントを確認してください。
著作権への配慮
講演、ラジオ番組、ポッドキャスト、テレビ番組など、第三者が制作したコンテンツを文字起こししてインターネット上に公開すると、著作権侵害に該当する可能性があります。文字起こしの対象が自社の音声データであるか、権利者の許諾を得ているかを必ず確認してください。社内の会議録音や自社制作の動画であれば問題ありませんが、他者のコンテンツを扱う場合は権利関係の確認が不可欠です。個人の学習目的で文字起こしをする分には私的利用の範囲に該当しますが、その結果をブログやSNSに公開する行為は著作権侵害となりうるため、十分に注意してください。
音声品質と精度の関係
Whisperの精度は音声の品質に大きく依存します。雑音の多い環境で録音された音声や、マイクから遠い位置で話された声は、認識精度が著しく低下します。業務で安定した精度を得るためには、外付けマイクの使用やノイズキャンセリング機能の活用が効果的です。オンライン会議の録音であれば、参加者がヘッドセットを使用するだけでも精度が向上します。会議室での対面会議を録音する場合は、テーブル中央に高感度の集音マイクを設置することで、全員の発言を均一な音質で拾えるようになり、認識精度の安定につながります。
セキュリティ上の考慮
API版のWhisperを利用する場合、音声データがOpenAIのサーバーに送信されます。社内の機密情報や個人情報を含む音声データを扱う場合は、データの取り扱いポリシーを事前に確認してください。OpenAIの利用規約では、APIに送信されたデータはモデルの学習に使用されないとされていますが、組織のセキュリティ要件によっては、ローカル環境でのWhisper実行を選択し、音声データを社外に送信しない運用を検討することをおすすめします。特に医療・法律・金融といった規制の厳しい業界では、データの越境移転に関する法的要件も確認が必要です。
関連記事:システム開発の外注とは|費用相場、選び方、失敗しない進め方を解説
| Whisperを活用した文字起こしの自動化やAI導入にお悩みの方は、まずは無料相談をご利用ください。貴社の業務フローに合ったAI活用の進め方をサポートいたします。 > 相談予約はこちら |
まとめ
Whisperは、OpenAIが開発した無料で使える高精度の音声認識AIです。本記事では、Whisperの仕組みと日本語精度、5つのモデルサイズの特徴と選び方、無料で文字起こしする3つの方法(ブラウザ・Google Colab・ローカルインストール)、API版の料金体系とモデル別の単価、そして議事録作成・字幕生成・コールセンター記録といったビジネス活用事例について解説しました。
使い方の選択肢は、「ブラウザで手軽に30秒試す」「Google Colabでインストール不要で本格的に使う」「自分のパソコンにインストールしてセキュアに処理する」「API版を利用して安定した処理環境を得る」の4つです。セキュリティ要件や処理量、技術スキルに応じて最適な方法を選んでください。まずはHugging Faceのデモで日本語の精度を体験し、業務に組み込む場合はGoogle ColabまたはAPI版で運用を始めるのが現実的な進め方です。
モデル選びでは、日常的な用途ならsmallモデル、高精度が必要な業務にはlargeモデルを基本とし、大量処理にはlarge-v3-turboを検討してください。API版は1分あたり約0.9円と非常に安価なため、手動の文字起こしと比べて圧倒的なコスト削減が可能です。1時間の音声を約54円で文字起こしできるこのコスト効率は、文字起こし業務に時間を取られている組織にとって大きな改善効果をもたらします。音声データのセキュリティに配慮しつつ、自社の業務に合った方法でWhisperを活用してください。
AIコンサル・AX伴走支援サービスご紹介資料
この資料でこんなことがわかります!
- 社外AI役員とは
- 支援内容
- 導入の進め方
- 導入実績・効果
\3ステップで簡単入力/
この記事の監修者
株式会社ネクストスケール 代表取締役




