AI × 業務活用実務入門 / AI活用

OpenAI Whisperの文字起こしを無料で使う方法|API課金版との違い・比較


OpenAIのWhisperで音声を文字起こしする場合、ローカルなら無料で使えるのでしょうか。無料なのはコードとモデルの重みで、実際に使うにはPCへの導入とモデル選びが必要です。本記事では、Whisperのモデル構成とライセンス、ローカルで動かす具体的な手順(Windows・Macでの使い方、日本語音声の扱い)、電気代や有料の文字起こしAPIとの比較、精度やデータの扱いといった価格以外の判断材料までを整理します。

公開2026.07.12
最終更新2026.07.14
読了 15 分 / 約7,200字
この記事をシェアポスト
AI × 業務活用無料で使う文字起こし

Whisperの無料文字起こし

OpenAI Whisper は、コードとモデルの重みが MIT ライセンスで無料公開されている音声認識モデルです。無料なのはこの利用料の部分で、実際に動かすにはPCの電気代・GPUの有無・セットアップの手間という実費が発生します。一方でOpenAI自身も、同じWhisperを含む文字起こしAPIを従量課金で提供しています。「無料のはずのWhisper」と「有料のWhisper API」を並べたとき、実際にどちらが得なのかを、公式ドキュメントの料金と電気料金の一次情報から計算して整理します。

C
結論
無料なのはコードとモデル。すでに使えるPCがあれば、今日からそのまま無料で使えます

Whisper本体はMITライセンスで商用利用も無料です。すでに使えるPCがあるなら、追加でかかる費用は電気代だけで、OpenAIの文字起こしAPIより安く済みます。ただし、この用途のためだけに新しくGPUを買うなら話は別です。API側の料金自体がすでに安いため、購入費用を電気代の節約分だけで回収するには相当な利用量が必要になります。

01.結論:無料なのはコードとモデルだけ

「Whisperはローカルなら無料」という話は、正確には「コードとモデルの重みの利用に料金がかからない」という意味です。動かす場所(自分のPCやサーバー)を用意し、電気を使って計算する部分は、無料化の対象ではありません。とはいえ、後述の通りこの電気代自体はごくわずかで、すでにPCを持っている人にとっては実質的に無視できる水準です。コスト構造を分解すると、次の3つに分かれます。

  • ソフトウェアの利用料:Whisper本体・whisper.cpp・faster-whisperのいずれもMITライセンスで無料
  • 実行環境の実費:電気代(すでにあるPCなら実質これだけ)。GPUを新規購入する場合はその費用
  • 時間コスト:環境構築、モデルのダウンロード、誤変換の校正にかかる手間

以下、それぞれの中身と、OpenAIの文字起こしAPIとの比較を順に見ていきます。

02.Whisperとは何か

Whisperは、OpenAIが2022年に公開した多言語対応の音声認識モデルです。GitHub の公式リポジトリで「コードとモデルの重みは MIT ライセンスで公開している」と明記されており、ダウンロードして自分のマシンで動かす分には利用料がかかりません。

モデルサイズとライセンス

Whisperにはパラメータ数の異なる6種類のモデルが公開されています。大きいモデルほど精度が上がる一方、必要なメモリが増え、処理速度は遅くなります。ここでの「メモリ」は、NVIDIA GPUならVRAM、Apple SiliconならCPU・GPUが共有する統一メモリを指します。

モデルパラメータ数必要メモリ目安相対速度
tiny39M約1GB約10倍(largeを1とした場合)
base74M約1GB約7倍
small244M約2GB約4倍
medium769M約5GB約2倍
large1550M約10GB1倍(基準)
turbo809M約6GB約8倍

出典:openai/whisper README。各モデルには英語専用版(.en)もあります。相対速度はlargeモデルとの比較で、実時間(音声の長さ)に対する速度ではありません。

必要メモリはmedium・turboクラスまでなら8GB前後、精度重視のlargeでも10GB前後で収まる規模なので、専用GPUに限らず、直近数年のMacBook Pro(Apple Silicon、統一メモリ16GB以上)でも無理なく動きます。専用GPUを積んでいないノートPCやデスクトップでも、後述するwhisper.cppのような軽量実装と組み合わせれば実用速度で動きます。

「Whisper API」はOSS版のホスティング

紛らわしいのが、OpenAIが提供する文字起こしAPIの位置づけです。公式ガイドでは、API のモデル「whisper-1」を「OpenAIのオープンソースモデル」と説明しています。つまりwhisper-1は、ローカルで動かせるのと同じOSS版Whisperを、OpenAIのサーバー上でホスティングして従量課金で使えるようにしたものです。

i
補足
gpt-4o-transcribe・mini は別モデル

同じAPIで使える「gpt-4o-transcribe」「gpt-4o-mini-transcribe」は、whisper-1とは別の非公開モデルです。公式ガイドでは「高品質なモデルスナップショット」と位置づけられており、重みは公開されていません。「ローカルWhisperと同条件で比べたい」場合はwhisper-1を、「精度優先でクラウドの最新モデルを使いたい」場合はgpt-4o-transcribe系を比較対象にするのが筋が通ります。

03.ローカルで動かすのに必要なもの

本家のopenai/whisperはpip install -U openai-whisper で導入できます。Python・PyTorch・ffmpegが前提で、GPUがなくてもCPUだけで動作します。Python環境を構えずに使いたい場合は、whisper.cppやfaster-whisperのような軽量な再実装が選択肢になります。whisper.cppは公式READMEの通りApple Silicon(Metal・Core ML経由)に対応しており、専用GPUを積んでいない直近のMacBook Proでも十分実用的に動きます。

実装ライセンス特徴
openai/whisper(本家)MITPython・PyTorch・ffmpeg必須
whisper.cppMIT外部依存のないC/C++実装。CPUのみでも動作。Windows(MSVC・MinGW)にも対応
faster-whisperMIT推論エンジンCTranslate2で再実装。高速・省メモリ

使い方自体はシンプルです。本家CLIならwhisper meeting.mp3 --model turbo --language Japaneseのように実行するだけで、日本語音声でも文字起こしのテキストや字幕ファイルが出力されます。OSはmacOS・Linuxに限らず、whisper.cppは公式にWindows(MSVC・MinGW)に対応しているほか、iOS向けの実装例(whisper.objc・whisper.swiftui、iPhone上でオフライン動作するデモも公開)やAndroid向けの実装例(whisper.android)も同じリポジトリに含まれているため、Windows PCはもちろんスマホアプリの土台としても使われています(スマホでの実用条件は08章FAQ参照)。

関連記事

ローカルLLMとは|必要なスペック・クラウドとの違い・始め方

Whisperに限らず、AIモデルを自分のPCで動かす際に共通する「必要なVRAM・量子化の考え方」は別記事で詳しく整理しています。あわせてご覧ください。

続きを読む

04.電気代を実際に計算する

「電気代くらいかかるのでは」という疑問に、具体的な数字で答えます。一例として、専用GPUを使う場合のミドルクラスGPU「GeForce RTX 4070」は、NVIDIA公式スペックによると消費電力(Total Graphics Power)が200Wです。東京電力エナジーパートナーの従量電灯Bの電力量料金単価(第2段階、2026年7月時点)は1kWhあたり36.40円なので、このGPUをフル稼働させ続けた場合の電気代は次のように計算できます。

📘
試算
GPUを1時間フル稼働させた場合の電気代

0.2kW(200W)× 1時間 × 36.40円/kWh = 約7.3円

turboやsmallのような軽量モデル、あるいはwhisper.cpp・faster-whisperの量子化モデルは実時間より速く処理できるため、音声1時間分の文字起こしに必要なGPU稼働時間は1時間より短く済みます。実際の電気代は、この7〜8円がさらに小さくなると見てよい水準です。CPUのみのノートPCであれば消費電力はさらに下がり、電気代はほぼ無視できます。

つまり、専用GPU搭載機でもApple Silicon MacBook Proでも、すでに使える端末がある人にとって、ローカルWhisperの追加コストは1時間あたり一桁円というのが実態です。この水準を踏まえて、次にOpenAIの文字起こしAPIの料金と比較します。

05.有料APIとの損益分岐点

OpenAIは同じAPIの中に、料金の異なる複数の文字起こしモデルを用意しています。公式の料金ページによると、2026年7月時点の価格は次の通りです。

モデル位置づけ料金1時間あたり換算
whisper-1OSS版Whisperのホスティング$0.006 / 分約58円
gpt-4o-transcribe非公開の高品質モデル$0.006 / 分約58円
gpt-4o-mini-transcribe非公開の軽量モデル$0.003 / 分約29円

1ドル=162円前後(2026年7月時点の実勢レート)で換算。為替は変動するため目安としてご覧ください。ライブ配信向けの gpt-realtime-whisper($0.017/分)はリアルタイム配信用の別料金体系のため、バッチ処理の比較対象からは除いています。ローカル側にもリアルタイム向けツールがあり、本記事の電気代試算は録音済み音声をまとめて処理するバッチ用途が前提です(詳しくは08章FAQ参照)。

1時間分の音声を処理するコスト比較

  • whisper-1 API
    gpt-4o-transcribeも同額
    約58円
  • mini API
    gpt-4o-mini-transcribe
    約29円
  • ローカル電気代
    GPUフル稼働時
    約7円
OpenAI公式の料金ページ・NVIDIA公式スペック・東京電力エナジーパートナーの料金単価表(いずれも2026年7月時点)から算出。

電気代だけで比べれば、ローカルの方が1時間あたり50円前後安く済みます。ただし、これは「すでにGPUを持っている」場合の話です。この用途のためだけに新しくGPUを購入するなら、初期費用の回収を考える必要があります。

!
注意
GPUを新規購入する場合は回収に相当な利用量が要る

たとえばGPU本体を新たに8万円で用意すると仮定します(実売価格は変動するため目安です)。API利用より電気代の方が1時間あたり約51円安いとすると、購入費用を電気代の節約分だけで回収するには、8万円 ÷ 51円 ≈ 1,570時間の利用が必要になります。1日8時間稼働させても半年以上かかる計算で、個人や小規模な利用では簡単には元が取れません。GPU購入は、この用途単体の損得ではなく、他の用途(ゲーム・別のAI活用など)と合わせて判断する方が無理がありません。

06.価格以外の判断材料:精度とプライバシー

コストだけで決められない事情も2つあります。

ローカル実行の良い点
  • 音声データが外部に送信されない。社外に出せない商談・取材・医療系の音声にも使いやすい
  • 電気代以外の追加課金が発生しない。処理量が増えても料金が変わらない
  • オフライン環境でも動く
ローカル実行の気になる点
  • ローカルで動かせるのは公開されているWhisper本体(whisper-1相当)まで。gpt-4o-transcribe・gpt-4o-mini-transcribeのような非公開の新しいモデルは使えないため、精度重視なら選択肢が狭まる
  • セットアップ・モデル選定・誤変換の校正に自分の作業時間がかかる
  • GPUを新規購入する場合は初期費用がかかる
音声データを外部に出せない場合や、処理量が読めず定額運用にしたい場合はローカル実行が候補になります。精度を優先するならAPIの非公開モデルが選択肢に入ります。

API側のデータの扱いについても、OpenAIの公式ドキュメントでは「2023年3月1日以降、APIに送信されたデータは、明示的にオプトインしない限りモデルの学習には使われない」と説明されています。学習に使われないとはいえ、音声データ自体はOpenAIのサーバーに送信される点は、ローカル実行との違いとして押さえておく必要があります。

07.結局どちらを選ぶべきか

ここまでの内容を踏まえると、判断の分かれ目は次のように整理できます。

  • すでに使える端末(GPU搭載PCでもApple Silicon Macでも)を持っていて、たまに使う程度:電気代がほぼ無視できるため、ローカル実行で十分です
  • 社外秘の音声を扱う・オフライン環境で使いたい:データを外に出したくない用途なので、ローカル実行が向きます
  • この用途のためだけにGPUを新規購入する必要がある:API側の料金がすでに安いため、購入費用の回収に時間がかかります。まずはAPIか、GPUなしで動くwhisper.cppから試す方が無難です
  • 精度を最優先したい:ローカルWhisperより新しいgpt-4o-transcribe系を検討する余地があります

08.よくある質問(FAQ)

OpenAI Whisperは商用利用できますか?

できます。公式リポジトリで「コードとモデルの重みはMITライセンスで公開している」と明記されており、商用・非商用を問わず無料で利用できます。

ローカルで動かすのに必ずGPUが必要ですか?

必須ではありません。whisper.cppは外部依存のないC/C++実装で、CPUのみでも動作します。直近のMacBook ProのようなApple Silicon機であれば、専用GPUを積んでいなくてもMetal・Core ML経由でCPU単体より大幅に高速化されるため、量子化した小型モデルなら十分実用的です。largeクラスの大きいモデルをCPUだけで動かすと速度は遅くなります。

OpenAIの文字起こしAPIの料金はいくらですか?

公式の料金ページによると、2026年7月時点でwhisper-1とgpt-4o-transcribeは1分あたり0.006ドル(1時間あたり約58円)、gpt-4o-mini-transcribeは1分あたり0.003ドル(1時間あたり約29円)です。為替は変動するため、円換算は目安としてご覧ください。

ローカル実行なら本当に無料ですか?

コードとモデルの利用自体は無料です。ただし実行にはPCの電気代がかかります。すでに使えるGPU搭載PCやApple Silicon Macがある場合、電気代はフル稼働でも1時間あたり10円未満に収まりますが、この用途のために新しくGPUを購入する場合は初期費用がかかり、API利用料との差額だけで回収しようとすると相当な利用量が必要になります。

ローカルWhisperとAPIで精度は同じですか?

whisper-1は、ローカルで動かせるのと同じOSS版WhisperをOpenAIがホスティングしたものなので、同じモデルサイズ(largeクラス)で比べれば精度は基本的に同じです。ただし、tiny・base・smallのような小型モデルや、速度優先で量子化したwhisper.cppを使う場合は、02章の表の通り精度と引き換えに速度を得ているため、API(whisper-1相当)と同等の精度にはなりません。gpt-4o-transcribeやgpt-4o-mini-transcribeは非公開の別モデルで、重みが公開されていないためローカルでは利用できません。精度を最優先するなら、この2モデルの利用を検討する余地があります。

録音データを社外に出したくない場合はどうすればいいですか?

ローカル実行であれば、音声データは自分のPC・サーバーの外に送信されません。APIを使う場合、OpenAIの公式ドキュメントでは「2023年3月1日以降、APIに送信されたデータはオプトインなしにモデルの学習には使わない」と説明されていますが、音声データ自体はOpenAIのサーバーに送信される点はローカル実行との違いです。社外秘の音声を扱う場合は、この違いを踏まえてローカル実行を選ぶ判断材料になります。

Windowsパソコンでもローカルで動かせますか?

動きます。本家のopenai/whisperはPython・PyTorch・ffmpegが動く環境であればWindowsでも実行でき、whisper.cppも公式にWindows(MSVC・MinGWビルド)に対応しています。GPUがなくてもCPUのみで動作するため、追加のハードウェアなしに試せます。

iPhoneやAndroidのスマホでも、文字起こしアプリとして使えますか?

本家のWhisperやfaster-whisperはPython前提でスマホ単体では動きませんが、whisper.cppは公式にiOS向けの実装例(whisper.objc・whisper.swiftui、iPhone上でオフライン動作するデモも公開)とAndroid向けの実装例(whisper.android)を公開しており、文字起こしアプリの土台として使われています。ただしスマホはPCよりメモリ・処理性能が小さいため、実用的なのはtiny・baseのような軽量モデルが中心です。

リアルタイムの文字起こしにも使えますか?

ローカルでも可能です。whisper.cppには音声を0.5秒ごとにサンプリングして連続的に文字起こしするwhisper-streamというツールが公式に含まれています。ただし本記事で試算した電気代・API料金の比較は、録音済み音声をまとめて処理するバッチ用途が前提のため、常時マイクを使うリアルタイム用途では処理時間・電力の使われ方が変わります。

09.まとめ

OpenAI Whisperは、コードとモデルの重みがMITライセンスで無料公開されているOSSです。ただし「ローカルなら無料」は正確には「ソフトウェア利用料が無料」という意味で、動かすための電気代・環境構築の手間は別にかかります。すでに使えるPCがあれば電気代はOpenAIの文字起こしAPIより安く済みますが、この用途のためだけに新しくGPUを買うなら、料金差だけで元を取るのに相当な利用量が必要です。データを外に出したくない事情や、すでに使えるハードウェアの有無を軸に選ぶと、判断がぶれません。

AI音声・文字起こし活用支援

商談・取材音声の文字起こしも、AIで効率化しませんか

弊社ではAIフル活用による業務効率化のコンサルティングを提供しています。商談・会議・取材音声の文字起こしから要約・ナレッジ化まで、伴走型の月次レビューで改善を続けます。まずはお気軽にご相談ください。

TANTOUの詳細を見る

AI・AIエージェント活用 基礎知識集

一覧に戻る →
この記事をシェア
澤田 翔太(Shota Sawada)
この記事を書いた人

澤田 翔太

株式会社クリプタル 代表取締役

1988年生まれ、慶應義塾大学卒。創業メンバーとして関わった株式会社セールスサポートを株式会社ネオマーケティング(東証STD 4196)に売却。株式会社クリプタルでも複数の事業立ち上げと売却を経験し、2022年9月には婚活・恋愛メディア「シッテク」「婚活会議」を株式会社ベビーカレンダー(東証GRT 7363)へ売却。現在はAI業務支援事業、TANTOU事業、グロースハック支援事業、メディア事業、SEOコンサルティング事業を手がける。