動画解析AI
4つの手段を比較
会議の録画、製品デモ、ウェビナーのアーカイブ——業務の動画をAIに解析させたいとき、実は方法は一つではありません。どの手段を選ぶかで「何ができるか」も実装の手間も変わり、ここを見誤ると構成の設計からやり直しになります。
マルチモーダルAI全体の概観はマルチモーダルAIとは|テキスト・画像・音声・動画・Computer Useの現状で扱っているので、本記事は「動画ファイルの解析」に絞り、4つの手段の選び方を整理します。
01.結論:動画解析、4つの手段からどう選ぶか
動画をAIで解析したいとき、選べる手段は次の4つに整理できます。
- ①モデルAPIを直接使う(Gemini・GPT-5.5・Claude・Qwen3-VL等)
- ②動画特化のインデックス型サービスを使う(Twelve Labs等)
- ③クラウド大手の動画解析APIを使う(ハイブリッド型・従来型の画像解析)
- ④既製ツール同梱のAI機能を使う(Drive・Zoom等)
どの手段で何ができるかを、先に一覧で見渡しておきます。
| 手段 | 自然文で質問・検索 | 大量アーカイブの横断検索 | 映像そのものを理解 | 定型データへの変換 | 判定・モデレーション | 会議要約の手軽さ |
|---|---|---|---|---|---|---|
| ①モデルAPIを直接使う | ◎ | △ | ◎ | △ | △ | ○ |
| ②インデックス型サービス | ◎ | ◎ | ◎ | × | △ | ○ |
| ③クラウド大手のAPI | △ | △ | ◎ | ◎ | ◎ | △ |
| ④既製ツール同梱機能 | ○ | × | × | × | × | ◎ |
①はプロンプト次第でなんでも聞ける柔軟さがある一方、②〜④は前処理・インデックス・運用基盤を提供する代わりに、できることがサービスの機能に固定されます。どれを使うかは、動画1本の中身をその場で知りたいのか、大量の動画から場面を検索・要約したいのか、動画を定型データとして基幹システムに流し込みたいのか、それとも会議の要約程度で足りるのかといった「やりたいこと」で決まります。用途別の目安は08章の早見表にまとめています。本記事では、この4つの手段を順に見ていきます。
02.前提:LLMが動画を読む2つの方式
LLMが動画を「読む」やり方には、大きく2つの方式があります。どちらを使うかで、扱える尺・音声の有無・実装の手間が変わります。
ネイティブ動画理解(動画を丸ごと渡す)
動画ファイルをそのままモデルに渡し、中身を理解させる方式です。GeminiやQwen3-VLが該当します。フレーム抽出を自前で組まなくてよいぶん実装が速く、Geminiのように音声まで同時に読めるモデルなら、映像と音声の対応関係(「この発言のとき画面に何が映っていたか」)も保たれます。ただし、ネイティブ対応でも音声まで読めるかはモデルによって分かれます。
なお、Geminiの公式ドキュメントによると、ネイティブ入力でも内部では動画を既定1秒1フレームでサンプリングし、音声とあわせてトークン化しています。つまりフレーム抽出パイプラインとの実質的な違いは「フレーム化するかどうか」ではなく、フレーム化・音声の統合・タイムスタンプの整合をモデル側が担っている点にあります。
フレーム抽出パイプライン(画像に分解して渡す)
動画から一定間隔でフレーム(静止画)を抜き出し、画像としてモデルに渡す方式です。音声は別途、文字起こし(ASR: 音声認識)でテキスト化して添えます。OpenAIも公式のCookbookで、動画からフレームを抽出してモデルに渡す手順を紹介しています。動画を直接読めないClaudeのようなモデルでも、この方式なら動画の中身を扱えます。手間はかかりますが、抽出するフレームの間隔や解像度を自分で制御できる柔軟さがあります。
- 1フレームを抜き出す
動画から一定間隔(例: 1秒に1枚)でフレームを切り出す。冒頭など重要箇所は間隔を細かくすることもある。
- 2音声を文字起こしする
音声トラックをASR(音声認識)でテキスト化し、発話内容をタイムスタンプ付きで添える。
- 3画像+テキストで解析させる
切り出した画像と文字起こしを、画像解釈に強いモデルに渡して内容を分析させる。
ネイティブ動画理解はGeminiやQwen3-VLのようなネイティブ対応のモデルを選べば、動画を渡すだけで始められます。ただしフレーム抽出パイプラインも「画像解釈が特に強いモデルを使いたい」「抽出の粒度を細かく制御したい」場面では依然有効で、両者は対立ではなく補完の関係にあります。
03.手段1|モデルAPIを直接使う(Gemini・GPT-5.5・Claude・Qwen3-VL)
1つ目の手段は、モデルのAPIを直接叩く方法です。プロンプト次第でなんでも聞ける柔軟さがある反面、動画ファイルをそのまま渡せるかどうかはモデルによって分かれます。まずは早見表で全体像を押さえ、詳細はモデルごとに見ていきます。
| モデル | 動画ファイル直接入力 | 映像+音声 | 立ち位置(対応尺の目安) |
|---|---|---|---|
| Gemini 3.1 Pro | ◎ ネイティブ対応 | ◎ 同時に処理 | 動画理解の本命。100万トークン窓で約1時間、低解像度なら約3時間 |
| GPT-5.5 | △ 直接は不可(テキスト・画像入力) | —(画像入力のみ) | 動画はフレーム抽出が前提。画像の読み取りは得意 |
| Claude(Opus 4.8 / Fable 5) | △ 直接は不可(フレーム抽出) | —(画像入力のみ) | 画像・スクリーンショットの解釈に強い |
| Qwen3-VL(オープンソース) | ◎ ネイティブ対応 | △ 映像のみ(音声は非対応) | 自社ホストの本命。長尺理解+発言箇所の時刻特定 |
◎はネイティブで動画ファイルを直接扱える、△は直接は読めずフレーム抽出などのひと手間が要る、という意味です。対応尺やトークン消費はモデルや解像度設定で変わるため、目安として捉えてください。
モデルAPIの利用は、動画を丸ごとトークンに変換して入力するため、問い合わせのたびに動画全体分のコストがかかります。料金の具体的な目安はFAQでまとめています。
Gemini 3.1 Pro|動画ファイル解析の本命
Geminiは、設計段階から映像・音声・テキストを同時に扱うことを前提にしたモデルで、公式ドキュメントのとおり動画をファイルのまま渡して、映像と音声をまとめて解析できます。「とりあえず動画を渡して中身を把握させたい」という最初の一歩として、もっとも素直に使えるモデルです。
GPT-5.5|入力は画像まで、動画はフレーム抽出が前提
OpenAIのGPT-5.5は、公式のモデルドキュメントによると入力がテキストと画像までで、動画・音声は入力として非対応です。そのため動画ファイルをそのまま渡すことはできず、扱うなら前章のフレーム抽出パイプラインで画像に分解する形になります。ChatGPTのアプリ上で動画を扱える場面も、内部的にはフレームを抜き出して解釈しています。画像の読み取り自体は強いので、動画から切り出したフレームの解析には使えますが、「動画を直接読む」用途では選択肢になりません。
Claude|動画は非対応だが画像・スクショ解釈に強い
Claude(Opus 4.8 / Fable 5)は、現状画像とPDFの入力に対応していますが、動画ファイルの直接入力には非対応です。動画を扱うなら、前章のフレーム抽出パイプラインで画像に分解して渡す形になります。
一方で、Claudeは画像・スクリーンショットの解釈に強く、グラフやダッシュボードのスクショから数値や傾向を読み取る用途で使えます。「動画そのもの」より「動画から切り出した画像」や「画面キャプチャ」を精密に解釈させたい場面で活きるモデルです。
Qwen3-VL|自社サーバーで動かせるオープンソースの本命
Qwen3-VLは、動画をネイティブに扱えるオープンソースのモデルです。長尺の動画理解と、特定の発言・場面が何分何秒に映っているかを言い当てる能力(temporal grounding)に強く、自社のサーバーで動かしてデータを外部に出さずに動画解析を完結させたいという要件に向きます。ただし読めるのは映像で、音声トラックの理解には対応していないため、発話内容も使いたい場合はASR(音声認識)の文字起こしを併用します。クラウドのAPIに比べて運用の手間はかかりますが、機密性を自社でコントロールしたい場合の有力な選択肢です。
ここまでの4モデルのうち、動画ファイルをそのまま渡せるのはGeminiとQwen3-VLだけです。GPT-5.5やClaudeでも動画解析を実現したい、あるいは1本ずつの質問ではなく大量の動画アーカイブを横断的に検索したいなら、次に紹介する動画特化サービスを使うことも検討してください。
04.手段2|動画特化のインデックス型サービスを使う(Twelve Labs)
2つ目の手段は、動画の解析そのものを専門に手がけるサービスを使う方法です。動画をアップロードすればインデックス化・検索・要約までこなす層で、Twelve Labsのような動画特化のインデックス型サービスから、次章で扱うクラウド大手の動画解析APIまで選択肢があります。まずは代表的な5サービスを、ロゴと料金の早見表で見渡します。
ここでは手段2のTwelve Labsに加え、手段3で扱うクラウド大手4サービスも合わせた計5サービスの料金とタイプを早見表で整理します。それぞれで何ができるかは、この後サービスごとに見ていきます。
| サービス | タイプ | 課金の単位 | 単価の目安 | 無料枠 |
|---|---|---|---|---|
| Twelve Labs | インデックス型 | 分単価+クエリ課金 | インデックス0.042ドル/分・検索4ドル/1,000クエリ | インデックス10時間分 |
| Azure AI Video Indexer | ハイブリッド型 | コンテンツの分数課金 | リージョン・プランごとに料金計算機で確認 | Web利用10時間・API利用40時間 |
| Bedrock Data Automation | ハイブリッド型 | 分単価 | 動画の標準出力0.050ドル/分 | — |
| Video Intelligence | 従来型の画像解析 | 分単価(機能ごと) | ラベル検出0.10ドル/分 | 月1,000分 |
| Amazon Rekognition Video | 従来型の画像解析 | 分単価(API種別ごと) | 保存動画の解析0.10ドル/分 | — |
単価はいずれも2026年7月時点の公式料金ページの値で、プラン・リージョンによって変わります。—の欄は、無料枠の最新条件を各料金ページで確認してください。
インデックス型サービスの課金は、「最初に分単価でインデックスを作り、以降はクエリ単価で検索する」構造です。一度インデックスを作れば、問い合わせのたびに動画全体を入力し直す必要がありません。同じ動画やアーカイブに何度も自然文で問い合わせたい場合に向く仕組みです。
Twelve Labs(インデックス型)|自然文でアーカイブの「場面」を探す
Twelve Labsは動画理解に特化した基盤モデルのプラットフォームで、検索用のMarengoと生成用のPegasusの2本立てです。最大の特徴は、「乾杯しているシーン」「製品ロゴが映る場面」のような話し言葉の一文で、大量の動画から該当の場面そのものを探し出せることです。キーワードやタグの一致ではなく意味で探すため、事前のタグ付け作業が要りません。
- 自然文でのシーン検索(Marengo):映像の動きだけでなく発話・効果音まで含めて検索し、該当区間を返す
- 要約・Q&A・キャプション生成(Pegasus):「この動画の要点を3行で」「子ども向けに言い換えて」のような自然文の指示で動画からテキストを生成
- テキスト・音声・画像・動画を横断する検索(any-to-any):画像を渡して「これに似た場面」を探す使い方も可能
- Amazon Bedrock経由でも利用でき、AWS上のパイプラインに組み込める
検索結果が「該当の区間」として返るため、報道・スポーツ・マーケティング素材のような、大量のアーカイブから場面を探し続ける運用に向きます。
05.手段3|クラウド大手の動画解析APIを使う(ハイブリッド型・従来型の画像解析)
3つ目の手段は、クラウド大手が提供する動画解析APIです。抽出結果をLLMに渡して要約まで生成するハイブリッド型(Azure AI Video Indexer・Bedrock Data Automation)と、判定結果をタイムスタンプ付きで返す従来型の画像解析(Video Intelligence・Rekognition)に分かれます。いずれも分単価の従量課金が中心で、上の早見表の単価が目安になります。
Azure AI Video Indexer(ハイブリッド型)|インサイト一括抽出+LLM要約
Azure AI Video Indexerは、動画をアップロードすると音声系・映像系のインサイトを一括で抽出し、公式ドキュメントのとおり抽出結果をLLM(Azure OpenAIやPhi)に渡して要約まで生成します。「映像・音声を解析して構造化してからLLMで生成する」という内部の構成を公表しているサービスです。
- 文字起こし(話者分離つき)・翻訳・音声イベント検出(音声系)
- OCR(画像内の文字認識)・物体検出・顔/有名人の認識(映像系)
- 抽出したインサイトをもとにしたLLM要約の生成
- インサイト一式をAPIで取得して自社システムに連携
字幕・アーカイブ管理・メタデータ整備のような、抽出したい項目が多いメディア系の用途に向きます。
Bedrock Data Automation(ハイブリッド型)|動画を定型JSONに変換する
Bedrock Data Automationは生成AIベースのETL(データを抽出・変換して別の形式で格納する処理)に相当するサービスで、動画を「決まった形のデータ」に変換することに特化しています。
- 標準出力:要約・チャプター分割・テキスト検出などを定型で生成
- ブループリント(あらかじめ定義した出力項目のテンプレート)を用意すると、動画からカスタムの定型JSONを直接出力
- ドキュメント・音声・画像・動画を同一のAPIで処理できる
抽出結果を基幹システムやデータ基盤へ流し込む用途で、自前のプロンプト設計と出力検証を丸ごと省けます。
Video Intelligence(従来型の画像解析)|タイムスタンプ付きメタデータの大量生成
Google Cloud Video Intelligenceは、動画の中身をタイムスタンプ付きの構造化メタデータとして返す従来型の画像解析のAPIです。
- ラベル検出・ショット検出(2万を超える物体・場所・動作を認識と公称)
- OCR・文字起こし(英語)
- 顔・人物検出、オブジェクトトラッキング
Cloud Storageと直結した非同期バッチが前提で、アーカイブの自動分類や検索基盤の内製に向きます。
Amazon Rekognition Video(従来型の画像解析)|モデレーションと顔検索
Amazon Rekognition Videoも従来型の画像解析のAPIで、判定系の機能がそろっています。
- ラベル検出・人物トラッキング
- 顔検出・顔検索(登録済みコレクションとの照合)
- 不適切コンテンツ検出(モデレーション)・テキスト検出
要約やQ&Aのような生成はできませんが、同じ入力に同じ出力が返る判定の一貫性があり、モデレーションや顔照合のように判定根拠の監査が求められる大量処理に向きます。動画ではなくテキストや静止画のモデレーションを組み込みたい場合は、無料で使える OpenAI Moderation API の仕組みと実装 も選択肢になります。
06.手段4|既製ツール同梱のAI機能を使う(Drive・Zoom等)
4つ目の手段は、Google DriveやNotebookLM、ZoomやTeamsといった普段使いのツールに組み込まれた機能をそのまま使う方法です。追加開発なしで手軽に使えますが、内部の仕組みには注意が必要です。
たとえばGoogle DriveのGemini連携は、公式のリリースノートに「利用には管理者が動画の字幕を有効にしている必要がある」と明記されています。NotebookLMも公式ヘルプで「YouTube動画はテキストの文字起こしのみをソースとして取り込む」としています。つまりこの層の多くは映像そのものではなく、字幕・文字起こしを読んでいます。発話のない画面共有の内容、テロップだけで示される情報、映像の動きは取りこぼされるため、「映像そのものの中身まで確認したい」用途では、動画ファイルを直接読めるモデルAPI(手段1)、自然文で問い合わせられる動画特化サービス(手段2)、あるいはOCR・物体検出で映像内容を構造化するクラウド大手のAPI(手段3)を検討してください。
- ✓ 映像にしか無い情報で検証する:テロップや画面共有だけに登場する情報を検証用の動画で質問し、そのサービスが映像まで見ているかを導入前に確かめる
- ✓ データの扱いを確認する:アップロード先のリージョン・保持期間・学習利用の有無まで見る。外部に出せない動画は自社ホストのモデルという選択肢もある
07.精度を左右する実践知見・サービスの評判
動画解析の精度を左右する主役は、フレームの枚数と音声(文字起こし)の扱いです。公開ベンチマークでの計測値を図解で見ると、効き方の大きさがわかります。
フレーム数と文字起こしで、正答率はここまで変わる
公開ベンチマークにおけるGPT-4oの正答率
- フレーム16枚LongVideoBench(900〜3,600秒の長尺動画)52.2%
- フレーム256枚60.9%
- 字幕(文字起こし)なしVideo-MME(動画全般)71.9%
- 字幕(文字起こし)併送77.2%
フレームを増やすほど精度が上がるのは高性能モデルの傾向で、LongVideoBenchの論文は、当時のオープンソースモデルが16枚を超えても改善できなかったことも報告しています。
- ✓ フレームのサンプリングによる取りこぼし:既定の1秒1フレームでは、一瞬だけ表示されるテロップや速い動きを取りこぼすことがある。Geminiの公式ドキュメントはクリップをスロー再生化する対処を案内しているほか、フレーム抽出パイプラインで間隔を細かくして補う方法もある
サービス側の精度を比べるうえで先に押さえたいのは、5サービスを横断して測った独立ベンチマークは2026年7月時点で見当たらず、精度の主張は提供元の公称値が中心という点です。その前提で、出典をたどれる評価を「提供元の公称」と「第三者の評価・所感」に分けて整理します。
| サービス | 提供元の公称(精度に関する主張) | 第三者の評価・所感 |
|---|---|---|
| Twelve Labs | 複数ベンチマークの複合で73%とし、Google Vertex(52%)等を上回ると公表。日本語を含む多言語ベンチの値も公表 | 独立の検証・主要レビューサイトの蓄積は確認できない(2026年7月時点) |
| Azure AI Video Indexer | 定量の精度値は非公表。公式のTransparency Noteが「同時発話時の精度低下」「音声品質への依存」などの制約を自己開示 | 独立の定量評価は確認できない(2026年7月時点)。文字起こしの精度は左記のとおり音声条件に左右される |
| Bedrock Data Automation | 「業界最高水準の精度」と主張(数値は非公表) | 新しいサービスでレビューの蓄積は確認できない。音声解析の日本語対応は2025年11月から |
| Video Intelligence | 2万を超える物体・場所・動作を認識できると公称(精度値は非公表) | 第三者の定量評価は確認できず、精度は自社データでの検証が前提 |
| Amazon Rekognition Video | 顔照合は「99%しきい値・85万件の照合で誤認識ゼロ」とする自社実験を公表 | ACLUの実験(2018年・既定しきい値80%)では連邦議会議員28人を逮捕写真と誤マッチ |
Rekognitionをめぐる公称と第三者実験の食い違いは、しきい値の設定の違いによるものです。どの値で運用するかで精度もリスクも変わるため、顔照合やモデレーションのような判定系を業務に使うときは、公称値や評判を参考にとどめ、自社の動画・自社の言語で小さく検証してから本採用するのが確実です。日本語のワークロードでは、対応言語と対応時期(Bedrock Data Automationのように日本語対応が新しいものがあります)もあわせて確認してください。
08.用途別の選び方
モデル・サービスどちらが正解かは、扱う動画と目的で変わります。代表的なケースで整理します。
| やりたいこと | 向いている選択 |
|---|---|
| 短い動画を手早く解析したい | Gemini。ファイルをそのまま渡せて、コストも軽い |
| 長尺の動画をまとめて扱いたい | Gemini。低解像度設定にすれば長尺も一度に扱える |
| データを外に出さず自社内で完結させたい | Qwen3-VLを自社ホスト。機密性とコストを自前で管理 |
| スクショや静止画を精密に読み取りたい | Claude。画像・画面キャプチャの解釈が強い |
| 大量のアーカイブから場面を検索したい | Twelve Labs等のインデックス型。繰り返すほどコストを抑えやすい |
| 動画を定型データ(JSON・タグ)に変換して流し込みたい | Bedrock Data AutomationかVideo Intelligence |
| モデレーション・顔照合を大量に回したい | Rekognition等の従来型の画像解析。判定の一貫性と監査性 |
| 会議録画の要約・議事録だけでよい | まずは会議ツール同梱のAI機能で試す |
ひとつのモデル・サービスにこだわらず、組み合わせるのも有効です。たとえば「動画全体の把握はGemini、大量アーカイブの検索はTwelve Labs、画面キャプチャの精密な読み取りはClaude」といった役割分担にすると、それぞれの得意分野を活かせます。
09.よくある質問(FAQ)
ChatGPT(GPT)で動画ファイルをそのまま解析できますか?
できません。APIのGPT-5.5は動画・音声の入力に対応しておらず、ChatGPTのアプリで動画を扱えるように見える場面も、フレームの切り出しによるものです。動画ファイルをそのまま解析したい場合は、ネイティブ対応のGeminiかQwen3-VLに切り替えるか、フレーム抽出パイプラインを組んで画像としてGPT-5.5に渡します。
Geminiで動画を解析するときの対応尺や料金の目安は?
Geminiは動画をネイティブに扱えます。公式ドキュメントによると、コンテキストウィンドウが100万トークンのモデルで、標準解像度なら約1時間、低解像度なら約3時間の動画まで処理できます。料金は動画の長さ(トークン量)に応じた従量制で、標準解像度で1秒あたり約300トークン、低解像度で約100トークンが目安です。数十秒の短い動画なら消費トークンはごくわずかで、コスト面の負担は小さく済みます。
YouTube動画も解析できますか?
Geminiは、公式ドキュメントのとおりYouTubeのURLを渡して解析する使い方に対応しています。一方、他のモデルで扱うときは、いったん動画をダウンロードし、ファイルとして渡すか、フレームを抜き出して画像として渡すのが基本です。著作権や利用規約の範囲で扱う点には注意してください。
モデルAPIとサービス、結局どちらが安いですか?
使い方で変わります。1本の動画に1回質問して終わりなら、モデルAPIの方が手軽で安く済むことが多いでしょう。同じ動画やアーカイブに何度も問い合わせる使い方では、動画を入力し直さずに検索できるTwelve Labsなどのインデックス型サービスの方がコストを抑えやすくなります。どちらも無料枠があるので、単発の動画で試すだけならモデルAPI、検索まで試したいならサービスの無料枠、と目的に合わせて選ぶとよいでしょう。
Twelve Labsとはどんなサービスですか?
動画理解に特化した基盤モデルを開発している企業・プラットフォームです。動画をアップロードしてインデックスを作ると、「乾杯しているシーン」のような自然文で場面を検索したり、要約やQ&Aを生成したりできます。料金はインデックス作成の分単価と検索のクエリ単位課金からなる従量制で、公式の料金ページで公開されています。Amazon Bedrock経由でもモデルが提供されています。
会議録画の要約だけなら、どれを選べばよいですか?
ZoomやTeamsなど、会議ツール同梱のAI機能でまず足りることが多いです(手段4)。ただし多くは文字起こしベースで映像そのものは見ていないため、画面共有の中身やデモの動きまで解析したい場合は手段1〜3(モデルAPI・動画特化サービス・クラウド大手API)を検討してください。
10.動画解析を業務に組み込む
動画解析の手段は一つに決め打ちする必要はありません。08章の早見表を起点に、扱う動画の量と「やりたいこと」に応じてモデルAPI・サービス・既製ツールを組み合わせるのが実務的です。
とはいえ、どの動画をどのモデル・サービスで解析し、フレーム抽出や音声の扱いをどう設計し、機密データをどう守るかは、業務や扱う情報によって変わります。弊社では、AIをフル活用した業務の仕組みづくりを、要件の整理からモデル・サービスの選定、実装・運用まで伴走して支援しています。動画解析やマルチモーダルAIをどう業務に組み込むかでお悩みの場合は、お気軽にご相談ください。
AIの業務活用を、実装まで伴走します
弊社では、AIをフル活用した業務の仕組みづくりを、要件整理からモデル・サービスの選定・実装・運用まで伴走して支援しています。動画解析やマルチモーダルAIの業務への組み込みでお悩みなら、無料相談からお気軽にどうぞ。

