AI × データ分析基礎知識集 / 全体像

データ分析でよく使うアルゴリズム・指標まとめ|類似度・一致度・モデル評価を用途別に整理


データ分析でよく使う指標は「何が知りたいか」で大きく3カテゴリに分かれます。本記事では、コサイン類似度・コーエンのカッパ係数(Cohen's Kappa)・F1スコア・ピアソン相関(Pearson)など代表的なアルゴリズムを、類似度/一致度/予測モデル評価の3つに整理し、用途別の早見表と各カテゴリの詳細記事への入り口をまとめます。BtoB の現場でデータ分析や AI(ChatGPT、Claude、Geminiなど)の品質計測に関わる方の地図として使えるよう、初学者でも追える粒度に絞りました。

公開2026.05.15
最終更新2026.06.11
読了 10 分 / 約4,800字
この記事をシェアポスト
AI × データ分析データ分析の指標を地図にする

データ分析の
アルゴリズム・指標まとめ

「コサイン類似度って結局なに?」「F1スコアと ROC-AUC、どう違うの?」「コーエンのカッパ係数(Cohen's Kappa)はどんなとき使う?」——データ分析や AI 品質の議論では、似た役割の指標が次々と登場します。1つずつ調べると断片化しやすいため、本記事ではよく使う指標を 「何を測りたいか」 で3カテゴリに整理しました。

C
結論
指標は「近さ」「揃い具合」「予測の正しさ」の3カテゴリで把握する

データ分析の指標は、(1) データ同士の類似度・距離、(2) 評価者やモデル同士の一致度・信頼性、(3) 予測モデルの正しさ、の3つに分かれます。先にカテゴリで地図を描いてから、個別の指標に降りると迷いません。

01.まず結論:指標は「目的」で3カテゴリに分かれる

指標の名前や数式から入ると、似たような指標が並んで混乱します。代わりに「自分はいま何を知りたいのか」を先に決めると、選ぶ指標は自然に絞れます。

知りたいことカテゴリ代表的な指標
2つのデータがどれくらい近いか類似度・距離コサイン類似度、ユークリッド距離、ジャッカード係数
評価者やモデルの判定がどれくらい揃っているか一致度・信頼性Cohen's Kappa(コーエンのカッパ係数)、Fleiss' Kappa(フライスのカッパ係数)、ICC(級内相関係数)
分類・回帰モデルがどれくらい当たっているか予測モデル評価適合率(Precision)・再現率(Recall)・F1スコア、ROC-AUC、平均絶対誤差(MAE)・RMSE・決定係数(R²)、ピアソン相関(Pearson)・スピアマン相関(Spearman)

02.図解:データ分析の指標マップ

3カテゴリと、その下にぶら下がる代表指標を 1 枚にまとめると、次のような地図になります。本記事では各カテゴリの「考え方」だけを紹介し、個別指標の数式や使い分けは別記事で扱います。

図:データ分析の指標マップ(目的別の3カテゴリ)

「何を測りたいか」で3つに分かれます。各カテゴリの代表指標は本記事下部の関連記事で詳しく扱います。

何を測りたいか?

CATEGORY 01

類似度・距離

データ同士の「近さ」を測る

  • ・コサイン類似度
  • ・ユークリッド距離
  • ・マンハッタン距離
  • ・ジャッカード係数

CATEGORY 02

一致度・信頼性

判定の「揃い具合」を測る

  • ・コーエンのカッパ係数(Cohen's Kappa)
  • ・フライスのカッパ係数(Fleiss' Kappa)
  • ・級内相関係数(ICC)

CATEGORY 03

予測モデル評価

予測の「正しさ」を測る

  • ・適合率・再現率・F1スコア
  • ・ROC-AUC・混同行列
  • ・平均絶対誤差(MAE)・RMSE・決定係数(R²)
  • ・ピアソン相関・スピアマン相関

目的が決まれば、選ぶ指標は自然に絞れる

03.カテゴリ別の概要と関連記事

各カテゴリは「測りたい対象」が違うだけで、上下関係はありません。プロジェクトの目的に応じて 1〜3 カテゴリを併用するのが普通です。

04.用途別の早見表

「いま手元のデータで何を計測すべきか」が決まっていれば、次の表から逆引きできます。

やりたいこと向いている指標・手法メモ
RAG や検索で「意味が近い文書」を取りたいコサイン類似度テキスト埋め込みなど、向きが意味を持つベクトルに最適
アンケート回答や購買履歴で「似ているユーザー」を探すユークリッド距離、マンハッタン距離数値の絶対差に意味があるときに使う
タグ集合・キーワード集合の重なりを比較ジャッカード係数集合の重複検知・重複コンテンツ判定に有効
アノテーターやモデルの判定が揃っているか確かめるCohen's Kappa(コーエンのカッパ係数)、Fleiss' Kappa(フライスのカッパ係数)偶然の一致を差し引いて評価できる
スコアを 1〜10 で付ける評価者の安定性を見るICC(級内相関係数)連続値の評価者間信頼性に向く
「離反する顧客」を分類するモデルの良し悪し適合率(Precision)・再現率(Recall)・F1スコア、ROC-AUC不均衡データなら PR-AUC や MCC(マシューズ相関係数)も併用
需要予測の精度を確かめる平均絶対誤差(MAE)・RMSE・決定係数(R²)外れ値の影響を見たいなら MAE と RMSE を併記
2 つの数値が連動しているか確かめるピアソン相関(Pearson)・スピアマン相関(Spearman)直線関係ならピアソン、順位関係ならスピアマン
Search Console データで CTR や記事の鮮度低下を読む順位別期待 CTR・4 象限分析・中央値曲線比較詳細は『SEO 分析の統計入門』(095)
A/B テストを設計してサンプルサイズを決めたいMDE・検出力・カイ二乗検定・t 検定詳細は『A/B テスト設計の基礎』(096)
SEO 流入や売上の時系列をトレンドと季節性に分けたいSTL 分解・移動平均・YoY/MoM 補正詳細は『時系列分析の基礎』(097)
コホート別にリテンションと顧客生涯価値を測りたいコホート分析・Kaplan-Meier・LTV/CAC詳細は『コホート分析・リテンション・LTV』(101)
A/B テストできない施策の効果を観察データで測りたい差分の差分・傾向スコアマッチング詳細は『A/B テストできない施策の効果測定』(102)
ラストクリックを卒業して広告予算を最適配分したいマルチタッチアトリビューション・マーケティングミックスモデリング詳細は『アトリビューション分析と MMM の基礎』(103)
LP やバナーを動的に最適化したいイプシロン貪欲法・信頼上限法・トンプソン抽出詳細は『バンディット・適応的最適化』(104)
要因の寄与を係数として分解したい単回帰・重回帰・ロジスティック回帰・対数変換・Ridge / Lasso詳細は『回帰分析の基礎』(105)
i
使い分けのコツ
単一指標で判断しない。最低2つ並べて読む

指標は1つだけ見ると、特定の偏りを見落とします。例えば分類モデルは正解率(Accuracy)だけ高くても、少数クラスを全く拾えていない場合があります。適合率(Precision)と再現率(Recall)、または F1スコアと PR-AUC のように、性格の違う指標を最低2つ並べて読むのが基本です。

i
無料ツール
代表的な分析はブラウザでそのまま試せます

データを貼り付けるだけで使える無料ツールを公開しています。平均・標準偏差・四分位数とヒストグラムは基本統計量の計算ツール、2変数の関係(散布図・回帰直線・相関係数)は単回帰分析ツール、時系列のトレンド予測は簡易未来予測ツールで確認できます。

05.SEO効果分析への応用

SEOの効果分析も、データ分析の考え方をそのまま使います。Search Console の表示回数・CTR・平均掲載順位、GA4 の CVR、BigQuery に蓄積した長期データを、単発の数字ではなく時系列・セグメント・施策前後で読み分けると、記事やサイト改善の判断が安定します。

06.よくある質問(FAQ)

指標は1つだけ見れば十分ですか?

通常は不十分です。分類モデルなら適合率(Precision)と再現率(Recall)、回帰モデルなら平均絶対誤差(MAE)と RMSE のように、見ている観点が違う指標を最低 2 つ並べて読むのが基本です。1 つの指標は 1 つの観点しか映さないため、特定の偏り(例: 少数クラスを全く拾えていない)を見落とします。

コサイン類似度とユークリッド距離はどちらを使えばいいですか?

ベクトルの「向き」が意味を持つときはコサイン類似度、絶対的な「距離」が意味を持つときはユークリッド距離が向きます。テキスト埋め込みのように長さがバラバラなベクトルではコサイン類似度が定番で、座標上の物理的な近さを測るときはユークリッド距離が自然です。詳細は 類似度・距離の指標の記事で扱っています。

カッパ係数は何のために使うのですか?

2 人以上の評価者の判定が、偶然の一致を差し引いてどれくらい揃っているかを測るために使います。アノテーション品質のチェック、AI(ChatGPT、Claude、Geminiなど)の出力と人間の判定の整合性を確認するときに使われます。詳細は 一致度・信頼性の指標の記事で扱っています。

Accuracy(正解率)だけ高ければ良いモデルですか?

不均衡データではほとんど役に立ちません。99% が陰性のデータで全て陰性と答えれば正解率(Accuracy)は 99% になりますが、本当に検出したい陽性は 1 件も拾えていません。F1スコア、適合率(Precision)、再現率(Recall)、ROC-AUC、MCC(マシューズ相関係数)など、不均衡に強い指標と併用するのが基本です。

数式まで覚えないとデータ分析の指標は使えませんか?

実務で使うだけなら数式の暗記は不要です。「何を測る指標か」「どんなときに高く出やすいか」「どんなときに過大評価しやすいか」を理解し、計算は scikit-learn など既存のライブラリに任せれば実用上は十分です。

07.まとめ

データ分析で出てくる指標は数が多く見えますが、「何を測りたいか」で 3 カテゴリに分けると一気に整理できます。類似度・距離はデータ同士の近さ、一致度・信頼性は評価者やモデル同士の揃い具合、予測モデル評価は予測の正しさを測る、と覚えるのが近道です。

個別の指標は 類似度・一致度・予測モデル評価 の 3 本で詳しく扱っています。実務で「これをどう測るか」「どう分析するか」が決まっている場面は、上の早見表から SEO 分析・A/B テスト・時系列・コホート/LTV・因果推論・アトリビューション/MMM・バンディット・回帰分析の手順記事に飛んでください。

お問い合わせ

AI とデータ分析の評価設計を社内で整えませんか

AI 出力や業務データの品質計測、KPI 設計、社内向けのデータ分析運用のご相談を承っています。お気軽にお問い合わせください。

お問い合わせはこちら

データ分析・アルゴリズム 基礎知識集

一覧に戻る →
01

全体像とカテゴリ早見

  • ›データ分析のアルゴリズム・指標まとめ(この記事)
07

モデル構築の自動化

この記事をシェア
澤田 翔太(Shota Sawada)
この記事を書いた人

澤田 翔太

株式会社クリプタル 代表取締役

1988年生まれ、慶應義塾大学卒。創業メンバーとして関わった株式会社セールスサポートを株式会社ネオマーケティング(東証STD 4196)に売却。株式会社クリプタルでも複数の事業立ち上げと売却を経験し、2022年9月には婚活・恋愛メディア「シッテク」「婚活会議」を株式会社ベビーカレンダー(東証GRT 7363)へ売却。現在はAI業務支援事業、TANTOU事業、グロースハック支援事業、メディア事業、SEOコンサルティング事業を手がける。