一致度・信頼性の
指標の使い分け
アンケート回答のラベル付け、AI 出力の品質チェック、社内の問い合わせカテゴリ分類——人間や AI(ChatGPT、Claude、Geminiなど)が判定を行う場面では、必ず「ばらつき」が出ます。複数の評価者で同じ基準で判定できているかを確かめないと、データの信頼性そのものが揺らぎます。
評価の揃い具合は、単純な「一致率」だけで判断すると過大評価になります。Cohen's Kappa(コーエンのカッパ係数)(2人)、Fleiss' Kappa(フライスのカッパ係数)(3人以上)、ICC(級内相関係数)(連続値スコア)など、偶然の一致を差し引いた指標で測るのが基本です。
01.まず結論:単純な一致率では不十分
「2 人の評価者が同じ判定をした割合」をそのまま使うと、偶然の一致まで含めてしまいます。例えば 2 値分類(はい/いいえ)で 2 人がランダムに答えても、50% は偶然一致します。一致率 80% といっても、その内訳が「実力で 60%、偶然で 20%」なのか「実力で 80%」なのかが分かりません。
この問題を解くため、本記事で扱う 4 つの指標はすべて「偶然どれくらい一致するか」を差し引いてから、評価者の本当の合意度を測るように設計されています。
02.4つの主要な指標を概観
実務でよく使う一致度・信頼性の指標は、対応する評価者数とデータの型で使い分けます。それぞれ役割が違うので、優劣ではなく場面で選びます。
METRIC 01
Cohen's Kappa
コーエンのカッパ係数
2 人の評価者でカテゴリ判定を行うときの一致度。偶然の一致を差し引いて -1〜1 で表現。cohen_kappa_score で計算可。
METRIC 02
Fleiss' Kappa
フライスのカッパ係数
3 人以上の評価者でカテゴリ判定を行うときの一致度。Cohen's の多人数版で、複数の LLM 同士の比較などに使う。
METRIC 03
ICC
級内相関係数(Intraclass Correlation Coefficient)
1〜10 のスコアなど連続値・順序値で評価者間の信頼性を測る。LLM-as-Judge のスコアの安定性確認に向く。
METRIC 04
Krippendorff's Alpha
クリッペンドルフのアルファ係数
評価者数・尺度・欠損が混在する複雑な状況で使える汎用指標。アノテーション品質評価のデファクト。
| 状況 | 向く指標 | ひとこと |
|---|---|---|
| 2人の評価者でカテゴリを判定(例:はい/いいえ) | Cohen's Kappa | もっとも基本的な一致度指標 |
| 3人以上の評価者でカテゴリを判定 | Fleiss' Kappa | Cohen's の多人数版 |
| 1〜10 などの連続スコアの評価者を比較 | ICC(級内相関係数) | 順序・連続値に対応 |
| 順序尺度の評価(例:1〜5の満足度) | Weighted Kappa(重み付きカッパ) | 近い値の不一致を「軽い不一致」として扱う |
| 欠損や順序・連続値が混ざる複雑な状況 | Krippendorff's Alpha | アノテーション品質評価のデファクト |
どれも目的は同じで、「偶然や尺度の歪みを差し引いて、本当の合意度を測る」ことです。Cohen's Kappa の式は κ = (po - pe) / (1 - pe) で、観測一致率 po から偶然一致率 pe を差し引きます。実装は Python の sklearn / statsmodels / krippendorff で揃っているため、数式を覚えなくても実用可能です。
03.値の解釈レンジ(共通の目安)
いずれの指標も値そのままでは「これは良い数字なのか」が分かりにくいので、Landis & Koch (1977) の解釈基準が広く使われます。Cohen's Kappa を起点に Fleiss' Kappa・ICC でも同じレンジで読まれることが多い目安です。
図:一致度指標の値の解釈レンジ(Landis & Koch 1977 基準)
Cohen's Kappa を起点に Fleiss' Kappa・ICC でも実務的に同じレンジで読まれることが多い目安。
BtoB の業務データや AI 評価データを扱う場面では、0.6 以上(「高い」レンジ)を作業の最低ラインに置くチームが多い印象です。0.4 を下回ったら、評価基準やラベル定義をそのまま使うのではなく、ガイドライン整備や評価者トレーニングのフェーズに戻すことを検討します。
04.実務での使い分けと注意点
一致度指標を使うときに、初学者が引っかかりやすいポイントを整理します。
カテゴリの分布が極端に偏っているとき(例:99% が「はい」、1% が「いいえ」)、Cohen's Kappa や Fleiss' Kappa は一致率が高くても低く出ることがあります。これは「Kappa paradox」と呼ばれる現象で、式が pe(偶然の一致率)に強く依存するために起こります。不均衡データでは Precision/Recall や混同行列も併用して全体像を見るのが安全です。
| 注意点 | 中身 | 対処 |
|---|---|---|
| サンプル数が少ない | 信頼区間が広くなり、評価が不安定 | Bootstrap で 95% CI を併記する |
| カテゴリ分布が偏っている | Kappa paradox が起きる | 別指標(F1、MCC など)と併用 |
| 順序尺度を Cohen's Kappa で見ている | 近い値の不一致を「完全な不一致」と扱ってしまう | Weighted Kappa か ICC に切り替える |
| LLM judge の自己一致を測っている | 同一プロンプトでも値が揺れる | 複数回サンプルして、温度を下げ、評価順序をランダム化 |
AI 出力を別の LLM で評価する LLM-as-Judge では、人間の評価と LLM judge の評価の一致度(Cohen's Kappa など)を取り、「LLM judge が人間と同じ基準で見えているか」を確認するのが定番です。値が低ければ判定基準そのものを書き直すサインで、一定以上に保てるまではプロダクション運用しない、という運用ラインが分かりやすくなります。
05.実装例(scikit-learn ほか)
4 つの指標とも Python ライブラリで 1 行で計算できます。Cohen's Kappa は scikit-learn、Fleiss' Kappa は statsmodels、ICC は pingouin、Krippendorff's Alpha は krippendorff パッケージを使うのが定番です。
# Cohen's Kappa(コーエンのカッパ係数):2人の評価者
from sklearn.metrics import cohen_kappa_score
y1 = [1, 0, 1, 1, 0]
y2 = [1, 0, 0, 1, 0]
cohen_kappa_score(y1, y2) # → 約 0.615
# Fleiss' Kappa(フライスのカッパ係数):3人以上
import numpy as np
from statsmodels.stats.inter_rater import fleiss_kappa
# rows=items, cols=各カテゴリに何人が投票したか
ratings = np.array([[2, 0], [1, 1], [0, 2], [2, 0]])
fleiss_kappa(ratings) # → 約 0.467
# ICC(級内相関係数):連続値スコアの評価者間信頼性
import pandas as pd
import pingouin as pg
df = pd.DataFrame({
"item": [1, 1, 2, 2, 3, 3],
"rater": ["A", "B", "A", "B", "A", "B"],
"score": [4.0, 4.5, 3.0, 3.2, 5.0, 4.8],
})
pg.intraclass_corr(data=df, targets="item", raters="rater", ratings="score")
# Krippendorff's Alpha(クリッペンドルフのアルファ係数):欠損ありOK
import krippendorff
data = [[1, 1, 0, np.nan], [1, 1, 0, 0]]
krippendorff.alpha(reliability_data=data, level_of_measurement="nominal")どの関数も値域は -1〜1(あるいは 0〜1)で、本記事 03 章のレンジで読みます。値が低いときは評価基準・ガイドラインの見直しから入るのが定石です。
06.よくある質問(FAQ)
単純な一致率(Accuracy)ではダメな理由は何ですか?
単純な一致率は、偶然の一致まで含めてしまうため、評価者の本当の合意度を過大評価します。例えば 2 択でランダムに答えても 50% は偶然一致します。Cohen's Kappa は「偶然の一致率」を差し引くことで、評価者が実力として揃っているかどうかを取り出します。
Cohen's Kappa が低いとき、どう改善すれば良いですか?
多くの場合、ラベル定義の曖昧さ、評価者トレーニング不足、サンプルの偏り、尺度の不一致が原因です。低 Kappa が出たケースを 10〜20 件持ち寄り、評価者ごとに判定理由を共有し、ガイドラインを具体例つきで書き直すと改善することが多いです。改善後に再計測して Kappa が伸びるかで効果を確認します。
Kappa の値はどれくらいあれば「合格」ですか?
Landis & Koch (1977) の解釈基準では、0.6 以上が「高い」、0.8 以上が「ほぼ完全」とされます。一般的な BtoB データ分析やアノテーションでは 0.6 以上を最低ラインに置くチームが多く、医療・法務・金融など影響の大きい領域では 0.8 以上が要求されることもあります。
AI 出力の評価でも Kappa を使えますか?
使えます。人間の評価者のラベルと AI(ChatGPT、Claude、Geminiなど)の出力の Kappa を取れば、「AI が人間と同じ基準で見えているか」を測れます。LLM-as-Judge と人間の Kappa が一定以上で安定するまで、AI の評価結果を本番運用しない、というラインを引けます。
ICC と Kappa はどう使い分けますか?
Kappa はカテゴリ判定(はい/いいえ、A/B/C)の一致度に使い、ICC は 1〜10 のスコアなど連続値・順序値の評価者間信頼性に使います。順序尺度(例:1〜5 の満足度)で「近い値の不一致は軽く扱いたい」場合は Weighted Kappa が選択肢になります。
07.まとめ
評価者やモデルの判定が揃っているかを測るときは、単純な一致率ではなく、評価者数とデータの型で Cohen's Kappa(コーエンのカッパ係数)(2 人)・Fleiss' Kappa(フライスのカッパ係数)(3 人以上)・ICC(級内相関係数)(連続値)・Krippendorff's Alpha(クリッペンドルフのアルファ係数)(複雑な状況)を使い分け、偶然の一致を差し引いて評価します。実務では 0.6 以上を目安に、アノテーションガイドラインや評価基準を整える材料として読みます。
Kappa paradox など独特の落とし穴があるため、不均衡データでは他の指標(F1・MCC など)と併用します。詳しい予測モデルの評価指標は次の記事で扱います。
データ分析でよく使うアルゴリズム・指標まとめ
類似度・一致度・予測モデル評価の3カテゴリで指標を整理した総合解説です。
予測モデルの評価指標とは(分類・回帰・相関)
F1・ROC-AUC・MAE・RMSE・Pearsonなど予測モデルの代表指標を整理します。
アノテーション品質や AI 評価の設計をご相談ください
社内データのアノテーション設計、AI 出力の評価指標と運用ラインの設計を伴走支援しています。お気軽にお問い合わせください。
データ分析・アルゴリズム 基礎知識集
一覧に戻る →全体像とカテゴリ早見
データの可視化
個別指標カテゴリ
- ›類似度・距離の指標の使い分け
- ›一致度・信頼性の指標の使い分け(この記事)
- ›予測モデル評価の指標と使い分け
- ›適合率と再現率|しきい値で見逃しと空振りを調整する
- ›確率較正(キャリブレーション)の基礎|事後較正・Vertex AI

