AI × データ分析基礎知識集 / 一致度・信頼性

一致度・信頼性の指標と使い分け|Cohen's Kappa・Fleiss' Kappa・ICC


Cohen's Kappa(コーエンのカッパ係数)・Fleiss' Kappa(フライスのカッパ係数)・ICC(級内相関係数)・Krippendorff's Alpha(クリッペンドルフのアルファ係数)は、複数の評価者やモデルの判定がどれくらい揃っているかを測るための指標です。アンケートのアノテーション品質、AI(ChatGPT、Claude、Geminiなど)と人間の判定の整合性を確認するときに使います。本記事では、なぜ単純な一致率では足りないのか、4つの指標をどう使い分けるかを、図解とともに初学者向けに整理します。

公開2026.05.15
最終更新2026.05.15
読了 12 分 / 約5,400字
この記事をシェアポスト
AI × データ分析判定の「揃い具合」を測る

一致度・信頼性の
指標の使い分け

アンケート回答のラベル付け、AI 出力の品質チェック、社内の問い合わせカテゴリ分類——人間や AI(ChatGPT、Claude、Geminiなど)が判定を行う場面では、必ず「ばらつき」が出ます。複数の評価者で同じ基準で判定できているかを確かめないと、データの信頼性そのものが揺らぎます。

C
結論
単純な一致率ではなく、偶然の一致を差し引いた指標を使う

評価の揃い具合は、単純な「一致率」だけで判断すると過大評価になります。Cohen's Kappa(コーエンのカッパ係数)(2人)、Fleiss' Kappa(フライスのカッパ係数)(3人以上)、ICC(級内相関係数)(連続値スコア)など、偶然の一致を差し引いた指標で測るのが基本です。

01.まず結論:単純な一致率では不十分

「2 人の評価者が同じ判定をした割合」をそのまま使うと、偶然の一致まで含めてしまいます。例えば 2 値分類(はい/いいえ)で 2 人がランダムに答えても、50% は偶然一致します。一致率 80% といっても、その内訳が「実力で 60%、偶然で 20%」なのか「実力で 80%」なのかが分かりません。

この問題を解くため、本記事で扱う 4 つの指標はすべて「偶然どれくらい一致するか」を差し引いてから、評価者の本当の合意度を測るように設計されています。

02.4つの主要な指標を概観

実務でよく使う一致度・信頼性の指標は、対応する評価者数とデータの型で使い分けます。それぞれ役割が違うので、優劣ではなく場面で選びます。

METRIC 01

Cohen's Kappa

コーエンのカッパ係数

2 人の評価者でカテゴリ判定を行うときの一致度。偶然の一致を差し引いて -1〜1 で表現。cohen_kappa_score で計算可。

METRIC 02

Fleiss' Kappa

フライスのカッパ係数

3 人以上の評価者でカテゴリ判定を行うときの一致度。Cohen's の多人数版で、複数の LLM 同士の比較などに使う。

METRIC 03

ICC

級内相関係数(Intraclass Correlation Coefficient)

1〜10 のスコアなど連続値・順序値で評価者間の信頼性を測る。LLM-as-Judge のスコアの安定性確認に向く。

METRIC 04

Krippendorff's Alpha

クリッペンドルフのアルファ係数

評価者数・尺度・欠損が混在する複雑な状況で使える汎用指標。アノテーション品質評価のデファクト。

状況向く指標ひとこと
2人の評価者でカテゴリを判定(例:はい/いいえ)Cohen's Kappaもっとも基本的な一致度指標
3人以上の評価者でカテゴリを判定Fleiss' KappaCohen's の多人数版
1〜10 などの連続スコアの評価者を比較ICC(級内相関係数)順序・連続値に対応
順序尺度の評価(例:1〜5の満足度)Weighted Kappa(重み付きカッパ)近い値の不一致を「軽い不一致」として扱う
欠損や順序・連続値が混ざる複雑な状況Krippendorff's Alphaアノテーション品質評価のデファクト

どれも目的は同じで、「偶然や尺度の歪みを差し引いて、本当の合意度を測る」ことです。Cohen's Kappa の式は κ = (po - pe) / (1 - pe) で、観測一致率 po から偶然一致率 pe を差し引きます。実装は Python の sklearn / statsmodels / krippendorff で揃っているため、数式を覚えなくても実用可能です。

03.値の解釈レンジ(共通の目安)

いずれの指標も値そのままでは「これは良い数字なのか」が分かりにくいので、Landis & Koch (1977) の解釈基準が広く使われます。Cohen's Kappa を起点に Fleiss' Kappa・ICC でも同じレンジで読まれることが多い目安です。

図:一致度指標の値の解釈レンジ(Landis & Koch 1977 基準)

Cohen's Kappa を起点に Fleiss' Kappa・ICC でも実務的に同じレンジで読まれることが多い目安。

値(-1 〜 1)偶然以下わずか弱い中程度高いほぼ完全-100.20.40.60.81実務目安:0.6 以上で「使える」、0.8 以上で「信頼できる」0 を下回るのは「偶然より一致しない」= 評価基準が共有できていないサイン
i
実務上の目安
アノテーション品質は 0.6 以上を目安に

BtoB の業務データや AI 評価データを扱う場面では、0.6 以上(「高い」レンジ)を作業の最低ラインに置くチームが多い印象です。0.4 を下回ったら、評価基準やラベル定義をそのまま使うのではなく、ガイドライン整備や評価者トレーニングのフェーズに戻すことを検討します。

04.実務での使い分けと注意点

一致度指標を使うときに、初学者が引っかかりやすいポイントを整理します。

!
ハマりやすいポイント
不均衡データに弱い(Kappa Paradox)

カテゴリの分布が極端に偏っているとき(例:99% が「はい」、1% が「いいえ」)、Cohen's Kappa や Fleiss' Kappa は一致率が高くても低く出ることがあります。これは「Kappa paradox」と呼ばれる現象で、式が pe(偶然の一致率)に強く依存するために起こります。不均衡データでは Precision/Recall や混同行列も併用して全体像を見るのが安全です。

注意点中身対処
サンプル数が少ない信頼区間が広くなり、評価が不安定Bootstrap で 95% CI を併記する
カテゴリ分布が偏っているKappa paradox が起きる別指標(F1、MCC など)と併用
順序尺度を Cohen's Kappa で見ている近い値の不一致を「完全な不一致」と扱ってしまうWeighted Kappa か ICC に切り替える
LLM judge の自己一致を測っている同一プロンプトでも値が揺れる複数回サンプルして、温度を下げ、評価順序をランダム化
i
AI 評価での使いどころ
LLM-as-Judge と人間評価の整合性確認に使う

AI 出力を別の LLM で評価する LLM-as-Judge では、人間の評価と LLM judge の評価の一致度(Cohen's Kappa など)を取り、「LLM judge が人間と同じ基準で見えているか」を確認するのが定番です。値が低ければ判定基準そのものを書き直すサインで、一定以上に保てるまではプロダクション運用しない、という運用ラインが分かりやすくなります。

05.実装例(scikit-learn ほか)

4 つの指標とも Python ライブラリで 1 行で計算できます。Cohen's Kappa は scikit-learn、Fleiss' Kappa は statsmodels、ICC は pingouin、Krippendorff's Alpha は krippendorff パッケージを使うのが定番です。

# Cohen's Kappa(コーエンのカッパ係数):2人の評価者
from sklearn.metrics import cohen_kappa_score
y1 = [1, 0, 1, 1, 0]
y2 = [1, 0, 0, 1, 0]
cohen_kappa_score(y1, y2)     # → 約 0.615

# Fleiss' Kappa(フライスのカッパ係数):3人以上
import numpy as np
from statsmodels.stats.inter_rater import fleiss_kappa
# rows=items, cols=各カテゴリに何人が投票したか
ratings = np.array([[2, 0], [1, 1], [0, 2], [2, 0]])
fleiss_kappa(ratings)         # → 約 0.467

# ICC(級内相関係数):連続値スコアの評価者間信頼性
import pandas as pd
import pingouin as pg
df = pd.DataFrame({
    "item":   [1, 1, 2, 2, 3, 3],
    "rater":  ["A", "B", "A", "B", "A", "B"],
    "score":  [4.0, 4.5, 3.0, 3.2, 5.0, 4.8],
})
pg.intraclass_corr(data=df, targets="item", raters="rater", ratings="score")

# Krippendorff's Alpha(クリッペンドルフのアルファ係数):欠損ありOK
import krippendorff
data = [[1, 1, 0, np.nan], [1, 1, 0, 0]]
krippendorff.alpha(reliability_data=data, level_of_measurement="nominal")

どの関数も値域は -1〜1(あるいは 0〜1)で、本記事 03 章のレンジで読みます。値が低いときは評価基準・ガイドラインの見直しから入るのが定石です。

06.よくある質問(FAQ)

単純な一致率(Accuracy)ではダメな理由は何ですか?

単純な一致率は、偶然の一致まで含めてしまうため、評価者の本当の合意度を過大評価します。例えば 2 択でランダムに答えても 50% は偶然一致します。Cohen's Kappa は「偶然の一致率」を差し引くことで、評価者が実力として揃っているかどうかを取り出します。

Cohen's Kappa が低いとき、どう改善すれば良いですか?

多くの場合、ラベル定義の曖昧さ、評価者トレーニング不足、サンプルの偏り、尺度の不一致が原因です。低 Kappa が出たケースを 10〜20 件持ち寄り、評価者ごとに判定理由を共有し、ガイドラインを具体例つきで書き直すと改善することが多いです。改善後に再計測して Kappa が伸びるかで効果を確認します。

Kappa の値はどれくらいあれば「合格」ですか?

Landis & Koch (1977) の解釈基準では、0.6 以上が「高い」、0.8 以上が「ほぼ完全」とされます。一般的な BtoB データ分析やアノテーションでは 0.6 以上を最低ラインに置くチームが多く、医療・法務・金融など影響の大きい領域では 0.8 以上が要求されることもあります。

AI 出力の評価でも Kappa を使えますか?

使えます。人間の評価者のラベルと AI(ChatGPT、Claude、Geminiなど)の出力の Kappa を取れば、「AI が人間と同じ基準で見えているか」を測れます。LLM-as-Judge と人間の Kappa が一定以上で安定するまで、AI の評価結果を本番運用しない、というラインを引けます。

ICC と Kappa はどう使い分けますか?

Kappa はカテゴリ判定(はい/いいえ、A/B/C)の一致度に使い、ICC は 1〜10 のスコアなど連続値・順序値の評価者間信頼性に使います。順序尺度(例:1〜5 の満足度)で「近い値の不一致は軽く扱いたい」場合は Weighted Kappa が選択肢になります。

07.まとめ

評価者やモデルの判定が揃っているかを測るときは、単純な一致率ではなく、評価者数とデータの型で Cohen's Kappa(コーエンのカッパ係数)(2 人)・Fleiss' Kappa(フライスのカッパ係数)(3 人以上)・ICC(級内相関係数)(連続値)・Krippendorff's Alpha(クリッペンドルフのアルファ係数)(複雑な状況)を使い分け、偶然の一致を差し引いて評価します。実務では 0.6 以上を目安に、アノテーションガイドラインや評価基準を整える材料として読みます。

Kappa paradox など独特の落とし穴があるため、不均衡データでは他の指標(F1・MCC など)と併用します。詳しい予測モデルの評価指標は次の記事で扱います。

お問い合わせ

アノテーション品質や AI 評価の設計をご相談ください

社内データのアノテーション設計、AI 出力の評価指標と運用ラインの設計を伴走支援しています。お気軽にお問い合わせください。

お問い合わせはこちら

データ分析・アルゴリズム 基礎知識集

一覧に戻る →
07

モデル構築の自動化

この記事をシェア
澤田 翔太(Shota Sawada)
この記事を書いた人

澤田 翔太

株式会社クリプタル 代表取締役

1988年生まれ、慶應義塾大学卒。創業メンバーとして関わった株式会社セールスサポートを株式会社ネオマーケティング(東証STD 4196)に売却。株式会社クリプタルでも複数の事業立ち上げと売却を経験し、2022年9月には婚活・恋愛メディア「シッテク」「婚活会議」を株式会社ベビーカレンダー(東証GRT 7363)へ売却。現在はAI業務支援事業、TANTOU事業、グロースハック支援事業、メディア事業、SEOコンサルティング事業を手がける。