統計的仮説検定の基礎
p値・過誤・信頼区間
A/Bテストの「勝ち負け」、施策の効果測定、回帰分析の係数――データ分析で出てくる結論は、ほぼ例外なく「観測した差が偶然で説明できるか」を判定する統計的仮説検定の上に成り立っています。p値や有意差という言葉は日常的に使われますが、その意味を取り違えたまま運用すると、偶然のノイズを「成果」と誤読してしまいます。
仮説検定は、まず「差はない」(帰無仮説)と仮定し、その仮定のもとで観測データがどれだけ起こりにくいか(p値)を計算します。p値が事前に決めた有意水準α(通常0.05)より小さければ、帰無仮説を棄却して「差がある」と判断します。判定には2種類の誤り――第一種の過誤(差がないのに「ある」とする偽陽性)と第二種の過誤(差があるのに見逃す偽陰性)――が常に伴います。p値だけでなく効果量と信頼区間を併記し、「統計的に有意」と「実務的に意味のある差」を切り分けることが、検定を実務で使ううえでの要点です。
01.まず結論:仮説検定は『観測した差が偶然か』を判定する手続き
手元のデータで「B群の方がCVRが0.7pt高い」と分かったとします。問題は、その0.7ptが本当の差なのか、それともたまたまサンプルがそう出ただけなのかを切り分けられないことです。仮説検定は、この切り分けを行うための標準的な手続きで、4つのステップに分解できます。
図:仮説検定は「差がない」と仮定して矛盾を探す4ステップ
仮説検定は背理法に似ています。「差はない」と仮定し、その仮定のもとで観測データが珍しすぎる(p値が小さい)なら、最初の仮定の方が間違っていたと結論します。
STEP 1
帰無仮説を立てる
「A群とB群に差はない」と仮定する。これを棄却できるかを検証する
STEP 2
データを集める
実験・観測で標本を取り、観測された差(効果量)を計算する
STEP 3
p値を計算する
「差がない」と仮定したとき、観測以上に極端な差が出る確率を求める
STEP 4
有意水準αと比較する
p < α なら帰無仮説を棄却(差ありと判断)。そうでなければ保留
棄却できなかったときは「差がないと証明できた」ではなく「差があるとは言えなかった」。検定は帰無仮説を採択しない。
02.帰無仮説と対立仮説|検定は『差がない』を棄却する形で進む
検定では、対になる2つの仮説を立てます。帰無仮説(H₀)は「差がない・効果がない」という主張、対立仮説(H₁)は「差がある・効果がある」という、本来確かめたい主張です。検定は H₀ が正しいと仮定して計算を進め、それが苦しくなったら H₀ を棄却して H₁ を採用します。
| 調べたいこと | 帰無仮説 H₀ | 対立仮説 H₁ |
|---|---|---|
| 新LPはCVRを上げるか | 新LPと旧LPのCVRは等しい | 新LPと旧LPのCVRは異なる |
| メール配信は売上に効くか | 配信群と非配信群の平均売上は等しい | 配信群と非配信群の平均売上は異なる |
| 2つの指標に関係があるか | 2指標の相関係数は0 | 2指標の相関係数は0でない |
p値がαを上回り帰無仮説を棄却できなかったとき、それは「差がないことを示せた」のではなく、「今回のデータでは差があるとは言えなかった」という意味です。サンプルが少なくて検出力が足りなかっただけかもしれません。「有意差なし」を「効果ゼロ」と読み替えると、本当はある効果を捨ててしまいます。差がないことを積極的に主張したいなら、検出力を確保したうえでの検定や、同等性検定(TOST など)という別の枠組みを使います。
03.p値と有意水準α|p値が答えること・答えないこと
p値とは、「帰無仮説が正しいと仮定したとき、実際に観測された差(以上に極端な差)が得られる確率」です。p値が小さいほど、「差がない」という仮定のもとでは今回のデータが起こりにくい――つまり仮定の方が怪しい、ということになります。
有意水準αは、検定を始める前に決めておく棄却の基準値です。慣例的に0.05(5%)が使われ、重要な意思決定では0.01にすることもあります。p < α なら帰無仮説を棄却し「統計的に有意」と判断します。
# 2群のCVR差を比率のZ検定で調べる(statsmodels)
import numpy as np
from statsmodels.stats.proportion import proportions_ztest
count = np.array([120, 160]) # CV件数(A群 / B群)
nobs = np.array([5000, 5000]) # 訪問数(A群 / B群)
stat, p = proportions_ztest(count, nobs)
print(f"検定統計量: {stat:.3f}")
print(f"p値: {p:.4f}") # 0.05 を下回れば有意
alpha = 0.05
print("有意差あり" if p < alpha else "有意差ありとは言えない")p=0.03 は「差がない確率が3%」という意味ではありません。p値は「帰無仮説が正しいと仮定したうえで、このデータが出る珍しさ」であって、仮説そのものが正しい確率を表しません。また、p値はサンプルサイズに強く依存します。サンプルを十分大きくすれば、実務的にはどうでもいい0.01ptの差でも p<0.05 になります。「有意である」と「意味のある差である」は別物です。だからこそ、p値は効果量と信頼区間(05章)とセットで報告します。
なぜCVRの差にこの検定が使えるのか|二項分布と正規近似
上のコードはproportions_ztestというZ検定を使っていますが、これは「平均を比べるt検定」とは別の理屈で成り立っています。CVRのような比率は、訪問1件ごとに「コンバージョンした/しなかった」という2択の結果(ベルヌーイ試行)の積み重ねです。表が出る確率pの偏ったコインを何度も投げて、表が出た回数を数えるのと同じ構造で、その合計コンバージョン数は二項分布に従います。二項分布はサンプル数nと確率pの2つだけで形が決まり、平均は np、分散は np(1−p) です。
図:コインを投げる回数が増えるほど、結果の山はなめらかになる
表が出る確率30%の偏ったコインを10回・40回・200回投げて「表の回数」を記録する実験を、それぞれ多数回繰り返したときの結果の分布。試行回数が増えるほど、ガタガタした形がなめらかな山に近づく。
山の形がなめらかになるのは分布の「形」の話です。統計的に有意かどうかはこれとは別の軸で、山の形に加えて「差の大きさ」との兼ね合いで決まります。
二項分布は、np と n(1−p) がどちらも十分大きいとき、正規近似という性質を持ちます。平均 np・分散 np(1−p) の正規分布にほぼ重なるため、2群の比率の差を「正規分布に従う1つの統計量」として扱え、平均の差の検定と同じZ検定の枠組みに載せられます。逆に、サンプルが少なくこの近似が崩れる場面では、二項分布(あるいは超幾何分布)そのものを直接使う厳密な検定に切り替える必要があります。A/Bテスト設計の基礎で紹介した「期待度数が5未満ならFisherの正確検定」は、この切り替えの目安の一例です。
「nは100くらいあれば十分」という思い込みに注意|必要な数はpで変わる
どこからが「十分大きい」かに決まった数(たとえば n=100)があるわけではありません。上の図のn=10のように、山の形がまだ非対称でガタついて見える場合は近似がまだ粗いサインです。pが0.5から離れる(0や1に近づく)ほど、同じ精度の近似を得るのに必要なnは増えます。つまり必要なnはp次第で変わるということです。
ここで「じゃあ確率さえ計算すればよくて、統計学は要らないのでは」という疑問が浮かびます。実は確率の計算そのものは同じです。p値も確率の一種にすぎません。統計学(仮説検定)が付け加えているのは、その確率をいつ・どう判断に使うかというルールです。
図:確率の計算は同じ。統計学が付け加えるのは判断のルール
p値も確率の一種で、計算そのものに違いはありません。統計学(仮説検定)は、その確率をいつ・どう判断に使うかというルールを付け加えることで、後付けの判断や思い込みを防ぎます。
確率をただ見る
- データを見てから「低そうだから」で判断しがち
- 同じ確率を何度も計算した影響を考えない
- 観測データの確率を出したところで終わる
統計学(仮説検定)を使う
- 有意水準αをデータを見る前に決めておく
- 何度も検定するなら多重比較で補正する
- 観測データから、真の値の推測(信頼区間)まで進める
図:nが大きいと、二項分布(棒)は正規分布(曲線)にほぼ重なる
例:n=40・p=0.3の二項分布(平均12、分散8.4)。棒はコンバージョン数kが出る確率、オレンジの曲線は同じ平均・分散の正規分布。両者がほぼ重なるからこそ、比率の差を正規分布ベースのZ検定で扱える。
棒(二項分布の確率)と曲線(正規分布)の形はほとんど区別できません。この一致こそが、比率の差の検定を「正規分布に従う統計量」として扱ってよい根拠です。ここでのn=40は形の一致を見やすくするための例で、実際のA/Bテストで何件集めるべきかとは別の話です(必要件数の考え方はこの下で扱います)。
正規近似が使える範囲では、比率の分散は p(1−p)/n という式で書けます。サンプルサイズ設計と検出力の基礎では、この不均一な分散を補正するアークサイン変換(Cohen's h)を介して必要サンプル数を逆算しますが、補正が必要になるのもそもそも分散が p(1−p) という p 依存の形をしているためです。ベースラインCVRが極端に高い・低い(p が 0 や 1 に近い)ほど分散 p(1−p) は小さくなり、必要サンプルも減る――というサンプルサイズ設計の挙動は、この二項分布の性質から導かれます。
04.第一種の過誤・第二種の過誤・検出力
検定はデータからの推測なので、必ず誤る可能性があります。誤り方は2種類あり、それぞれ別の名前と記号がついています。
図:第一種の過誤・第二種の過誤・検出力の位置関係
検定の結論は「実際に差があるか」と「検定が差ありと判定したか」の組み合わせで4通り。対角線が正しい判断、残り2つが過誤です。
正しい検出
検出力 = 1 − β
第二種の過誤
β(見逃し・偽陰性)
第一種の過誤
α(あわてん坊・偽陽性)
正しい判断
1 − α
有意水準 α は「差がないのに差ありと誤る確率」の上限。検出力 1 − β は「差があるときに気づける確率」。サンプルサイズを増やすと、α を一定に保ったまま β を下げられる。
| 概念 | 意味 | 実務での扱い |
|---|---|---|
| 第一種の過誤(α) | 差がないのに「差あり」と誤る確率(偽陽性) | 有意水準そのもの。通常0.05。効かない施策に投資する誤り |
| 第二種の過誤(β) | 差があるのに「差なし」と見逃す確率(偽陰性) | 効く施策を捨てる誤り。サンプル不足で大きくなる |
| 検出力(1 − β) | 差が本当にあるとき、それに気づける確率 | 通常0.8以上を目標に設計。低いと「有意差なし」が信用できない |
| 効果量 | 差の大きさそのもの(CVR差、Cohen's d など) | 検出力の設計に必要。p値と別に必ず報告する |
αとβはトレードオフの関係にあります。αを厳しく(0.05→0.01に)すれば偽陽性は減りますが、その分だけ見逃し(β)は増えます。両方を同時に下げる唯一の現実的な方法がサンプルサイズを増やすことです。テスト前に「検出したい効果量・α・検出力」から必要サンプル数を逆算する手順は、A/Bテスト設計の基礎で詳しく扱っています。
05.信頼区間|p値とセットで『どれくらいの差か』を示す
p値は「差があると言えるか」をイエス・ノーの二値で答えるだけで、「どれくらいの差か」「その推定がどれだけ不確かか」には答えません。それを担うのが信頼区間です。95%信頼区間とは、ざっくり言えば「真の差はこの範囲に収まっていそうだ」という幅を示します。
図:95%信頼区間が 0 をまたぐかで「有意かどうか」が分かる
例:LP 改修による CVR の差(B群 − A群、単位 pt)。95%信頼区間が「差なし」を表す 0 を含めば有意でない、含まなければ有意(両側検定 α=0.05 と対応)。
信頼区間は「真の差はこの範囲に収まっていそう」という幅。p値が有意か否かの二値しか答えないのに対し、信頼区間は差の大きさと不確実性の幅を同時に伝える。
両側検定(α=0.05)と95%信頼区間は表裏一体です。「差なし」を表す0 を信頼区間が含めば有意でなく、含まなければ有意になります。さらに信頼区間は、p値だけでは見えない2つの状況を見分けてくれます。
| 状況 | p値だけだと | 信頼区間を見ると |
|---|---|---|
| 幅が広く 0 をまたぐ | 「有意差なし」で片付く | 差が大きい可能性も残る。サンプル不足を疑い追加検証 |
| 0 は含まないが幅が狭く 0 付近 | 「有意差あり」と喜ぶ | 差はごく小さい。統計的に有意でも実務的に無意味かを判断 |
意思決定に必要な情報は「差の大きさ(効果量)」「不確実性(信頼区間)」「偶然らしさ(p値)」の3つです。p値だけの報告は「有意でした/有意ではありませんでした」しか伝えられません。効果量と95%信頼区間を併記すれば、「この施策に投資する価値があるか」をビジネス側が自分で判断できます。
信頼区間の幅を決める「平均の標準誤差」は、当サイトの無料ツール基本統計量の計算ツールにデータを貼り付けると、標準偏差・四分位数と合わせてその場で確認できます。
A/BテストのCVRの差については、ここまでのp値・信頼区間の読み方を次のツールでそのまま試せます。各パターンの訪問数とCV数を入れると、p値・信頼区間・有意差の判定をその場で計算します。
各パターンの訪問数とCV数を入れると、比率のz検定(カイ二乗検定と同等)でその場で有意差を判定します(ブラウザ内で計算、サーバー送信なし)。
差が偶然生じる確率(p値)が有意水準5%(α=0.05)を下回りました。
差が偶然である確率はp = 0.015と小さく、有意水準5%を下回っています。勝ちパターンを本番に反映し、次の改善テストに進める段階です。ただし、テスト期間中に何度も結果を確認して「有意になった瞬間に止めた」場合は偽陽性の可能性が高まるため、事前に決めた期間・サンプルサイズを満たしているかを確認してください。
LP・フォーム・CTAの改善テストを継続的に回す体制づくりはWeb運用代行サービス「TANTOU」で支援しています。
06.片側検定と両側検定の使い分け
対立仮説の立て方には2種類あります。両側検定は「差がある(どちら向きでもよい)」を、片側検定は「特定の方向の差がある(例:B群の方が高い)」を対立仮説にします。
| 両側検定 | 片側検定 | |
|---|---|---|
| 対立仮説 | A ≠ B(増えても減っても差あり) | B > A(増える方向のみ) |
| 検出力 | 標準的 | 同条件なら片側の方が高い(αを片方に集中できる) |
| リスク | なし(保守的で安全) | 逆方向の効果(B が悪化)を完全に見逃す |
| 使いどころ | 実務ではこちらが基本 | 方向を事前に断定でき、逆方向を見る必要がない場合のみ |
実務では両側検定をデフォルトにします。片側検定は検出力で有利ですが、「新施策で数値が下がる」という現実に起こりうる結果を構造的に検出できません。さらに、結果を見てから「上がる方を期待していた」と後付けで片側に切り替えるのは、実質的に有意水準を甘くする操作で、偽陽性を増やします。片側にするなら、データを見る前に方向を決め、逆方向の悪化を許容できる根拠を持っておく必要があります。
07.多重比較問題と実務でつまずく落とし穴
単発の検定を正しく行えても、検定を何度も繰り返すと偽陽性が積み上がります。これが多重比較問題です。α=0.05 の検定を20回独立に行うと、すべて「本当は差がない」場合でも、少なくとも1回は偶然有意になる確率が約64%(1 − 0.95²⁰)に達します。
# 複数の検定をまとめて多重比較補正する(statsmodels)
from statsmodels.stats.multitest import multipletests
p_values = [0.012, 0.041, 0.039, 0.250, 0.008] # 5回ぶんのp値
# Bonferroni:αを検定数で割る(厳しめ)
rej_b, p_b, _, _ = multipletests(p_values, alpha=0.05, method="bonferroni")
# Benjamini-Hochberg:偽発見率(FDR)を制御(バランス型)
rej_f, p_f, _, _ = multipletests(p_values, alpha=0.05, method="fdr_bh")
print("Bonferroni 後に有意:", rej_b)
print("FDR(BH) 後に有意: ", rej_f)| 落とし穴 | 起きること | 対処 |
|---|---|---|
| 多重比較の未補正 | セグメント別・指標別に検定を量産し、偶然の有意を拾う | Bonferroni 補正(α÷検定数)/FDR(Benjamini-Hochberg) |
| p-hacking | 有意になるまで指標・期間・除外条件を変えて検定し直す | 分析計画(指標・検定・期間)を事前登録し、後から変えない |
| HARKing(後付け仮説) | 結果を見てから「この層で効いた」と仮説を作る | 探索で見つけた仮説は別データ・別期間で確認してから主張 |
| p=0.05 の崖 | p=0.049は採用・p=0.051は却下と機械的に二分する | 0.05は便宜的な線。効果量・信頼区間・事前確度と合わせて判断 |
BIツールで多数の指標やセグメントを見比べ、「この組み合わせだけ伸びている」と気づくのは探索です。探索で見つけたパターンは、検定にかける前から「目立つように選ばれている」ため、そのまま検定すると高確率で有意になります。探索で立てた仮説は、別の期間・別のデータで改めて検証して初めて「確認された」と言えます。探索(仮説を作る)と確認(仮説を検定する)を同じデータで一度にやらないことが、多重比較を避ける一番の原則です。
08.実務での使い方|LPのA/Bテストを例に
ここまでの概念を、よくある場面――LPのCTAボタンのコピーを変えてCVRを上げたい――に当てはめてみます。仮説検定は、テストの前・最中・後でやることが型として決まっています。難しい数式を覚えるより、この型をなぞる方が実務では確実です。
テスト前:3つの数字を決めてからテストを始める
- 帰無仮説と対立仮説を一文で書く。H₀「新コピーと旧コピーのCVRは等しい」、H₁「異なる」。上がるか下がるか事前に断定できないので両側検定にします。
- 「これ以上の差なら改修する価値がある」という基準を先に決める。現状CVRが3%なら、「+0.5pt(3.5%)以上なら勝ち」とビジネス側と合意します。これが検出したい効果量(MDE)で、後の判定基準になります。
- α・検出力からサンプルサイズを逆算する。α=0.05・検出力0.8・上記のMDEなら、1群あたり約2万件が目安です。日次の流入数で割れば「何日回せばよいか」が出ます。期間内に集まらないなら、MDEを緩めるか期間を延ばします。
3つのうち判断が最も難しいのが、2つ目のMDEです。「+0.5pt」は勘で置く数字ではなく、改修で増える売上から逆算して決めます。逆算の軸は2つあります。
軸1:改修コストを回収できる最小の向上か(売上換算)
MDE は「この差未満なら、そもそも改修しない」という損益分岐ラインです。改修で増える売上が、改修とテストにかかるコストを上回る最小の向上幅を、売上換算で求めます。
| 逆算の項目 | この例での値 |
|---|---|
| 月間のLP流入数 | 100,000 セッション |
| 現状CVR | 3.0% |
| MDE +0.5pt 達成時のCV増 | 月 +500 件(3.0% → 3.5%) |
| CV 1件あたりの粗利 | 10,000 円 |
| 売上インパクト | 月 +500 万円 |
| 改修+テスト運用の総コスト | 約 60 万円(おおむね一度きり) |
| 判断 | 回収余裕は十分。「+0.5pt以上なら勝ち」をMDEに設定できる |
逆に、CV 1件の粗利が小さく、+0.5pt の向上でも月 +5 万円にしかならない商材なら、改修とテストのコストを回収できません。その場合はMDEをもっと大きく取り直します――「+1pt 以上で初めて勝ち」のように。同じ +0.5pt でも、商材の単価しだいで「価値ある差」かどうかは変わります。
軸2:その差を現実に検出できるか(トラフィック制約)
ビジネス的には +0.1pt の向上でも嬉しいはずです。しかし小さい差ほど、検出に必要なサンプルは急増します――必要サンプルは効果量の2乗に反比例するため、+0.1pt を検出するには +0.5pt の約25倍のサンプルが要ります。テスト期間内に集められない差をMDEに設定しても、結果は「有意差なし」にしかなりません。MDE は「ビジネス的に意味のある最小の差」と「現実に検出できる差」の折り合いで決まります。
MDE は検定の前提になる数字ですが、決めるのは統計やデータの担当者ではありません。「この水準未満なら施策を動かさない」と宣言できるのは、コスト構造と売上を把握しているビジネス側だけです。アナリストの役割は、ビジネス側が出したMDE候補に対して「ではサンプルは何件・期間は何週間必要」と返し、検出可能性とすり合わせること。この往復が、ステップ2の「合意」の中身です。MDEを決めずに「有意になったら勝ち」で進めると、大サンプルでは実務的に無意味な差まで採用してしまいます。
テスト中:覗き見して途中で止めない
テストを始めたら、事前に決めた期間・サンプル数に達するまで、結果を見て止めないのが鉄則です。「3日目にp<0.05になったから勝ち」で止めるのは、検定を何度も繰り返すのと同じで、偽陽性が大きく増えます(多重比較・ピーキングの問題)。途中経過は見てよいですが、勝敗の判定は予定日まで保留します。
テスト後:2つの問いに両方Yesなら採用する
期間が終わったら、p値だけでなく効果量と95%信頼区間を出します。そのうえで、次の2つを両方満たすときだけ「採用」と判断します。
| 確認する問い | 見るもの | OKの条件 |
|---|---|---|
| (1) 統計的に有意か | p値 / 95%信頼区間 | p < 0.05、かつ信頼区間が 0(差なし)をまたがない |
| (2) 実務的に意味のある差か | 効果量 / 信頼区間の下限 | 信頼区間の下限が、事前に決めたMDE(+0.5pt)を上回る |
判定例を見てみます。同じ「点推定 +0.7pt」でも、信頼区間しだいで結論はまったく変わります。
| テスト結果 | 読み方 | 判断 |
|---|---|---|
| CVR +0.7pt(95%CI: +0.5〜+0.9pt), p=0.002 | 有意。信頼区間の下限 +0.5pt がMDEを満たす | 採用。新コピーに切り替える |
| CVR +0.7pt(95%CI: −0.2〜+1.6pt), p=0.13 | 有意でない。信頼区間が0をまたぐ=サンプル不足の可能性 | 保留。期間を延ばすか再テスト。「効果なし」と断定しない |
| CVR +0.1pt(95%CI: +0.02〜+0.18pt), p=0.03 | 有意だが、差が小さくMDEに届かない | 見送り。統計的に有意でも改修コストに見合わない |
図:同じ「+0.7pt」でも、信頼区間しだいで結論は変わる
横軸はCVRの差(B群 − A群)。「0=差なし」は統計の基準線、「MDE=改修に値する最小の差」はビジネスが決めるゴール。点(観測された差)が同じ +0.7pt でも、信頼区間(ブレの幅)がどこにかかるかで、採用・保留・見送りが分かれる。
信頼区間が 0 をまたがなければ統計的に有意(採用・見送り)。さらに 区間がMDEより右に収まればビジネス的にも価値あり(採用のみ)。同じ観測値 +0.7pt でも、「保留」は信頼区間が広く0をまたぐため有意と言えない。観測の点が同じでも、ブレの幅で結論が変わる。
上の表と図の2行目・3行目は、「統計の問い」と「ビジネスの問い」が別物であることをそのまま示しています。2行目は点推定では +0.7pt とMDEを超えているのに、統計が「ノイズかもしれない」と止める。3行目は統計が「本物の差だ」と認めるのに、ビジネス基準では小さすぎて見送る。片方だけでは判断を誤ります。
ここで「MDEをビジネス側が決めるなら、なぜ統計が要るのか」という疑問が出ます。答えは、観測した数字が、真の数字そのものではないからです。中身がまったく同じLP同士を比べても(A/Aテスト)、CVRはサンプルの引き当てしだいで「B群が +0.3pt 高い」のように必ずズレます。だから手元の「+0.7pt」を見ても、それが真の効果 +0.7pt なのか、真の効果は 0 なのに偶然そう見えただけなのか、数字だけからは区別できません。
役割分担をひと言でまとめます。サッカーに例えるなら、ゴールポストの位置(MDE)を決めるのがビジネス、ボールがぼやけて見える中で本当にゴールを越えたかを判定するのが統計(審判)です。もし測定に誤差がゼロなら統計は要りません。観測値がそのまま真の値なので、MDEと直接比べて即決できます。統計が必要なのは、観測値が常にブレているからです。だから「統計的に有意」は「価値があった」を意味しません。有意性が言うのは「差はノイズでは説明しにくい」ことだけで、その差が改修コストに見合う大きさかは、MDEと照らして別途判断します。
A/Bテストでは、CVR・クリック率・離脱率・滞在時間など複数の指標が同時に動きます。これを全部検定して「どれか1つでも有意なら勝ち」とすると、多重比較問題そのものになり、偶然の有意を拾います。勝敗を決める主指標はテスト前に1つだけ決め、残りは「悪化していないか」を見るガードレール指標として扱います。
- ✓ テスト前に H₀・H₁・MDE・サンプルサイズ・テスト期間を決める
- ✓ 勝敗を決める主指標は1つに絞る(補助指標は参考に留める)
- ✓ 事前に決めた期間まで、結果を見て止めない(ピーキング禁止)
- ✓ 判定は p値・効果量・95%信頼区間 の3点セットで行う
- ✓ 「統計的に有意」と「MDEを超える差」の両方を満たして初めて採用
逆に言えば、テスト前にこの数字を決めていないA/Bテストは、結果が出ても正しく判定できません。検定の知識は、テスト後の分析よりむしろテスト前の設計でこそ効きます。サンプルサイズの逆算など設計の手順は、A/Bテスト設計の基礎で具体的に扱っています。
09.よくある質問(FAQ)
p値が0.05を下回れば、その施策は成功と判断してよいですか?
p<0.05 は「差が偶然だけでは説明しにくい」ことを示すだけで、差が大きいことや投資価値があることまでは保証しません。サンプルが十分大きければ、CVR +0.01pt のような実務的に無意味な差でも有意になります。効果量(差の大きさ)と95%信頼区間を必ず併せて見て、「この差なら施策コストに見合うか」をビジネス側の基準で判断してください。「統計的に有意」と「実務的に意味のある差」は別物です。
「有意差なし」は「効果がなかった」という意味ですか?
いいえ。「有意差なし」は「差がないと証明できた」ではなく、「今回のデータでは差があるとは言えなかった」という意味です。サンプルが少なく検出力が足りなかっただけかもしれません。判断の前に、検出力が0.8以上確保されていたか、信頼区間の幅がどれくらいかを確認してください。信頼区間が広く0をまたいでいるなら結論は保留、狭くて0付近に収まっているなら「効果は実務的に無視できる」と言えます。差がないことを積極的に示したいときは、同等性検定(TOST など)という別の枠組みを使います。
有意水準は必ず0.05にすべきですか?
0.05 は広く使われる慣習値であって、絶対の基準ではありません。偽陽性(効かない施策に投資する)のコストが大きい重要な意思決定では0.01を使い、初期の探索段階ではやや緩める、といった調整は妥当です。大切なのは、結果を見る前にαを決めておくことです。データを見てから「0.05では足りないので0.1にする」と動かすのは、偽陽性を意図的に増やす操作になります。
複数の指標やセグメントを同時に検定しても問題ありませんか?
検定を繰り返すほど、本当は差がないのに偶然有意になるケースが積み上がります。複数の指標・セグメントを検定するなら、Bonferroni 補正(αを検定数で割る、厳しめ)か FDR(Benjamini-Hochberg、バランス型)で偽陽性を制御してください。さらに、ダッシュボードを眺めて「この層だけ伸びている」と見つけた差は、選ばれた時点で有意になりやすいバイアスがかかっています。探索で立てた仮説は、別の期間・別のデータで改めて検定して初めて「確認できた」と言えます。
AIに分析させればp値や有意差の判断は任せられますか?
検定統計量やp値の計算、コードの生成は AI(ChatGPT、Claude、Geminiなど)に任せられます。一方で、何を帰無仮説にするか、両側か片側か、検定を何回行ったので多重比較補正が要るか、出た差が実務的に意味のある大きさかといった設計と解釈の判断は人が担う領域です。AIは「有意です」と断定的に出力しがちですが、サンプル設計の妥当性や探索と確認の混同まではチェックしてくれません。AIの出力するp値・有意差はそのまま鵜呑みにせず、設計と結論を人が検証する運用にしてください。
10.まとめ
統計的仮説検定は、「差はない」という帰無仮説を立て、その仮定のもとで観測データがどれだけ珍しいか(p値)を測り、有意水準αを下回れば棄却する、という手続きです。判定には第一種の過誤(偽陽性)と第二種の過誤(偽陰性)が常に伴い、両者を同時に下げる現実的な手段はサンプルサイズの確保です。
実務で押さえる要点は3つです。第一に、p値は「差がない確率」ではない――サンプル次第でいくらでも小さくなる二値の指標にすぎません。第二に、p値・効果量・信頼区間を3点セットで報告し、「統計的に有意」と「実務的に意味のある差」を切り分けること。第三に、検定を繰り返すなら多重比較補正を行い、探索で見つけた差は別データで確認すること。この3点を守るだけで、データ分析の結論が「偶然のノイズを成果と誤読する」事故を大きく減らせます。
A/Bテスト設計の基礎|サンプルサイズ・MDE・検定の使い分け
MDE・サンプルサイズ・検出力の事前設計と、比率・平均・順位それぞれの検定の使い分けを整理します。
A/Bテストできない施策の効果測定|差分の差分と傾向スコア
無作為割付ができない観察データから効果を取り出す、差分の差分と傾向スコアの実務手順です。
予測モデル評価の指標と使い分け
F1・ROC-AUC・MAE・RMSE など予測モデルの代表指標を整理します。
データ分析でよく使うアルゴリズム・指標まとめ
類似度・一致度・予測モデル評価の3カテゴリで指標を整理した総合解説です。
データ分析と効果検証の体制づくりをご相談ください
A/Bテストや施策の効果測定で「この数字を成果と呼んでよいか」を判断する仮説検定の設計・分析・レポーティングの伴走支援を行っています。お気軽にお問い合わせください。
データ分析・アルゴリズム 基礎知識集
一覧に戻る →全体像とカテゴリ早見
データの可視化
個別指標カテゴリ
統計的推測の基礎
- ›統計的仮説検定の基礎|p値・過誤・信頼区間(この記事)
- ›ベイズ統計の基礎|事前分布・事後分布・ベイズ更新
- ›相関分析の基礎|ピアソン・スピアマンと相関≠因果
- ›サンプルサイズ設計と検出力の基礎
- ›A/Bテスト設計の基礎|サンプル・MDE・検定

