AI × データ分析基礎知識集 / サンプルサイズ設計

A/Bテストの必要サンプル数とサンプルサイズ設計|検出力・MDE・αから逆算する


A/Bテストや効果測定が「有意差なし」で終わってしまう原因の多くは、分析の腕前ではなく、テスト開始前のサンプルサイズ設計にあります。本記事では、検出力(statistical power)とは何か、なぜ慣例的に0.8を取るのか、ベースライン率・検出可能効果量(MDE)・有意水準α・検出力の4つから必要サンプル数を逆算する手順、必要サンプルが効果量の2乗に反比例する性質、そしてトラフィックの少ないBtoBサイトで現実的に設計する工夫までを、statsmodels の計算例とともに初学者向けに整理します。

公開2026.05.17
最終更新2026.07.16
読了 15 分 / 約6,800字
この記事をシェアポスト
AI × データ分析「有意差なし」の多くは設計の問題

サンプルサイズ設計と
検出力の基礎

A/Bテストや効果測定をやってみたものの、結果が「有意差なし」で、勝ちとも負けとも言えないまま終わった――こうした空振りの多くは、分析の腕前ではなく、テストを始める前のサンプルサイズ設計に原因があります。検出したい差に対してサンプルが足りていなければ、本当は効いている施策でも「有意差なし」としか出ません。サンプルサイズは、テストが終わってから振り返る数字ではなく、テストの前に逆算して決める数字です。

C
本記事の結論を先に
必要サンプル数は『4つの入力』から逆算する出力であって、願って決める数字ではない

必要サンプル数は、ベースライン率・検出したい最小の差(MDE: Minimum Detectable Effect)・有意水準α・検出力の4つが決まれば一意に計算されます。検出力(statistical power)は「本当に差があるとき、それに気づける確率」で、慣例的に0.8を取ります。必要サンプルは検出したい差の2乗に反比例し、差を半分にすると必要件数は約4倍に膨らみます。トラフィックが少なく必要数に届かないときは、勘でテストを始めるのではなく、MDEを緩める・CVRより上流の指標で測る・期間を延ばすといった設計側の調整で折り合いをつけます。

01.まず結論:サンプルサイズはテスト前に逆算して決める

新しいLPでCVRを上げたい、メール配信で売上を伸ばしたい――こうした施策の効果を測るとき、多くの現場が「とりあえず2週間回してみる」と期間だけ決めて走り出します。しかし、その2週間で集まるサンプルが、見たい差を検出するのに足りているとは限りません。足りていなければ、施策が本当に効いていても結果は「有意差なし」になり、効く施策を捨ててしまいます。

そこで必要になるのがサンプルサイズ設計です。これは「どれくらいの差を、どれくらいの確実さで見つけたいか」を先に決め、そこから必要なサンプル数を逆算する手続きです。観測した差が偶然かどうかを判定する仕組み自体は統計的仮説検定の基礎で扱いました。本記事は、その検定を空振りさせないための「テスト前の準備」に焦点を当てます。

逆算の結果である必要サンプル数を、日次のトラフィックで割れば「テストに何日かかるか」が出ます。期間内に集まらないと分かれば、テストを始める前に設計を直せます。サンプルサイズ設計の本当の価値は、走り出す前に「このテストは成立するのか」を判定できることにあります。

02.検出力(statistical power)とは|なぜ0.8を取るのか

検出力(statistical power)とは、「本当に差があるとき、検定がそれを差ありと正しく判定できる確率」です。記号では 1 − β と書きます。βは第二種の過誤(差があるのに「差なし」と見逃す確率)で、検出力はその裏返しです。検出力0.8とは、「本当に効果がある施策を、5回テストすれば4回は有意と検出できる」状態を指します。

検定にはもう一つ、有意水準α(差がないのに「ある」と誤る第一種の過誤の確率)があります。αとβ・検出力の関係は統計的仮説検定の基礎で詳しく整理しています。ここで重要なのは、αを一定に保ったまま検出力を上げる現実的な手段が、サンプルサイズを増やすことだけだという点です。

図:検出力曲線|サンプルを増やすほど検出力は上がるが、伸びは鈍る

MDE・αを固定すると、検出力はサンプルサイズだけの関数になります。検出力0.8まではサンプル追加の効きが大きく、その先は同じだけ上げるのにずっと多くのサンプルが要ります(収穫逓減)。

ここから先は伸びが鈍い00.50.81.0標準ライン:検出力 0.8必要サンプルサンプルサイズ(1群あたり)が大きい →検出力(差に気づける確率)

検出力0.8(必要サンプル)までは、サンプルを足すほど「効く施策を見逃さない確率」が大きく伸びます。0.8を超えてからは、同じだけ検出力を上げるのにずっと多くのサンプルが要るため、0.8あたりがコストと安心のバランス点になります。

では、なぜ検出力は0.8が標準なのでしょうか。0.8は法律で決まった値ではなく、慣例です。その背景には2つの考え方があります。

  • 過誤コストの非対称性:第一種の過誤(効かない施策に投資する)は、第二種の過誤(効く施策を見送る)より深刻に扱われがちです。慣例的に「α=0.05 に対し β はその4倍まで許容する」と置くと、β=0.20、つまり検出力 1 − 0.20 = 0.80 になります。
  • 収穫逓減:上の検出力曲線のとおり、0.8まではサンプル追加がよく効きますが、0.8を超えると伸びが鈍ります。0.8から0.9へ上げるには必要サンプルが約34%増、0.95へ上げるなら約66%増になります。0.8は「コストと安心のバランスが取れる折り返し点」なのです。
i
0.8 は絶対ではない
見逃しのコストが特に高い意思決定なら、検出力を0.9に上げる判断もある

検出力0.8は「効く施策を5回に1回は見逃す」設定でもあります。見逃しの代償が大きい意思決定――たとえば全社の主力商品のLP刷新――では、検出力を0.9に引き上げる判断も妥当です。ただしその分サンプルとテスト期間が増えます。検出力もαと同じく、テストを始める前に、見逃し・誤検出それぞれのコストを踏まえて決めておく数字です。

03.サンプルサイズを決める4つの入力

必要サンプル数は、次の4つの入力が決まれば一意に計算される出力です。「何件あれば安心か」と願って決める数字ではありません。

図:サンプルサイズは4つの入力から逆算される

必要サンプル数は「測りたい」と願って決める数字ではなく、4つの入力が決まれば一意に計算される出力です。逆に言えば、この4つを先に決めない限りサンプル数は決まりません。

① ベースライン率

現状のCVR・CTRなど。過去90日などの平均から推定する

② MDE(検出したい最小の差)

「これ以上の差なら施策を動かす」という基準。ビジネス側が決める

③ 有意水準 α

差がないのに「ある」と誤る確率の上限。通常0.05

④ 検出力(1 − β)

差があるとき気づける確率。通常0.8

↓ 逆算(statsmodels など)

必要サンプルサイズ(1群あたり n)

n を日次トラフィックで割れば「テストに何日かかるか」が出る。期間内に集まらないなら、入力(特にMDE)を見直す

入力意味決め方
ベースライン率現状のCVR・CTRなど、A群(既存)の基準値過去90日などの実測平均から推定する
MDE(検出したい最小の差)「これ以上の差なら施策を動かす価値がある」という最小ライン改修コストを回収できる売上から逆算。ビジネス側が決める
有意水準 α差がないのに「差あり」と誤る確率の上限(偽陽性)通常0.05。誤採用のコストが高ければ0.01
検出力(1 − β)差が本当にあるとき、それに気づける確率通常0.8。見逃しのコストが高ければ0.9

4つのうち、技術的な判断ではなく事業判断を要するのがMDEです。MDEは「測れたら嬉しい差」ではなく、「この差未満なら、そもそも施策を動かさない」という損益分岐ラインです。改修とテストにかかるコストを、改修で増える売上が上回る最小の向上幅を、売上換算で求めます。MDEの逆算手順はA/Bテスト設計の基礎で具体例とともに扱っています。

CVR・CTRのような比率の必要サンプル数は、二項分布の分散 p(1−p)/n をもとに計算されます。この式はベースライン率が0や1に近いほど小さくなる性質を持ち、次の統計ソフトでの逆算でもこの分散を補正する形で使われます。

!
よくあるつまずき
MDEを「小さいほど良い」と考えると、テストが永遠に終わらない

「+0.1ptの改善でも見たい」とMDEを小さく置くほど、必要サンプルは急増します(次章)。MDEは「ビジネス的に意味のある最小の差」と「テスト期間内に現実に集められる差」の折り合いで決める数字です。小さく置けば置くほど精密になるわけではなく、期間内に終わらないテストは設計として失敗です。

04.サンプルサイズの逆算|statsmodels での計算

4つの入力が揃えば、計算自体は Python の statsmodels で数行です。CVR・CTRのような比率の差を見る場合は、2つの比率を効果量(Cohen's h)に変換してから、必要サンプル数を逆算します。

# CVRの差を検出するのに必要なサンプルサイズ(statsmodels)
from statsmodels.stats.power import NormalIndPower
from statsmodels.stats.proportion import proportion_effectsize

baseline = 0.030          # ベースラインCVR:3.0%
mde_abs  = 0.005          # 検出したい最小の差(MDE):+0.5pt

# 2つの比率の差を効果量(Cohen's h)に変換する
effect = proportion_effectsize(baseline + mde_abs, baseline)

n = NormalIndPower().solve_power(
    effect_size=effect,
    alpha=0.05,           # 有意水準(第一種の過誤)
    power=0.80,           # 検出力(1 − 第二種の過誤)
    alternative="two-sided",
)
print(f"1群あたり必要サンプル: {n:,.0f} 件")   # → 約 19,700 件
print(f"合計(A群+B群):      {2 * n:,.0f} 件")  # → 約 39,400 件

滞在時間や売上金額のような連続値(平均)の差を見る場合は、効果量に Cohen's d(検出したい平均差 ÷ 標準偏差)を使い、TTestIndPower で逆算します。

# 平均値(売上・滞在時間)の差を検出するサンプルサイズ
from statsmodels.stats.power import TTestIndPower

# 効果量 Cohen's d = 検出したい平均差 ÷ 標準偏差
d = 0.2   # 標準偏差の0.2倍ぶんの差を見たい(小さめの効果)

n = TTestIndPower().solve_power(
    effect_size=d,
    alpha=0.05,
    power=0.80,
    alternative="two-sided",
)
print(f"1群あたり必要サンプル: {n:,.0f} 件")
i
計算結果の感覚値
CVR 3% から +0.5pt を見るには、1群あたり約2万件・合計約4万件

ベースラインCVR3.0%・MDE +0.5pt(3.5%を狙う)・α=0.05・検出力0.8のとき、必要サンプルは1群あたりおよそ19,700件、A群とB群の合計でおよそ39,400件です。月10万セッションのLPなら、半分ずつ振り分けて約12日。月1万セッションのサイトなら、同じ条件で4か月近くかかる計算になります。まず「自分のサイトの規模で、この設計は何日かかるか」を必ず見積もってください。

この逆算は、次のツールに4つの入力を入れればその場で計算できます。ベースラインCVR・MDE・有意水準・検出力を変えると、1群あたりと合計の必要サンプル数、1日あたりの想定流入を入れればテストに何日かかるかの目安まで出ます。MDEを半分・2倍にしたときの必要数の変化も並べて確認できます。

A/Bテスト 必要サンプルサイズ計算ツール
ツール単体ページで開く

ベースラインCVR・MDE・有意水準・検出力を入れると、1群あたり/合計の必要サンプル数と所要日数を逆算します(ブラウザ内で計算、サーバー送信なし)。

条件を入力数値は書き換えられます
② 検出したい最小の差(MDE)「これ以上の差なら施策を動かす」基準。ビジネス側が決める

→ 目標CVR 3.50%(相対 +16.7%)

③ 有意水準:④ 検出力:検定:
必要サンプル数
1群あたり必要サンプル
19,716
件(A群・B群それぞれ)
合計(A群+B群)
39,432
件
テスト所要日数の目安
約12日
1日3,300件で割った概算

効果量 Cohen's h = 0.0282(ベースライン3.00% → 目標3.50%)。2標本の比率の逆正弦変換にもとづく正規近似で、有意水準5%・検出力0.80・両側検定の条件です。

MDEを変えると必要サンプルはどう動くか
検出したい差(MDE)1群あたり合計所要日数
+1.00pt(2倍)5,27610,552約4日
+0.50pt(現在)19,71639,432約12日
+0.25pt(半分)76,007152,014約47日

検出したい差を半分にすると、必要サンプルはおよそ4倍に膨らみます(効果量の2乗に反比例)。「もっと小さい差まで見たい」は「テスト期間が4倍になってもよいか」とほぼ同義です。

使い方:テストを始める前に「成立するか」を判定する

算出した合計サンプルを日次の流入で割り、テスト期間が現実的かを確かめます。期間内に集まらないときは、勘で始めずMDEを緩める・上流の指標で測る・対象を絞るといった設計側の調整で折り合いをつけてください。テスト後の有意差判定はA/Bテスト有意差判定ツールが使えます。

サンプルサイズ設計からA/Bテストの効果検証・レポーティングまでの伴走はWeb運用代行サービス「TANTOU」で支援しています。

すでにテストを走らせている場合は、次のツールに各パターンの訪問数とCV数を入れると、有意差の判定に加えて「観測された差を検出力80%で検出するのに必要な1パターンあたりの訪問数」をその場で逆算できます。

A/Bテスト有意差判定ツール
ツール単体ページで開く

各パターンの訪問数とCV数を入れると、比率のz検定(カイ二乗検定と同等)でその場で有意差を判定します(ブラウザ内で計算、サーバー送信なし)。

テスト結果を入力数値は書き換えられます
パターンA(現行)
比較のベースになる既存パターン
パターンB(新案)
効果を確かめたい変更後パターン
信頼水準:
判定結果
パターンAのCVR
2.40%
120 ÷ 5,000
パターンBのCVR
3.20%
160 ÷ 5,000
CVRの差(B−A)
+0.80pt
相対 +33.3%
判定:統計的に有意な差があります(p = 0.015)

差が偶然生じる確率(p値)が有意水準5%(α=0.05)を下回りました。

z値(χ²=z²)
2.425(χ²=5.879)
p値(両側)
0.015
差の95%信頼区間
0.15pt 〜 1.45pt
BがAに勝つ確率(参考)
99.2%
診断:パターンBが統計的に有意に優れています

差が偶然である確率はp = 0.015と小さく、有意水準5%を下回っています。勝ちパターンを本番に反映し、次の改善テストに進める段階です。ただし、テスト期間中に何度も結果を確認して「有意になった瞬間に止めた」場合は偽陽性の可能性が高まるため、事前に決めた期間・サンプルサイズを満たしているかを確認してください。

LP・フォーム・CTAの改善テストを継続的に回す体制づくりはWeb運用代行サービス「TANTOU」で支援しています。

05.必要サンプルは効果量の2乗に反比例する

サンプルサイズ設計でいちばん直感に反するのが、必要サンプルは検出したい差の2乗に反比例するという性質です。検出したい差を半分にすると、必要サンプルは2倍ではなく、およそ4倍に膨らみます。

図:MDEを半分にするたび、必要サンプルはおよそ4倍になる

ベースラインCVR3.0%・α=0.05・検出力0.8で固定したときの、1群あたり必要サンプル数の目安。検出したい差を小さくするほど、必要サンプルは線形ではなく2乗のペースで膨らみます。

MDE +2.0pt

約 1,500 件

MDE +1.0pt

約 5,300 件

MDE +0.5pt

約 19,700 件

MDE +0.25pt

約 76,000 件

検出したい差を半分にするたび、必要サンプルは 約4倍。「もっと小さい改善も見たい」は、テスト期間が4倍・16倍に伸びることを意味します。

理由は、必要サンプル数 n が効果量の2乗を分母に持つ形(おおまかに n ∝ 1 ÷ 効果量²)になっているからです。観測される差のばらつき(標準誤差)はサンプル数の平方根に反比例して縮みます。差を半分の細かさで見分けたいなら、ばらつきも半分に抑える必要があり、そのためにはサンプルを4倍にしなければなりません。

この性質は、設計の意思決定をかなり左右します。「ついでに小さな改善も検出できるようにMDEを下げておこう」という判断は、テスト期間を4倍・16倍に延ばすことを意味します。逆に、MDEを少し緩めるだけでサンプル要件は劇的に軽くなるとも言えます。MDEを +0.5pt から +1pt に緩めれば、必要サンプルは約2万件から約5,300件へ、4分の1以下に減ります。

!
この2乗の壁を踏まえて
「もっと精密に測りたい」は、たいてい「もっと長く待てますか」と同義

関係者から「念のため小さい差も見えるようにしてほしい」と頼まれたら、それは検出力やαの話ではなくMDEを下げる依頼であり、必要サンプルが2乗で増えることを意味します。「MDEを半分にすると、テスト期間は約4倍の◯か月になります」と期間に翻訳して返すと、現実的な落としどころを一緒に決めやすくなります。

06.トラフィックが少ないサイトの現実的な設計

ここまでの計算をBtoBサイトに当てはめると、多くの場合「必要サンプルが、現実的な期間内には集まらない」という壁に突き当たります。月数千〜1万セッション規模のサイトでCVRの +0.5pt を検出しようとすると、テストに半年以上かかってしまう、というのはよくあることです。テスト期間が長すぎると、その間に季節要因や別の施策が混ざり、結果の解釈もあやしくなります。

このとき取るべきは「サンプルが足りないまま勘でテストを始める」ことではなく、設計側の4つの調整です。

調整やること効果と注意点
MDEを緩める検出したい差を +0.5pt から +1pt などに引き上げる必要サンプルが2乗で減り最も効く。ただし小さな改善は検出できなくなる
上流の指標で測るCVRより、発生頻度の高いCTR・クリック率・離脱率で評価するイベント数が多くサンプル効率が良い。最終CVとの連動は別途確認
対象を絞るコンバージョンしやすいセグメントや流入経路に絞ってテストするベースライン率が上がり差を検出しやすい。結果の一般化には注意
期間を延ばす/逐次設計に切り替えるテスト期間を延長する、またはバンディットなど別の枠組みを使う延長は季節要因の混入に注意。固定サンプル設計が苦しいなら設計自体を見直す

最も効果が大きいのはMDEを緩めることです。前章のとおり必要サンプルは2乗で効くため、MDEを2倍にするだけで必要数は4分の1になります。次に有効なのが上流の指標で測る方法です。最終CVは発生頻度が低く、サンプルが貯まりにくい指標です。CTAのクリック率やフォーム到達率のような、より手前で多く発生するイベントで評価すれば、同じ期間でも判定に足るサンプルが集まります。ただし上流指標が改善しても最終CVに必ずつながるとは限らないため、上流指標は「速く回すための代理指標」と位置づけ、最終的な効果は別途確認します。

どの調整をしても必要サンプルに届かない場合は、固定サンプルのA/Bテストという枠組み自体が、そのサイト規模に合っていない可能性があります。トラフィックを少しずつ勝ち筋に寄せていくバンディットアルゴリズムとトンプソンサンプリングのような逐次的な手法が選択肢になります。

トラフィックが少ないサイトでのサンプルサイズ設計チェック
  • ✓ テスト前に必要サンプル数を逆算し、自サイトの日次流入で「何日かかるか」を出す
  • ✓ 期間内に集まらないなら、まずMDEを緩められないかビジネス側と相談する
  • ✓ CVRが貯まりにくいなら、CTRなど上流の指標で代理評価できないか検討する
  • ✓ テスト期間が長期化するときは、季節要因や並行施策の混入リスクを確認する
  • ✓ どの調整でも届かないなら、固定サンプル設計に固執せず逐次的手法も検討する

07.設計を誤るとどうなるか|過小設計と過大設計

サンプルサイズ設計の失敗には、足りない方向(過小設計)と多すぎる方向(過大設計)の2つがあります。実務で深刻なのは圧倒的に過小設計です。

設計起きること実務上の問題
過小設計(サンプル不足)検出力が0.8に届かず、効く施策でも「有意差なし」が出やすい効く施策を誤って捨てる。「効果がなかった」と誤った学習が残る
適正設計検出力0.8前後で、MDE以上の差なら高確率で検出できる「有意差なし」を『この規模の差は無さそう』と前向きに解釈できる
過大設計(サンプル過剰)必要以上にサンプルを集め、ごく小さな差まで有意になる実務的に無意味な差まで「有意」と出る。テスト期間の浪費

過小設計が怖いのは、「有意差なし」という結果が、検出力不足のせいなのか本当に差がないのか、結果だけ見ても区別できないことです。検出力0.3でテストして「有意差なし」が出ても、それは「効果がない」ではなく「このテストには効果を見つける力が無かった」だけかもしれません。テスト前に検出力を確保していなければ、空振りの結果から何も学べません。

サンプルが先に決まっている(期間や流入が固定されている)ときは、逆に「そのサンプル数で検出力がいくつになるか」を事前に逆算しておきます。

# サンプルが先に決まっているとき、達成できる検出力を逆算する
from statsmodels.stats.power import NormalIndPower
from statsmodels.stats.proportion import proportion_effectsize

effect = proportion_effectsize(0.035, 0.030)   # MDE +0.5pt

power = NormalIndPower().solve_power(
    effect_size=effect,
    nobs1=5000,            # 期間内に1群で集まる見込み
    alpha=0.05,
    alternative="two-sided",
)
print(f"このサンプル数で得られる検出力: {power:.2f}")  # → 約 0.29

この例では、必要な約2万件に対して5,000件しか集まらず、検出力は0.29――本当に +0.5pt の効果があっても、検出できるのは3回に1回未満です。この数字をテスト前に知っていれば、「この設計のままテストしても結論は出ない」と判断し、MDEを緩めるなり期間を延ばすなりの手を打てます。事後に「有意差なし」を眺めて悩むより、はるかに安上がりです。

一方の過大設計は、過小設計ほど深刻ではありませんが無害でもありません。サンプルが多すぎると、実務的にはどうでもいい +0.02pt のような差まで統計的に有意になります。「有意である」と「意味のある差である」は別物なので、過大設計のテストでは結局、効果量と信頼区間を見てMDEと照らす判断が欠かせません。サンプルサイズ設計は、足りなさだけでなく『ちょうど良さ』を狙う作業です。

08.よくある質問(FAQ)

検出力は必ず0.8にしないといけませんか?

0.8 は広く使われる慣例値であって、絶対の基準ではありません。検出力0.8は「効く施策を5回に1回は見逃す」設定でもあるため、見逃しの代償が大きい重要な意思決定では0.9に引き上げる判断も妥当です。ただし0.8から0.9へ上げると必要サンプルは約34%増え、テスト期間もその分延びます。検出力もαと同じく、テストを始める前に、見逃し・誤検出それぞれのコストを踏まえて決めておく数字です。データを見てから動かすと、判定の意味が変わってしまいます。

サンプルサイズを事前に計算せず、有意差が出たところで止めてはいけませんか?

それは「ピーキング(覗き見による早期停止)」と呼ばれる典型的な失敗です。結果を毎日見て、有意になった瞬間に止めるのは、検定を何度も繰り返すのと同じ構造で、本当は差がなくてもどこかで偶然有意になる確率が大きく上がります。固定サンプルのA/Bテストでは、必要サンプル数とテスト期間を事前に決め、その時点まで勝敗の判定を保留するのが鉄則です。途中で結果を見ながら止めたいなら、それを前提に設計された逐次検定やバンディットなど、別の枠組みを使います。

トラフィックが少なくて、計算した必要サンプルがどうしても集まりません。

サンプルが足りないまま勘でテストを始めるのは最も避けたい選択です。まずMDEを緩められないかをビジネス側と相談してください。必要サンプルは検出したい差の2乗に反比例するため、MDEを2倍にするだけで必要数は4分の1になり、最も効果的です。次に、最終CVより発生頻度の高いCTRやフォーム到達率といった上流の指標で測る、コンバージョンしやすいセグメントに対象を絞ってベースライン率を上げる、といった工夫があります。どの調整でも届かない場合は、固定サンプルのA/Bテストという枠組み自体がサイト規模に合っていない可能性があり、バンディットのような逐次的手法を検討します。

必要サンプル数は「合計」と「1群あたり」のどちらで考えればよいですか?

statsmodels の solve_power など多くの計算ツールが返すのは「1群あたり」の必要サンプル数です。A/Bテストには少なくともA群とB群があるため、実際に必要なトラフィックはその2倍になります。1群あたり約2万件なら、テスト全体では約4万件が必要、という具合です。テスト期間を見積もるときは、この合計値を日次の流入数で割ります。「1群あたり」と「合計」を混同すると、テスト期間の見積もりが半分になってしまうので注意してください。

サンプルサイズの計算はAIに任せられますか?

効果量への変換やサンプルサイズの逆算コードの生成は、AI(ChatGPT、Claude、Geminiなど)に任せられます。一方で、MDEをいくつに置くか(改修コストと売上から決める事業判断)、検出力やαをどの水準にするか、CVRの代わりに上流指標で測ってよいか、といった設計の前提を決める判断は人が担う領域です。AIは前提を勝手に補って「必要サンプルは◯件です」と断定的に答えがちですが、その前提が自社の状況に合っているかはチェックしてくれません。AIが出した数字は、どのベースライン率・MDE・α・検出力を仮定した結果なのかを必ず確認してから使ってください。

09.まとめ

サンプルサイズ設計は、テスト後の分析テクニックではなく、テストを始める前の準備です。必要サンプル数は、ベースライン率・MDE・有意水準α・検出力という4つの入力から逆算される出力で、4つを先に決めなければサンプル数は決まりません。検出力(statistical power)は「差があるとき気づける確率」で、過誤コストの非対称性と収穫逓減のバランスから、慣例的に0.8を取ります。

実務で押さえる要点は3つです。

  • 必要サンプルは検出したい差の2乗に反比例します――差を半分にすると必要数は約4倍に膨らみます。
  • トラフィックが少なく必要数に届かないときは、勘で走り出すのではなく、MDEを緩める・上流の指標で測る・対象を絞るといった設計側の調整で折り合いをつけます。
  • 最も避けるべきは過小設計で、検出力不足の「有意差なし」は何も教えてくれません。

テスト前に「この設計は何日かかり、検出力はいくつか」を逆算する習慣だけで、空振りのA/Bテストは大きく減らせます。

お問い合わせ

A/Bテストの設計・効果検証の体制づくりをご相談ください

サンプルサイズ設計、MDEの逆算、A/Bテストの統計分析とレポーティングまで、施策の効果検証を空振りさせないための伴走支援を行っています。お気軽にお問い合わせください。

お問い合わせはこちら

データ分析・アルゴリズム 基礎知識集

一覧に戻る →
07

モデル構築の自動化

この記事をシェア
澤田 翔太(Shota Sawada)
この記事を書いた人

澤田 翔太

株式会社クリプタル 代表取締役

1988年生まれ、慶應義塾大学卒。創業メンバーとして関わった株式会社セールスサポートを株式会社ネオマーケティング(東証STD 4196)に売却。株式会社クリプタルでも複数の事業立ち上げと売却を経験し、2022年9月には婚活・恋愛メディア「シッテク」「婚活会議」を株式会社ベビーカレンダー(東証GRT 7363)へ売却。現在はAI業務支援事業、TANTOU事業、グロースハック支援事業、メディア事業、SEOコンサルティング事業を手がける。