目次
A/Bテストの必要サンプルサイズは、現状のCVRと「検出したい改善幅」から統計的に決まります。 目安として、CVR3%のページで+1ポイントの改善を検出するにはA/B合計で約1万人が必要です。この記事では、必要数の考え方と早見表、テスト期間の決め方を解説します。
なぜ事前にサンプルサイズを決めるのか
サンプルが足りないままテストを判定すると、次のどちらかが起きます。
- 偽陽性 — たまたまの差を「Bの勝ち」と誤認して本実装し、成果が再現しない
- 検出漏れ — 本当は効果があった改善を「差なし」と捨ててしまう
特に多い失敗が「良さそうに見えた時点での打ち切り」です。テストを毎日眺めて有意になった瞬間に止めると、偽陽性率は設定した5%を大きく超えます。開始前に必要数を計算し、達するまで判定しない。これが固定サンプル方式のA/Bテストの原則です。逐次検定など、途中評価に対応した設計は別に扱います。
必要サンプルサイズの早見表(CVR3%の場合)
有意水準5%(両側)・検出力80%・2群均等配分の正規近似による必要数です。1群あたりを整数に切り上げて2倍し、日数は合計人数÷500を切り上げています。
| 検出したい改善 | 必要サンプル(A/B合計) | 1日500人なら |
|---|---|---|
| 3% → 3.5%(+0.5pt) | 39,486人 | 79日 |
| 3% → 4%(+1pt) | 10,602人 | 22日 |
| 3% → 4.5%(+1.5pt) | 5,036人 | 11日 |
| 3% → 5%(+2pt) | 3,012人 | 7日 |
自社のCVR・トラフィックでの必要数は計算式に当てはめて算出します。
元のCVR別の早見表(1%・3%・5%・10%)
上の表はCVR3%のページを絶対値(ポイント)で見たものです。元のCVRが違うと必要数は大きく変わるため、相対の改善幅(+10%・+20%など)で並べたのが次の表です。有意水準5%・検出力80%・2群均等配分でのA/B合計人数です。
| 元のCVR | +10%の改善 | +20%の改善 | +30%の改善 | +50%の改善 |
|---|---|---|---|---|
| 1%(1%→1.1%/1.2%/1.3%/1.5%) | 約32.6万人 | 約8.5万人 | 約4.0万人 | 約1.6万人 |
| 3%(3%→3.3%/3.6%/3.9%/4.5%) | 約10.6万人 | 約2.8万人 | 約1.3万人 | 約5,000人 |
| 5%(5%→5.5%/6.0%/6.5%/7.5%) | 約6.2万人 | 約1.6万人 | 約7,600人 | 約2,900人 |
| 10%(10%→11%/12%/13%/15%) | 約3.0万人 | 約7,700人 | 約3,500人 | 約1,400人 |
読み方は2つあります。元のCVRが低いほど必要数は増える(同じ+20%でも、CVR1%はCVR10%の約11倍)。そして同じCVRなら、狙う改善幅を大きくするほど必要数は激減する(CVR3%で+10%を見抜くには約10.6万人、+50%なら約5,000人で足ります)。
必要な日数は、この人数を1日あたりの訪問者数で割ります。CVR1%のページで+20%を狙うなら、1日1,000人でも約85日。トラフィックの薄いページで小さな改善を検証するのは、そもそも設計として無理があるということです。
必要サンプルサイズの計算式
2つの比率を比べる正規近似式は次のとおりです(1グループあたりの人数。p1が現状のCVR、p2が改善後のCVR、pバーはその平均)。
有意水準5%(両側)なら z = 1.96、検出力80%なら z = 0.84 を使います。
この式は大標本で用いる近似です。帰無仮説側にプールした比率、対立仮説側に別々の比率を使う考え方はstatsmodelsのサンプルサイズ計算の説明でも確認できます。独立したユーザーを無作為に均等配分し、同じユーザーを重複して人数に数えないことが前提です。
暗算用には、次の簡略式で概算できます。A/Bテストの必要サンプルは「16 × pバー × (1 − pバー) ÷ 差の2乗」でおおよそ求まります(1グループあたり、有意水準5%・検出力80%)。16という数字は 2 ×(1.96 + 0.84)² ≒ 15.7 を丸めたものです。
CVR3%→4%で試すと、pバー = 0.035、差 = 0.01 なので、16 × 0.035 × 0.965 ÷ 0.0001 = 約5,400人。1グループ5,400人、A/B合計で約1.1万人です。z値を1.959964・0.841621として同じ正規近似式で計算すると1グループ5,301人(合計10,602人)なので、この近似は実際より2%ほど多めに出ます。桁を掴んで「やる価値があるテストか」を判断するには、それで足ります。
この式から、冒頭のキーポイント(改善幅が半分になると必要数は約4倍)がそのまま読み取れます。差が分母の2乗に入っているためで、サンプル数を減らす一番効く手は、テストする変更を大胆にして差そのものを大きくすることです。
テスト期間はどう決めるのか
- 必要サンプル合計を、テスト対象ページ(LPや商品ページ)の1日あたり訪問者数で割る
- 出てきた日数を週単位に切り上げる。曜日によってユーザーの質が変わるため、計算上4日でも1週間は回す
- 8週間を超える場合はテスト設計を見直す。期間が長すぎると、季節要因やキャンペーンなど別の変化が混ざります
サンプルが集まらない場合の現実的な選択肢は3つです。大胆な変更をテストして検出したい差を大きくする(ボタン色ではなく訴求全体。検索意図そのものを取り違えていないかまで戻って見直す)、テスト対象を広げる(1ページでなくテンプレート単位)、より上流の指標で測る(ファネルの下流にある購入ではなく、母数の大きいカート追加で測る)。小さな改善幅を少ないサンプルで判定することは、統計的にできません。
よくある失敗
- 有意になった瞬間に打ち切る — 偽陽性の典型。事前に決めた数まで回し切る
- 相対と絶対を混同する — 「CVR10%改善」は3%→3.3%(+0.3pt)であり、3%→13%ではない。必要サンプルは絶対幅で決まります
- 同時に複数の変更を入れる — どの変更が効いたか分離できない。1テスト1論点はCTVRの改善でも同じ原則です
- テスト対象のKPIが売上と繋がっていない — クリック率(CTR)が上がってもCVRが下がることはあります。獲得単価まで含めた指標の設計はCPAの考え方とデジタル広告のKPIを参照してください
サンプルサイズの計算は一度覚えれば数十秒の作業です。テストを走らせる前にサンプルサイズ計算ツールで「勝敗を判定できるテストか」を必ず確認してください。
よくある質問
A/Bテストに必要なサンプル数はどのくらいですか?
検出したい改善幅によって大きく変わります。CVR3%のページで+1ポイント(3%→4%)の差を検出するにはA/B合計で約1万人、+0.5ポイントなら約4万人が必要です(有意水準5%・検出力80%)。テスト開始前に計算ツールで確認するのが定石です。
検出力80%とはどういう意味ですか?
本当に差があるときに、その差を統計的に有意と検出できる確率が80%という意味です。Webのテストでは有意水準5%・検出力80%が標準的な設定で、見逃しをより減らしたい場合は検出力90%にしますが、必要サンプルは増えます。
A/Bテストを途中でやめてはいけないのはなぜですか?
良さそうに見えた時点で打ち切ると、たまたまの差を実力と誤認する確率(偽陽性)が大きく上がるためです。事前に必要サンプルサイズと期間を決め、達するまでは判定しないのが原則です。