広告向け A/B テスト計算ツール:有意性とサンプルサイズ

2つのバージョンの訪問者数とコンバージョン数を入力すると、差が本物かどうかがわかります。あるいはコンバージョン率と検出したいリフトを入力すると、テストに必要な訪問者数がわかります。両方の計算式を、計算例付きで記載しています。

無料ツール ブラウザ内で計算します。何も送信、保存、記録されません:このページの向こう側にサーバーはありません。

2 つの質問、1 つの計算ツール

どの広告テストも、この順序で 2 つのことを問います。開始前:知りたい差を見つけるには、どれだけの訪問者が必要か。終了後:A と B の差は本物か、それとも偶然の可能性があるか。上の 2 つのタブをこの順序で使ってください。先にサンプルサイズを計算しておくことが、2 つ目の質問への答えに意味を持たせます。

「訪問者」は、ランディングページの訪問者、リンククリック、あるいはコンバージョンする公平な機会を得た他の誰でもかまいません。両方のバージョンを同じ方法で数えている限りは問題ありません。「コンバージョン」は、あなたがテストしている行動を実際に行った人のことです。

有意性検定の仕組み

この計算ツールは、2 つの率を比較するための大標本検定である二標本比率の z 検定を実行します。これは NIST/SEMATECH 統計手法電子ハンドブックで説明されています:

  • プールされた率 p = (コンバージョン A + コンバージョン B) ÷ (訪問者 A + 訪問者 B)。
  • z = (率 B − 率 A) ÷ √(p × (1 − p) × (1/訪問者 A + 1/訪問者 B))。
  • 両側 p 値 = 2 × (1 − Φ(|z|))。Φ は標準正規分布です。
  • 差の区間は (率 B − 率 A) ± z × √(率 A × (1 − 率 A) ÷ 訪問者 A + 率 B × (1 − 率 B) ÷ 訪問者 B) です。上昇の範囲はこれを率 A で割ったもので、率 A を既知として扱うため、近似となります。

計算例。 バージョン A は 10,000 訪問者から 200 件のコンバージョンを獲得(2.00%)。バージョン B は 10,000 から 245 件(2.45%)で、相対的な上昇は 22.5%。プールされた率は 445 ÷ 20,000 = 2.225%、標準誤差は 0.209 パーセントポイント、z = 0.45 ÷ 0.209 = 2.157。両側 p 値は 0.031 で 0.05 を下回るため、95% の信頼度で B が勝ちます。差の 95% 区間は +0.04 から +0.86 パーセントポイント:B の方が優れていますが、真の上昇はおよそ 2% から 43% のどこかになり得ます。

この検定は十分なデータを必要とする近似です。NIST のハンドブックは1 つの基準を示しています:最低でも 5 件の成功と 5 件の失敗。各バージョンに 5 件のコンバージョンと 5 件の非コンバージョンが揃うまで、計算ツールは判定を保留し、まだデータが足りませんと表示します。それより少ない場合、NIST は小標本向けの正確検定を示していますが、広告テストにおける現実的な答えはテストを継続することです。

サンプルサイズの計算方法

両側検定の場合、バージョンごとの訪問者数:

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

ここで p1 は現在のレート、p2 はリフトを適用したレート、p̄ はそれらの平均です。連続性補正なしの正規近似で、NIST ハンドブックの単一比率のサンプルサイズ計算式に 2 つ目のグループを加えた形と同じ形をしています。95% の信頼水準では z1−α/2 は 1.959964、80% の検出力では z1−β は 0.841621 です。

計算例。コンバージョン率が 2% で、20% のリフトを検出したい場合、2.0% と 2.4% の比較になります。平均レートは 2.2% です。上段は 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811、これを二乗すると 0.3377、0.004² で割るとバージョンごとに 21,109 人の訪問者、合計 42,218 人となります。1 日 3,000 人の訪問者なら 15 日です。

最も重要なのは求めるリフトの大きさです。同じ 2% のレートでも、30% のリフトはバージョンごとに 9,798 人、10% のリフトは 80,682 人が必要です。リフトを半分にするとトラフィックはおよそ 4 倍になります。これは差が計算式の分母で二乗されているためです。

早期に打ち切ると偽陽性が増える理由

95% の信頼水準とは、A と B が本当に同じコンバージョン率であっても、固定サンプルサイズでの 1 回のテストで約 5% の割合で勝者が出てしまうことを意味します。その 5% は、最後に 1 回だけ確認した場合にのみ正しい数値です。

毎日結果を確認し、有意と表示された最初の時点で打ち切るのは別の手順です。データが集まるにつれてレートは変動し、確認するたびに偶然の差が基準を越えるチャンスが増えます。最初に越えた時点で打ち切ると、最も運の良い瞬間を選んでしまうため、実際の偽陽性率は 5% を超え、確認回数が多いほど大きくなります。画面上の p 値はあなたが途中で覗いたことを知らないので、1 回だけ確認したかのように表示されます。

対策は地味ですが効果的です。テスト開始前にサンプルサイズを決め、そのサイズに達するまで待ち、結果を 1 回だけ確認します。途中で何も壊れていないか確認するのは問題ありません。数値が良さそうだからという理由で打ち切るのはいけません。

Meta と Google Ads はテスト期間について何と言っているか

  • Meta のA/B テストのベストプラクティスでは、少なくとも 7 日間のテストを推奨しており、それより短いテストは結論の出ない結果になる可能性があるとし、A/B テストの上限を 30 日としています。同じページでは、通常顧客がコンバージョンに 7 日以上かかる場合はより長く実施することを勧めています。
  • Meta は通常、推定検出力 80% 以上を推奨しており、ここでのデフォルトの検出力です。A/B の結果には信頼度のパーセンテージが表示され、A/B テストでは 65% 以上を勝ちの結果として扱います。この数値は Meta 独自の手法によるもので、このページの信頼水準とは別物なので、両者は一致しません。
  • Meta はまた、広告セットのオン・オフを切り替えて非公式にテストすることを勧めていません。オーディエンスが重複する可能性があるためで、両方のバージョンに同じ予算を設定することを推奨しています。
  • Google Ads は実験を 2〜3 週間実施することを推奨しており、デフォルトで 80% の信頼区間を表示し、リクエストに応じて他の水準も表示します。有意な結果には青いアスタリスクが付きます。その統計手法はアームごとに 20 バケットのジャックナイフ再標本化を使うため、その区間も z 検定とは正確には一致しません。

この計算ツールができないこと

  • これは 2 つのバージョンを比較します。3 つ以上の場合、比較が増えるごとに偽の勝者が出るチャンスが増えますが、ここのシンプルなテストはそれを調整しません。
  • これはコンバージョン率をテストするもので、訪問者あたりの収益や注文額はテストしません。それらには別のテストが必要です。
  • これは逐次検定ではありません。計画したサンプルサイズで結果を 1 回だけ確認することを前提としています。
  • あなたの分割が公平だったかは判断できません。一方のバージョンが異なるオーディエンス、予算、時間帯を受けた場合、どんな計算式もそれを修正できません。

数値を手計算したくない場合

Hermoso はマーケティングの自動操縦です。何をスケールし、停止し、次にテストすべきかを尋ねると、接続したすべての広告プラットフォームを読み取り、データが少なすぎるキャンペーンは判断せずに別のバケットに分け、提案する各テストに仮説、変更すべき 1 点、判断する指標、予算、期間を付けます。またテスト用のブランドに沿った画像や動画のバリエーションを作成し、あなた自身の広告アカウント上でキャンペーンを一時停止状態で構築します。ウェブアプリ内でも、MCP サーバーを通じて Claude、ChatGPT、Cursor の中でも動作します。テストで勝者が決まったら、無料の ROAS 計算ツールが、それが利益になるかどうかも教えてくれます。

無料ツール: · ROAS計算ツール · 広告コピー文字数チェッカー

よくある質問

広告の A/B テストが統計的に有意かどうか、どうすればわかりますか?

両バージョンの訪問者数とコンバージョン数を入力してください。計算ツールは2標本比率の z 検定を実行し、両側 p 値を返します。信頼度95%で、p 値が 0.05 未満であれば、その差は偶然である可能性が低いことを意味します。10,000 中 200 と 10,000 中 245 の場合、p は 0.031 なので B が勝ちます。

A/B テストには何人の訪問者が必要ですか?

それはコンバージョン率と、検出したい最小のリフトによって決まります。コンバージョン率2%で、信頼度95%・検出力80%において20%のリフトを見つけるには、バージョンごとに 21,109 人の訪問者が必要です。10%のリフトなら 80,682 人かかります。

計算ツールがまだデータが足りないと表示するのはなぜですか?

z 検定は大標本の近似です。この計算ツールは、NIST e-Handbook に示された基準の1つにならい、各バージョンが少なくとも5件のコンバージョンと5件の非コンバージョンを持つまで待ってから判定を出します。

有意に見えた時点ですぐにテストを止められますか?

信頼度の数値を本来の意味どおりにしたいなら、止めてはいけません。繰り返し確認して最初に有意になった時点で止めると、偶然が線を越える機会が増え、実際の偽陽性率が選んだ値より高くなってしまいます。先にサンプルサイズを決めて、結果は一度だけ読んでください。

Meta の A/B テストはどれくらいの期間実施すべきですか?

Meta は最低7日間を推奨し、それより短いテストは結論が出ない可能性があるとしており、最長30日間まで認めています。Google Ads は実験に2~3週間を推奨しています。1日あたりのトラフィックとともにサンプルサイズのタブを使って、ご自身のテストに必要な期間を確認してください。

入力した内容はどこかに送信されますか?

いいえ。計算はブラウザ上で実行されます。入力内容を運ぶネットワークリクエストはなく、何も保存されません。

Hermoso は、あなたの広告アカウント全体で何を拡大し、停止し、次にテストすべきかを教えてくれます。無料で開始、250以上の獲得可能な無料クレジット、カード不要。

無料で始める →   料金を見る