广告 A/B 测试计算器:显著性与样本量

输入两个版本的访问者数和转化数,看看差距是否真实;或者输入你的转化率和你关心的提升幅度,看看测试需要多少访问者。两个公式都写了出来,并附有计算示例。

免费工具 在你的浏览器中计算。不发送、不存储、不记录任何内容:本页另一端没有服务器。

两个问题,一个计算器

每次广告测试都会按顺序提出两个问题。开始前:要发现我在意的差异,需要多少访客?结束后:A 和 B 之间的差距是真实的,还是可能只是偶然?请按此顺序使用上方的两个标签页。先算出样本量,才能让第二个问题的答案真正有意义。

“访客”可以是落地页访客、链接点击,或任何获得公平转化机会的人,只要两个版本采用相同的计数方式即可。“转化”是指完成你所测试行为的人。

显著性检验的工作原理

本计算器运行双比例 z 检验,这是 NIST/SEMATECH 统计方法电子手册中描述的用于比较两个比率的大样本检验:

  • 合并比率 p = (A 的转化数 + B 的转化数)÷(A 的访客数 + B 的访客数)。
  • z = (比率 B − 比率 A)÷ √(p × (1 − p) × (1/A 的访客数 + 1/B 的访客数))。
  • 双侧 p 值 = 2 × (1 − Φ(|z|)),其中 Φ 是标准正态分布。
  • 差异的区间为(比率 B − 比率 A)± z × √(比率 A × (1 − 比率 A) ÷ A 的访客数 + 比率 B × (1 − 比率 B) ÷ B 的访客数)。提升范围是将其除以比率 A,这把比率 A 当作已知,因此是一个近似值。

实例演算。版本 A 从 10,000 位访客中获得 200 次转化(2.00%)。版本 B 从 10,000 位访客中获得 245 次(2.45%),相对提升 22.5%。合并比率为 445 ÷ 20,000 = 2.225%,标准误为 0.209 个百分点,z = 0.45 ÷ 0.209 = 2.157。双侧 p 值为 0.031,低于 0.05,因此在 95% 置信度下 B 获胜。差异的 95% 区间从 +0.04 到 +0.86 个百分点:B 更好,但真实的提升可能在大约 2% 到 43% 之间。

该检验是一个需要足够数据的近似方法。NIST 手册给出了一个标准:至少 5 次成功和 5 次失败。在每个版本都有 5 次转化和 5 次未转化之前,计算器会暂不下结论,并显示数据还不够。数据少于此时,NIST 推荐使用适用于小样本的精确检验,但对于广告测试,实用的做法是继续运行它。

样本量是如何算出的

对于双侧检验,每个版本的访客数:

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

这里 p1 是你当前的转化率,p2 是应用提升后的转化率,p̄ 是两者的平均值。这是不含连续性校正的正态近似,其形式与 NIST 手册中的单比例样本量公式相同,只是多加了一个分组。在 95% 置信度下,z1−α/2 为 1.959964;在 80% 效能下,z1−β 为 0.841621。

计算示例。转化率为 2%,你想捕捉 20% 的提升,也就是 2.0% 对比 2.4%。平均转化率是 2.2%。分子部分为 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811,平方后为 0.3377,再除以 0.004² 得到每个版本 21,109 名访客,合计 42,218 名。按每天 3,000 名访客计算,就是 15 天。

你要求的提升幅度影响最大。在同样的 2% 转化率下,30% 的提升需要每个版本 9,798 名访客,而 10% 的提升则需要 80,682 名。提升幅度减半,所需流量大约翻两番,因为这个差距在公式分母中是平方项。

为什么提前停止会抬高误报率

95% 的置信度意味着:当 A 和 B 的真实转化率相同时,一次固定样本量的测试仍有约 5% 的概率判出赢家。只有在你只看一次、在结束时才看时,这 5% 才成立。

每天查看结果,并在第一次显示显著时就停止,这是另一种做法。随着数据进来,转化率会上下波动,每看一次就是一次让偶然差距越过阈值的机会。在第一次越线时停止,你就挑中了最幸运的时刻,于是真实的误报率会超过 5%,而且看得越频繁,误报率越高。屏幕上的 p 值并不知道你偷看过,所以它读起来仍像你只看了一次。

解决办法很枯燥,但有效:在测试开始前就确定样本量,让它达到那个规模,然后只读一次结果。中途查看一下有没有出故障是没问题的,但因为数字看着好就停止,就不行。

Meta 和 Google Ads 对测试时长的说法

  • Meta 的 A/B 测试最佳实践建议测试至少持续 7 天,指出短于这个时长的测试可能得出无定论的结果,并把 A/B 测试上限设为 30 天。同一页还建议:如果客户通常需要超过 7 天才会转化,就把测试运行得更久一些。
  • Meta 通常建议预估效能为 80% 或更高,这也是本计算器的默认效能。它的 A/B 结果会显示一个置信度百分比,并把 65% 或更高视为 A/B 测试的获胜结果。这个数字来自 Meta 自己的方法,与本页的置信度不是一回事,所以两者不会吻合。
  • Meta 还不建议通过开关广告组来做非正式测试,因为受众可能重叠,并建议两个版本使用相同的预算。
  • Google Ads 建议让实验运行 2 到 3 周,默认显示 80% 的置信区间(可按需选择其他水平),并用蓝色星号标记显著结果。它的统计方法在每个分支的 20 个分桶上使用刀切法重采样,所以它的区间也不会与 z 检验完全一致。

这个计算器不做什么

  • 它比较的是两个版本。如果有三个或更多版本,每多一次比较就多一次出现假赢家的机会,而这里的简单检验并不会为此做调整。
  • 它检验的是转化率,不是每访客收入或订单价值,后者需要不同的检验方法。
  • 它不是序贯检验。它假定你只读一次结果,且在你计划好的样本量上读取。
  • 它无法判断你的分流是否公平。如果某个版本拿到了不同的受众、预算或投放时段,任何公式都无法弥补这一点。

如果你不想手动算这些数字

Hermoso 让营销自动驾驶。问它接下来该扩量、暂停还是测试什么,它会读取你连接的每个广告平台,把数据太少的广告系列单独归入一类而不去评判它们,并为每个建议的测试给出假设、唯一要改动的那一项、决定胜负的指标、预算和时长。它还会生成符合品牌调性的图片和视频变体供你测试,并在你自己的广告账户中创建广告系列,创建时为暂停状态。它可在网页应用中运行,也可通过其 MCP 服务器在 Claude、ChatGPT 和 Cursor 中运行。一旦测试有了赢家,免费的 ROAS 计算器会告诉你它是否也盈利。

免费工具: · ROAS 计算器 · 广告文案长度检查器

常见问题

我怎么知道我的广告 A/B 测试是否具有统计显著性?

输入两个版本的访问者数和转化数。计算器会进行双比例 z 检验并给出双侧 p 值。在 95% 置信度下,p 值低于 0.05 意味着差距不太可能是偶然。对于 10,000 中 200 对 10,000 中 245,p 为 0.031,所以 B 胜出。

一次 A/B 测试需要多少访问者?

这取决于你的转化率和你想检测的最小提升幅度。在 2% 的转化率下,以 95% 置信度和 80% 功效检测 20% 的提升需要每个版本 21,109 名访问者。检测 10% 的提升则需要 80,682 名。

为什么计算器说数据还不够?

z 检验是一种大样本近似。计算器会等到每个版本都至少有 5 次转化和 5 次未转化(这是 NIST 电子手册给出的一项标准之一)后才给出结论。

我可以一看到结果显著就停止测试吗?

如果你希望置信水平名副其实,就不要这样做。反复查看并在第一次读到显著结果时停止,会给偶然更多越过界线的机会,于是真实的假阳性率最终会高于你所选定的那个。先设定好样本量,然后只读一次结果。

Meta 的 A/B 测试应该运行多久?

Meta 建议至少运行 7 天,表示更短的测试可能无法得出结论,并最多允许 30 天。Google Ads 建议实验运行 2 到 3 周。用样本量标签页结合你的每日流量,看看你自己的测试需要运行多久。

我输入的内容会被发送到任何地方吗?

不会。计算在你的浏览器中进行。没有任何网络请求携带你输入的内容,也不会存储任何东西。

Hermoso 会告诉你在各个广告账户中接下来该扩量、暂停和测试什么。免费开始,可赚取 250+ 免费积分,无需绑卡。

免费开始 →   查看价格