A/B test calculator para sa ads: significance at sample size

Ilagay ang mga bisita at conversion para sa dalawang bersyon para makita kung totoo ang agwat, o ilagay ang iyong conversion rate at ang lift na mahalaga sa iyo para makita kung ilang bisita ang kailangan ng test. Nakasulat ang dalawang formula, kasama ang mga halimbawang ginamit.

Libreng tool Kinakalkula ito sa iyong browser. Walang ipinapadala, iniimbak o nila-log: walang server sa kabilang dulo ng pahinang ito.

Dalawang tanong, isang calculator

Bawat ad test ay nagtatanong ng dalawang bagay, sa ganitong pagkakasunod. Bago ito magsimula: ilang bisita ang kailangan para matuklasan ang pagkakaibang mahalaga sa akin? Pagkatapos nito: totoo ba ang agwat sa pagitan ng A at B, o posibleng tsamba lang? Gamitin ang dalawang tab sa itaas sa ganitong pagkakasunod. Ang pag-aalam muna ng sample size ang gumagawang may kabuluhan ang sagot sa pangalawang tanong.

Ang “mga bisita” ay maaaring mga bisita sa landing page, link click, o sinumang nabigyan ng patas na tsansang mag-convert, basta't pareho ang pagbibilang sa dalawang bersyon. Ang “mga conversion” ay ang mga taong gumawa ng bagay na sinusubukan mo.

Paano gumagana ang significance test

Nagpapatakbo ang calculator ng two-proportion z-test, ang large-sample test para sa paghahambing ng dalawang rate na inilarawan sa NIST/SEMATECH e-Handbook of Statistical Methods:

  • Pinagsamang rate p = (mga conversion A + mga conversion B) ÷ (mga bisita A + mga bisita B).
  • z = (rate B − rate A) ÷ √(p × (1 − p) × (1/bisita A + 1/bisita B)).
  • Two-sided p-value = 2 × (1 − Φ(|z|)), kung saan ang Φ ay ang standard normal distribution.
  • Ang interval para sa pagkakaiba ay (rate B − rate A) ± z × √(rate A × (1 − rate A) ÷ visitors A + rate B × (1 − rate B) ÷ visitors B). Hinahati ng lift range iyan sa rate A, na itinuturing ang rate A na alam na, kaya ito ay approximation.

Halimbawang nasolusyunan. Ang Version A ay nakakuha ng 200 conversion mula sa 10,000 bisita (2.00%). Ang Version B ay nakakuha ng 245 mula sa 10,000 (2.45%), isang 22.5% relative lift. Ang pooled rate ay 445 ÷ 20,000 = 2.225%, ang standard error ay 0.209 na percentage point, at z = 0.45 ÷ 0.209 = 2.157. Ang two-sided p-value ay 0.031, mas mababa sa 0.05, kaya sa 95% confidence nanalo ang B. Ang 95% interval para sa pagkakaiba ay mula +0.04 hanggang +0.86 na percentage point: mas mahusay ang B, ngunit ang tunay na lift ay maaaring nasaan mula sa humigit-kumulang 2% hanggang 43%.

Ang test ay approximation na nangangailangan ng sapat na data. Ang handbook ng NIST ay nagbibigay ng isang criterion: hindi bababa sa 5 success at 5 failure. Pinipigil ng calculator ang hatol nito at sinasabing hindi pa sapat ang data hanggang bawat bersyon ay may 5 conversion at 5 non-conversion. Sa mas kaunti pa riyan, itinuturo ng NIST ang isang exact test para sa maliliit na sample, ngunit para sa isang ad test ang praktikal na sagot ay panatilihin itong tumatakbo.

Paano kinakalkula ang sample size

Para sa two-sided test, mga bisita bawat bersyon:

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

Dito, ang p1 ay ang kasalukuyang rate mo, ang p2 ay ang rate na iyon na may inilapat na lift, at ang p̄ ay ang kanilang average. Ito ang normal approximation, na walang continuity correction, at kapareho ng hugis ng single-proportion sample size formula sa NIST handbook, na may idinagdag na pangalawang grupo. Sa 95% confidence, ang z1−α/2 ay 1.959964, at sa 80% power, ang z1−β ay 0.841621.

Halimbawang kinalkula. Isang 2% conversion rate, at gusto mong makita ang 20% lift, kaya 2.0% laban sa 2.4%. Ang average na rate ay 2.2%. Ang itaas na linya ay 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811, na kapag isina-square ay 0.3377, at kapag hinati sa 0.004² ay nagbibigay ng 21,109 na bisita kada bersyon, 42,218 sa kabuuan. Sa 3,000 na bisita kada araw, iyon ay 15 araw.

Ang lift na hinihingi mo ang pinakamahalaga. Sa parehong 2% rate, ang 30% lift ay nangangailangan ng 9,798 kada bersyon at ang 10% lift ay nangangailangan ng 80,682. Kapag hinati sa kalahati ang lift, halos nagiging apat na beses ang traffic, dahil ang puwang ay naka-square sa ibaba ng formula.

Bakit pinapalaki ng maagang paghinto ang mga false positive

Ang 95% confidence level ay nangangahulugang kapag talagang pareho ang conversion ng A at B, ang isang test sa nakapirming sample size ay nagdedeklara pa rin ng panalo mga 5% ng panahon. Totoo lang ang 5% na iyon kung titingnan mo ito nang isang beses, sa dulo.

Ang pagtingin sa resulta araw-araw at paghinto sa unang pagkakataon na lumabas itong significant ay ibang proseso. Gumagala ang mga rate habang pumapasok ang data, at bawat tingin ay isa pang pagkakataon na matawid ng isang chance gap ang linya. Huminto ka sa unang pagtawid at napili mo ang pinakamasuwerteng sandali, kaya ang tunay na false-positive rate ay nagiging mas mataas sa 5%, at lumalaki ito kapag mas madalas kang tumingin. Hindi alam ng p-value sa screen na sumilip ka, kaya mukha pa rin itong parang isang beses kang tumingin.

Ang solusyon ay nakakabagot pero gumagana: desidihan ang sample size bago magsimula ang test, hayaan itong maabot ang laking iyon, at basahin ang resulta nang isang beses. OK lang na tumingin sa gitna para tingnan kung may sira. Hindi OK na huminto dahil maganda ang hitsura ng numero.

Ano ang sinasabi ng Meta at Google Ads tungkol sa haba ng test

  • Inirerekomenda ng A/B testing best practices ng Meta ang mga test na hindi bababa sa 7 araw, sinasabing ang mga test na mas maikli diyan ay maaaring magbigay ng walang katiyakang resulta, at nililimitahan ang mga A/B test sa 30 araw. Iminumungkahi ng parehong pahina na patakbuhin nang mas matagal kung ang mga customer ay karaniwang tumatagal nang mahigit 7 araw bago mag-convert.
  • Karaniwang iminumungkahi ng Meta ang tinatayang power na 80% o mas mataas, ang default na power dito. Ang mga A/B result nito ay nagpapakita ng porsyento ng confidence, at itinuturing nitong panalong resulta para sa isang A/B test ang 65% o mas mataas. Ang bilang na iyon ay nagmumula sa sariling pamamaraan ng Meta at hindi pareho sa confidence level sa pahinang ito, kaya hindi magtutugma ang dalawa.
  • Hindi rin inirerekomenda ng Meta ang impormal na pagte-test sa pamamagitan ng pag-on at pag-off ng mga ad set, dahil maaaring mag-overlap ang mga audience, at inirerekomenda ang parehong budget para sa dalawang bersyon.
  • Inirerekomenda ng Google Ads na hayaang tumakbo ang isang experiment sa loob ng 2 hanggang 3 linggo, nagpapakita ng 80% confidence interval bilang default na may iba pang antas kapag hiniling, at minamarkahan ang mga significant na resulta ng asul na asterisk. Ang istatistikal na pamamaraan nito ay gumagamit ng jackknife resampling sa 20 bucket kada arm, kaya hindi rin eksaktong magtutugma ang mga interval nito sa isang z-test.

Ano ang hindi ginagawa ng calculator na ito

  • Nagkukumpara ito ng dalawang bersyon. Sa tatlo o higit pa, bawat karagdagang paghahambing ay isa pang pagkakataon ng maling panalo, at ang simpleng test dito ay hindi nag-aadjust para diyan.
  • Sinusuri nito ang mga conversion rate, hindi ang kita kada bisita o order value, na nangangailangan ng ibang test.
  • Hindi ito sequential test. Ipinapalagay nito na babasahin mo ang resulta nang isang beses, sa sample size na binalak mo.
  • Hindi nito masasabi kung patas ang iyong split. Kung ang isang bersyon ay nakakuha ng ibang audience, budget o oras ng araw, walang formula ang makakaayos niyan.

Kung ayaw mong gawin ang mga numero nang mano-mano

Ang Hermoso ay marketing na naka-autopilot. Tanungin mo ito kung ano ang i-scale, i-pause at susunod na i-test at babasahin nito ang bawat ad platform na ikinonekta mo, ilalagay nito ang mga campaign na may masyadong kakaunting data sa sariling bucket nila sa halip na husgahan ang mga ito, at bibigyan ang bawat iminungkahing test ng hypothesis, ang isang bagay na babaguhin, ang metric na magdedesisyon nito, isang budget at isang tagal. Gumagawa rin ito ng on-brand na mga image at video variant para i-test, at bumubuo ng mga campaign sa sarili mong ad account, likhang naka-pause. Gumagana ito sa web app, o sa loob ng Claude, ChatGPT at Cursor sa pamamagitan ng MCP server nito. Kapag may panalo na ang isang test, sasabihin sa iyo ng libreng ROAS calculator kung kumikita rin ba ito.

Mga libreng tool: · Kalkulator ng ROAS · Tseker ng haba ng ad copy

Mga madalas na tanong

Paano ko malalaman kung statistically significant ang A/B test ng aking ad?

Ilagay ang mga bisita at conversion para sa parehong bersyon. Nagpapatakbo ang calculator ng two-proportion z-test at nagbibigay ng two-sided p-value. Sa 95% confidence, ang p-value na mas mababa sa 0.05 ay nangangahulugang malamang hindi tsamba ang agwat. Para sa 200 ng 10,000 laban sa 245 ng 10,000, ang p ay 0.031, kaya nanalo ang B.

Ilang bisita ang kailangan ng isang A/B test?

Nakadepende ito sa iyong conversion rate at sa pinakamaliit na lift na gusto mong matukoy. Sa 2% conversion rate, ang paghahanap ng 20% lift sa 95% confidence at 80% power ay nangangailangan ng 21,109 na bisita bawat bersyon. Ang 10% lift ay nangangailangan ng 80,682.

Bakit sinasabi ng calculator na kulang pa ang data?

Ang z-test ay isang large-sample approximation. Naghihintay ang calculator hanggang may hindi bababa sa 5 conversion at 5 non-conversion ang bawat bersyon, isang pamantayang nasa NIST e-Handbook, bago ito magbigay ng hatol.

Puwede ko bang itigil ang test sa sandaling mukhang significant na ito?

Hindi kung gusto mong may kahulugan ang antas ng confidence. Ang paulit-ulit na pagtingin at pagtigil sa unang significant na reading ay nagbibigay sa tsamba ng mas maraming pagkakataong tumawid sa linya, kaya ang totoong false-positive rate ay nagiging mas mataas kaysa sa pinili mo. Itakda muna ang sample size at basahin ang resulta nang isang beses.

Gaano katagal dapat tumakbo ang isang Meta A/B test?

Inirerekomenda ng Meta ang hindi bababa sa 7 araw, sinasabing maaaring walang katiyakan ang mas maiikling test, at pinapayagan hanggang 30 araw. Inirerekomenda ng Google Ads ang 2 hanggang 3 linggo para sa mga eksperimento. Gamitin ang sample size tab kasama ang iyong daily traffic para makita kung gaano katagal kailangan ng sarili mong test.

May ipinapadala ba kahit saan ang kahit ano na i-type ko?

Hindi. Tumatakbo ang mga kuwenta sa iyong browser. Walang network request na nagdadala ng iyong tina-type at walang itinatago.

Sinasabi sa iyo ng Hermoso kung ano ang isusunod mong i-scale, i-pause at i-test sa iyong mga ad account. Magsimula nang libre, 250+ na makukuhang libreng credit, walang card.

Magsimula nang libre →   Tingnan ang presyo