광고용 A/B 테스트 계산기: 유의성과 표본 크기

두 버전의 방문자 수와 전환 수를 입력하면 차이가 실제인지 알 수 있고, 전환율과 관심 있는 상승분을 입력하면 테스트에 몇 명의 방문자가 필요한지 알 수 있습니다. 두 공식 모두 풀이와 예제와 함께 설명되어 있습니다.

무료 도구 브라우저에서 계산합니다. 어떤 것도 전송, 저장, 기록되지 않습니다: 이 페이지 반대편에는 서버가 없습니다.

두 가지 질문, 하나의 계산기

모든 광고 테스트는 이 순서로 두 가지를 묻습니다. 시작하기 전에: 내가 관심 있는 차이를 찾으려면 방문자가 몇 명 필요한가? 끝난 후에: A와 B의 차이가 실제인가, 아니면 우연일 수 있는가? 위의 두 탭을 그 순서대로 사용하십시오. 표본 크기를 먼저 구하는 것이 두 번째 질문에 대한 답을 의미 있게 만듭니다.

“방문자”는 랜딩 페이지 방문자, 링크 클릭 또는 전환할 공정한 기회를 얻은 누구든 될 수 있으며, 두 버전을 동일한 방식으로 집계하기만 하면 됩니다. “전환”은 테스트 대상이 되는 행동을 한 사람들입니다.

유의성 검정의 작동 방식

이 계산기는 NIST/SEMATECH e-Handbook of Statistical Methods에 설명된, 두 전환율을 비교하는 대표본 검정인 2-비율 z-검정을 실행합니다:

  • 통합 전환율 p = (전환 A + 전환 B) ÷ (방문자 A + 방문자 B).
  • z = (전환율 B − 전환율 A) ÷ √(p × (1 − p) × (1/방문자 A + 1/방문자 B)).
  • 양측 p-값 = 2 × (1 − Φ(|z|)), 여기서 Φ는 표준정규분포입니다.
  • 차이에 대한 구간은 (전환율 B − 전환율 A) ± z × √(전환율 A × (1 − 전환율 A) ÷ 방문자 A + 전환율 B × (1 − 전환율 B) ÷ 방문자 B)입니다. 향상 범위는 이를 전환율 A로 나누며, 이는 전환율 A를 알려진 값으로 취급하므로 근사치입니다.

계산 예시. 버전 A는 방문자 10,000명 중 200건 전환(2.00%). 버전 B는 10,000명 중 245건(2.45%)으로 상대 향상 22.5%입니다. 통합 전환율은 445 ÷ 20,000 = 2.225%, 표준 오차는 0.209퍼센트포인트, z = 0.45 ÷ 0.209 = 2.157입니다. 양측 p-값은 0.031로 0.05보다 낮으므로 95% 신뢰수준에서 B가 승리합니다. 차이에 대한 95% 구간은 +0.04에서 +0.86퍼센트포인트입니다. B가 더 낫지만, 실제 향상은 약 2%에서 43% 사이 어디든 될 수 있습니다.

이 검정은 충분한 데이터가 필요한 근사치입니다. NIST 핸드북은 하나의 기준을 제시합니다: 성공 5건과 실패 5건 이상. 이 계산기는 각 버전이 전환 5건과 비전환 5건에 도달할 때까지 판정을 보류하고 아직 데이터가 충분하지 않음이라고 표시합니다. 그보다 적으면 NIST는 소표본용 정확 검정을 안내하지만, 광고 테스트에서 실용적인 답은 계속 진행하는 것입니다.

표본 크기 계산 방식

양측 검정의 경우, 버전당 방문자 수:

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

여기서 p1은 현재 전환율, p2는 상승폭을 적용한 전환율, p̄는 둘의 평균입니다. 연속성 보정을 하지 않은 정규 근사이며, NIST 핸드북의 단일 비율 표본 크기 공식에 두 번째 그룹을 추가한 것과 같은 형태입니다. 95% 신뢰 수준에서 z1−α/2는 1.959964, 80% 검정력에서 z1−β는 0.841621입니다.

계산 예시. 전환율 2%에서 20% 상승을 감지하려면 2.0% 대 2.4%를 비교합니다. 평균 전환율은 2.2%입니다. 분자는 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811이고, 제곱하면 0.3377이며, 0.004²로 나누면 버전당 방문자 21,109명, 전체 42,218명이 나옵니다. 하루 3,000명이라면 15일입니다.

요구하는 상승폭이 가장 큰 영향을 줍니다. 같은 2% 전환율에서 30% 상승은 버전당 9,798명, 10% 상승은 80,682명이 필요합니다. 상승폭을 절반으로 줄이면 트래픽은 대략 네 배가 되는데, 그 차이가 공식의 분모에서 제곱되기 때문입니다.

조기 종료가 거짓 양성을 부풀리는 이유

95% 신뢰 수준은 A와 B의 전환율이 실제로 같을 때, 고정된 표본 크기로 한 번 검정하면 그래도 약 5%의 경우에 승자가 나온다는 뜻입니다. 그 5%는 끝에 한 번만 볼 때에만 성립합니다.

매일 결과를 확인하다가 유의미하게 나온 첫 순간에 멈추는 것은 다른 절차입니다. 데이터가 쌓이면서 전환율이 요동치고, 볼 때마다 우연한 차이가 기준선을 넘을 또 하나의 기회가 됩니다. 처음 넘는 순간에 멈추면 가장 운 좋은 순간을 고른 셈이라, 실제 거짓 양성 비율은 5%를 넘게 되고 자주 볼수록 더 커집니다. 화면의 p값은 당신이 중간에 들여다본 것을 모르므로, 한 번만 본 것처럼 그대로 표시됩니다.

해결책은 지루하지만 효과가 있습니다. 검정을 시작하기 전에 표본 크기를 정하고, 그 크기에 도달하게 두고, 결과를 한 번만 확인하는 것입니다. 중간에 아무 이상이 없는지 확인하는 것은 괜찮습니다. 숫자가 좋아 보인다고 멈추는 것은 안 됩니다.

Meta와 Google Ads가 말하는 테스트 기간

  • Meta의 A/B 테스트 모범 사례는 최소 7일간의 테스트를 권장하며, 그보다 짧은 테스트는 결론을 내기 어려울 수 있다고 하고, A/B 테스트를 최대 30일로 제한합니다. 같은 페이지에서는 고객이 보통 전환까지 7일 넘게 걸린다면 더 길게 진행하라고 권합니다.
  • Meta는 일반적으로 추정 검정력 80% 이상을 권장하며, 이는 여기의 기본 검정력과 같습니다. Meta의 A/B 결과는 신뢰도 백분율을 보여주고, A/B 테스트에서는 65% 이상을 승리 결과로 봅니다. 이 수치는 Meta 자체 방식에서 나온 것이라 이 페이지의 신뢰 수준과는 다른 개념이므로, 두 값은 일치하지 않습니다.
  • Meta는 또한 광고 세트를 켜고 끄며 비공식적으로 테스트하지 말라고 권고합니다. 대상이 겹칠 수 있기 때문이며, 두 버전에 같은 예산을 쓰도록 권장합니다.
  • Google Ads는 실험을 2~3주간 진행하도록 권장하고, 기본적으로 80% 신뢰 구간을 보여주며 요청 시 다른 수준도 제공하고, 유의미한 결과는 파란색 별표로 표시합니다. 그 통계 방식은 각 그룹당 20개 버킷에 잭나이프 리샘플링을 사용하므로, 그 구간도 z-검정과 정확히 일치하지는 않습니다.

이 계산기가 하지 않는 것

  • 두 버전을 비교합니다. 세 개 이상이면 추가 비교마다 거짓 승자가 나올 가능성이 또 생기는데, 여기의 단순한 검정은 그에 대해 보정하지 않습니다.
  • 전환율을 검정하며, 방문자당 매출이나 주문 금액은 검정하지 않습니다. 그것들은 다른 검정이 필요합니다.
  • 순차 검정이 아닙니다. 계획한 표본 크기에서 결과를 한 번만 확인한다고 가정합니다.
  • 분할이 공정했는지는 알 수 없습니다. 한 버전이 다른 대상, 예산, 시간대를 받았다면 어떤 공식으로도 바로잡을 수 없습니다.

직접 계산하고 싶지 않다면

Hermoso는 자동 조종되는 마케팅입니다. 무엇을 확장하고, 중단하고, 다음에 테스트할지를 물어보면 연결된 모든 광고 플랫폼을 읽어, 데이터가 너무 적은 캠페인은 판단하지 않고 별도 그룹으로 분류하고, 제안하는 각 테스트마다 가설, 바꿀 한 가지, 결정 지표, 예산, 기간을 제시합니다. 또한 테스트할 브랜드에 맞는 이미지와 영상 변형을 만들고, 당신의 광고 계정에 일시중지 상태로 캠페인을 구성합니다. 웹 앱에서, 또는 MCP 서버를 통해 Claude, ChatGPT, Cursor 안에서 동작합니다. 테스트에 승자가 나오면 무료 ROAS 계산기가 그것이 수익성도 있는지 알려줍니다.

무료 도구: · ROAS 계산기 · 광고 카피 길이 체커

자주 묻는 질문

내 광고 A/B 테스트가 통계적으로 유의한지 어떻게 알 수 있나요?

두 버전의 방문자 수와 전환 수를 입력하십시오. 계산기는 두 비율의 z-검정을 실행해 양측 p-값을 제공합니다. 95% 신뢰 수준에서 p-값이 0.05 미만이면 그 차이가 우연일 가능성이 낮다는 뜻입니다. 10,000명 중 200명 대 10,000명 중 245명의 경우 p는 0.031이므로 B가 이깁니다.

A/B 테스트에는 방문자가 몇 명 필요한가요?

전환율과 감지하려는 최소 상승분에 따라 다릅니다. 전환율 2%에서 95% 신뢰 수준과 80% 검정력으로 20% 상승분을 찾으려면 버전당 21,109명의 방문자가 필요합니다. 10% 상승분이라면 80,682명이 필요합니다.

계산기가 아직 데이터가 충분하지 않다고 하는 이유는 무엇인가요?

z-검정은 대표본 근사입니다. 계산기는 각 버전이 최소 전환 5건과 비전환 5건을 가질 때까지 판정을 내리지 않으며, 이는 NIST e-Handbook에 제시된 기준 중 하나입니다.

유의해 보이는 즉시 테스트를 중단해도 되나요?

신뢰 수준이 그 의미대로 유지되길 원한다면 안 됩니다. 반복적으로 확인하다가 처음 유의한 수치에서 멈추면 우연이 기준선을 넘을 기회가 더 많아져, 실제 거짓 양성률이 설정한 값보다 높아집니다. 먼저 표본 크기를 정하고 결과는 한 번만 읽으십시오.

Meta A/B 테스트는 얼마나 오래 실행해야 하나요?

Meta는 최소 7일을 권장하며, 더 짧은 테스트는 결론을 내리기 어려울 수 있다고 하고, 최대 30일까지 허용합니다. Google Ads는 실험에 2~3주를 권장합니다. 표본 크기 탭에 일일 트래픽을 입력해 본인의 테스트가 얼마나 오래 필요한지 확인하십시오.

입력한 내용이 어디로든 전송되나요?

아닙니다. 계산은 브라우저에서 실행됩니다. 입력한 내용을 전송하는 네트워크 요청이 없고 아무것도 저장되지 않습니다.

Hermoso는 광고 계정 전반에서 무엇을 확장하고, 중단하고, 다음에 테스트할지 알려 줍니다. 무료로 시작하고, 획득 가능한 무료 크레딧 250개 이상, 카드 불필요.

무료로 시작하기 →   가격 보기