İki soru, tek hesaplayıcı
Her reklam testi şu sırayla iki şey sorar. Başlamadan önce: önemsediğim farkı bulmak için kaç ziyaretçiye ihtiyacı var? Bittikten sonra: A ile B arasındaki fark gerçek mi, yoksa rastlantısal mı olabilir? Yukarıdaki iki sekmeyi bu sırayla kullanın. İkinci sorunun cevabını anlamlı kılan şey, önce örneklem boyutunu hesaplamaktır.
“Ziyaretçiler” açılış sayfası ziyaretçileri, bağlantı tıklamaları veya dönüşüm sağlama şansı adil olan herkes olabilir; yeter ki her iki sürüm de aynı şekilde sayılsın. “Dönüşümler”, test ettiğiniz eylemi gerçekleştiren kişilerdir.
Anlamlılık testi nasıl çalışır
Hesaplayıcı, iki oranı karşılaştırmak için kullanılan büyük örneklem testi olan iki oranlı z-testini çalıştırır; bu test NIST/SEMATECH e-Handbook of Statistical Methods içinde açıklanmıştır:
- Havuzlanmış oran p = (dönüşüm A + dönüşüm B) ÷ (ziyaretçi A + ziyaretçi B).
- z = (oran B − oran A) ÷ √(p × (1 − p) × (1/ziyaretçi A + 1/ziyaretçi B)).
- İki taraflı p-değeri = 2 × (1 − Φ(|z|)), burada Φ standart normal dağılımdır.
- Fark için aralık (oran B − oran A) ± z × √(oran A × (1 − oran A) ÷ ziyaretçi A + oran B × (1 − oran B) ÷ ziyaretçi B) şeklindedir. Artış aralığı bunu oran A'ya böler ve bu da oran A'yı bilinen kabul eder, bu yüzden bir yaklaşımdır.
Çözümlü örnek. Sürüm A, 10.000 ziyaretçiden 200 dönüşüm alır (%2,00). Sürüm B, 10.000'den 245 alır (%2,45), yani %22,5'lik göreli bir artış. Havuzlanmış oran 445 ÷ 20.000 = %2,225, standart hata 0,209 yüzde puanı ve z = 0,45 ÷ 0,209 = 2,157'dir. İki taraflı p-değeri 0,031 olup 0,05'in altındadır, bu yüzden %95 güvende B kazanır. Fark için %95 aralığı +0,04 ile +0,86 yüzde puanı arasındadır: B daha iyidir, ancak gerçek artış kabaca %2 ile %43 arasında herhangi bir yerde olabilir.
Test, yeterli veri gerektiren bir yaklaşımdır. NIST'in el kitabı bir ölçüt verir: en az 5 başarı ve 5 başarısızlık. Hesaplayıcı, her sürümün 5 dönüşümü ve 5 dönüşümsüzü olana kadar kararını saklar ve henüz yeterli veri yok der. Bundan azı için NIST bir küçük örneklemler için kesin test önerir, ancak bir reklam testi için pratik cevap testi çalışır durumda tutmaktır.
Örneklem boyutu nasıl hesaplanır
İki taraflı bir test için, sürüm başına ziyaretçi:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Burada p1 mevcut oranınız, p2 artış uygulanmış halidir ve p̄ ikisinin ortalamasıdır. Bu, süreklilik düzeltmesi olmayan normal yaklaşımdır ve NIST el kitabındaki tek oranlı örneklem büyüklüğü formülü ile aynı şekle sahiptir, buna ikinci bir grup eklenmiştir. %95 güvende z1−α/2 1,959964, %80 güçte ise z1−β 0,841621 olur.
Çözümlü örnek. %2 dönüşüm oranı var ve %20'lik bir artışı yakalamak istiyorsunuz, yani %2,0'a karşı %2,4. Ortalama oran %2,2. Üst satır 1,959964 × 0,2074 + 0,841621 × 0,2074 = 0,5811, karesi 0,3377 ve 0,004²'ye bölündüğünde sürüm başına 21.109 ziyaretçi, toplamda 42.218 verir. Günde 3.000 ziyaretçide bu 15 gündür.
En çok önemli olan talep ettiğiniz artıştır. Aynı %2 oranında, %30'luk bir artış için sürüm başına 9.798, %10'luk bir artış için 80.682 gerekir. Artışı yarıya indirmek trafiği kabaca dört katına çıkarır, çünkü fark formülün alt kısmında karesi alınmış olarak durur.
Erken durdurmak neden yanlış pozitifleri artırır
%95'lik bir güven düzeyi, A ve B gerçekten aynı oranda dönüşüm sağladığında, sabit örneklem büyüklüğünde yapılan tek bir testin yine de yaklaşık %5 oranında bir kazanan ilan edeceği anlamına gelir. Bu %5 yalnızca bir kez, sonda baktığınızda geçerlidir.
Sonucu her gün kontrol edip ilk kez anlamlı göründüğünde durmak farklı bir yöntemdir. Veri geldikçe oranlar dolaşır ve her bakış, rastlantısal bir farkın sınırı aşması için başka bir fırsattır. İlk aşmada durursanız en şanslı anı seçmiş olursunuz, dolayısıyla gerçek yanlış pozitif oranı %5'in üstüne çıkar ve ne kadar sık bakarsanız o kadar büyür. Ekrandaki p-değeri gizlice baktığınızı bilmez, bu yüzden hâlâ bir kez bakmışsınız gibi görünür.
Çözüm sıkıcıdır ama işe yarar: testten önce örneklem büyüklüğünü belirleyin, o büyüklüğe ulaşmasına izin verin ve sonucu bir kez okuyun. Ortada bir şeyin bozulmadığını kontrol etmek için bakmak sorun değil. Sayı iyi göründüğü için durmak sorun.
Meta ve Google Ads test süresi hakkında ne diyor
- Meta'nın A/B testi en iyi uygulamaları en az 7 günlük testler önerir, bundan kısa testlerin sonuçsuz kalabileceğini söyler ve A/B testlerini 30 günle sınırlar. Aynı sayfa, müşterilerin dönüşüm yapması genellikle 7 günden uzun sürüyorsa testi daha uzun süre çalıştırmayı önerir.
- Meta genellikle %80 veya daha yüksek bir tahmini güç önerir, burada da varsayılan güç budur. A/B sonuçları bir güven yüzdesi gösterir ve A/B testi için %65 veya üzerini kazanan sonuç olarak kabul eder. Bu rakam Meta'nın kendi yönteminden gelir ve bu sayfadaki güven düzeyiyle aynı şey değildir, bu yüzden ikisi uyuşmayacaktır.
- Meta ayrıca, kitleler çakışabileceğinden, reklam setlerini açıp kapatarak gayri resmi test yapmamanızı önerir ve her iki sürüm için aynı bütçeyi tavsiye eder.
- Google Ads bir deneyi 2 ila 3 hafta çalıştırmanızı önerir, varsayılan olarak %80 güven aralığı gösterir ve istek üzerine başka düzeyler sunar, anlamlı sonuçları mavi bir yıldız işaretiyle belirtir. İstatistiksel yöntemi kol başına 20 kova üzerinde jackknife yeniden örneklemesi kullanır, bu yüzden aralıkları da bir z-testiyle tam olarak uyuşmaz.
Bu hesaplayıcının yapmadıkları
- İki sürümü karşılaştırır. Üç veya daha fazlasında, her ek karşılaştırma yanlış bir kazanan ihtimalini artırır ve buradaki basit test bunu düzeltmez.
- Dönüşüm oranlarını test eder, ziyaretçi başına geliri veya sipariş değerini değil; bunlar farklı bir test gerektirir.
- Bu sıralı bir test değildir. Sonucu, planladığınız örneklem büyüklüğünde bir kez okuduğunuzu varsayar.
- Bölüşümünüzün adil olup olmadığını söyleyemez. Bir sürüm farklı bir kitle, bütçe veya günün farklı bir saatini aldıysa, hiçbir formül bunu düzeltmez.
Sayıları elle hesaplamak yerine
Hermoso otomatik pilotta pazarlamadır. Ona neyi ölçekleyeceğinizi, duraklatacağınızı ve bir sonraki olarak test edeceğinizi sorun; bağladığınız her reklam platformunu okur, çok az verisi olan kampanyaları değerlendirmek yerine kendi grubuna koyar ve önerdiği her teste bir hipotez, değiştirilecek tek şey, kararı veren metrik, bir bütçe ve bir süre verir. Ayrıca test etmek için markaya uygun görsel ve video varyantları oluşturur ve kendi reklam hesaplarınızda duraklatılmış olarak kampanyalar kurar. Web uygulamasında ya da MCP sunucusu aracılığıyla Claude, ChatGPT ve Cursor içinde çalışır. Bir testin kazananı belli olduğunda, ücretsiz ROAS hesaplayıcı bunun kârlı olup olmadığını da söyler.
Ücretsiz araçlar: · ROAS hesaplayıcı · Reklam metni uzunluğu denetleyici
Sık sorulan sorular
Reklam A/B testimin istatistiksel olarak anlamlı olup olmadığını nasıl anlarım?
Her iki sürümün ziyaretçi ve dönüşüm sayılarını girin. Hesaplayıcı iki oranlı bir z-testi çalıştırır ve iki yönlü bir p-değeri verir. %95 güvende, 0,05'in altındaki bir p-değeri farkın tesadüf olma ihtimalinin düşük olduğu anlamına gelir. 10.000'de 200'e karşı 10.000'de 245 için p 0,031'dir, yani B kazanır.
Bir A/B testi kaç ziyaretçiye ihtiyaç duyar?
Bu, dönüşüm oranınıza ve tespit etmek istediğiniz en küçük artışa bağlıdır. %2 dönüşüm oranında, %95 güven ve %80 güçle %20'lik bir artışı bulmak sürüm başına 21.109 ziyaretçi gerektirir. %10'luk bir artış 80.682 gerektirir.
Hesaplayıcı neden henüz yeterli veri yok diyor?
Z-testi büyük örneklem yaklaşımıdır. Hesaplayıcı, bir karar vermeden önce NIST e-Handbook'ta verilen kriterlerden biri gereğince her sürümde en az 5 dönüşüm ve 5 dönüşümsüz olana kadar bekler.
Bir test anlamlı göründüğü anda durdurabilir miyim?
Güven düzeyinin söylediği şeyi ifade etmesini istiyorsanız, hayır. Tekrar tekrar kontrol edip ilk anlamlı okumada durmak, tesadüfe çizgiyi geçmek için daha fazla fırsat verir, böylece gerçek yanlış pozitif oranı seçtiğinizden daha yüksek olur. Örneklem büyüklüğünü önce belirleyin ve sonucu bir kez okuyun.
Bir Meta A/B testi ne kadar sürmeli?
Meta en az 7 gün önerir, daha kısa testlerin sonuçsuz kalabileceğini söyler ve 30 güne kadar izin verir. Google Ads deneyler için 2 ila 3 hafta önerir. Kendi testinizin ne kadar sürmesi gerektiğini görmek için günlük trafiğinizle örneklem büyüklüğü sekmesini kullanın.
Yazdığım herhangi bir şey bir yere gönderiliyor mu?
Hayır. Hesaplamalar tarayıcınızda yapılır. Yazdıklarınızı taşıyan bir ağ isteği yoktur ve hiçbir şey saklanmaz.
Hermoso, reklam hesaplarınız genelinde neyi ölçekleyeceğinizi, duraklatacağınızı ve bir sonraki olarak test edeceğinizi söyler. Ücretsiz başlayın, 250'den fazla kazanılabilir ücretsiz kredi, kart gerekmez.
Ücretsiz başla → Fiyatları görün