Dua soalan, satu kalkulator
Setiap ujian iklan menanya dua perkara, mengikut susunan ini. Sebelum ia bermula: berapa ramai pelawat diperlukan untuk mengesan perbezaan yang saya ambil berat? Selepas ia tamat: adakah jurang antara A dan B itu nyata, atau mungkin kebetulan? Gunakan dua tab di atas mengikut susunan itu. Mengira saiz sampel dahulu itulah yang menjadikan jawapan kepada soalan kedua bermakna.
“Pelawat” boleh jadi pelawat halaman pendaratan, klik pautan atau sesiapa sahaja yang mendapat peluang saksama untuk menukar, asalkan kedua-dua versi dikira dengan cara yang sama. “Penukaran” ialah orang yang melakukan perkara yang anda uji.
Cara ujian signifikan berfungsi
Kalkulator menjalankan ujian-z dua perkadaran, ujian sampel besar untuk membandingkan dua kadar seperti yang diterangkan dalam NIST/SEMATECH e-Handbook of Statistical Methods:
- Kadar terkumpul p = (penukaran A + penukaran B) ÷ (pelawat A + pelawat B).
- z = (kadar B − kadar A) ÷ √(p × (1 − p) × (1/pelawat A + 1/pelawat B)).
- Nilai-p dua hala = 2 × (1 − Φ(|z|)), di mana Φ ialah taburan normal piawai.
- Selang untuk perbezaan ialah (kadar B − kadar A) ± z × √(kadar A × (1 − kadar A) ÷ pelawat A + kadar B × (1 − kadar B) ÷ pelawat B). Julat peningkatan membahagikannya dengan kadar A, yang menganggap kadar A diketahui, jadi ia adalah anggaran.
Contoh dikira. Versi A mendapat 200 penukaran daripada 10,000 pelawat (2.00%). Versi B mendapat 245 daripada 10,000 (2.45%), peningkatan relatif 22.5%. Kadar terkumpul ialah 445 ÷ 20,000 = 2.225%, ralat piawai ialah 0.209 mata peratus, dan z = 0.45 ÷ 0.209 = 2.157. Nilai-p dua hala ialah 0.031, di bawah 0.05, jadi pada keyakinan 95% B menang. Selang 95% untuk perbezaan bermula dari +0.04 hingga +0.86 mata peratus: B lebih baik, tetapi peningkatan sebenar boleh berada di mana-mana antara kira-kira 2% hingga 43%.
Ujian ini adalah anggaran yang memerlukan data yang mencukupi. Buku panduan NIST memberikan satu kriteria: sekurang-kurangnya 5 kejayaan dan 5 kegagalan. Kalkulator menahan keputusannya dan menyatakan data belum mencukupi sehingga setiap versi mempunyai 5 penukaran dan 5 bukan penukaran. Dengan kurang daripada itu, NIST merujuk kepada ujian tepat untuk sampel kecil, tetapi bagi ujian iklan jawapan praktikalnya adalah meneruskannya.
Cara saiz sampel dikira
Untuk ujian dua hala, pelawat setiap versi:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Di sini p1 ialah kadar semasa anda, p2 ialah kadar itu dengan peningkatan dikenakan, dan p̄ ialah purata keduanya. Ia merupakan penghampiran normal, tanpa pembetulan keselanjaran, dan mempunyai bentuk yang sama dengan formula saiz sampel kadaran tunggal dalam buku panduan NIST, dengan satu kumpulan kedua ditambah. Pada keyakinan 95%, z1−α/2 ialah 1.959964, dan pada kuasa 80%, z1−β ialah 0.841621.
Contoh dikira. Kadar penukaran 2%, dan anda mahu mengesan peningkatan 20%, jadi 2.0% berbanding 2.4%. Kadar puratanya ialah 2.2%. Baris atasnya ialah 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811, dikuasa duakan ialah 0.3377, dan bahagi dengan 0.004² memberikan 21,109 pelawat setiap versi, 42,218 kesemuanya. Pada 3,000 pelawat sehari itu ialah 15 hari.
Peningkatan yang anda minta paling penting. Pada kadar 2% yang sama, peningkatan 30% memerlukan 9,798 setiap versi dan peningkatan 10% memerlukan 80,682. Mengurangkan peningkatan separuh lebih kurang menggandakan empat kali trafik, kerana jurang itu dikuasa duakan di bahagian bawah formula.
Mengapa berhenti awal membengkakkan positif palsu
Tahap keyakinan 95% bermakna apabila A dan B sebenarnya menukar pada kadar sama, satu ujian pada saiz sampel tetap masih mengisytiharkan pemenang kira-kira 5% masa. 5% itu hanya benar jika anda melihat sekali, pada akhirnya.
Menyemak keputusan setiap hari dan berhenti kali pertama ia menunjukkan signifikan ialah prosedur yang berbeza. Kadar bergerak-gerak apabila data masuk, dan setiap pemerhatian ialah satu lagi peluang untuk jurang kebetulan melintasi garisan. Berhenti pada lintasan pertama dan anda telah memilih saat paling bertuah, jadi kadar positif palsu sebenar berakhir melebihi 5%, dan ia bertambah semakin kerap anda melihat. Nilai-p pada skrin tidak tahu anda mengintai, jadi ia masih dibaca seolah-olah anda melihat sekali.
Pembetulannya membosankan dan ia berkesan: tentukan saiz sampel sebelum ujian bermula, biarkan ia mencapai saiz itu, dan baca keputusan sekali. Melihat di pertengahan untuk memastikan tiada yang rosak adalah baik. Berhenti kerana nombornya nampak elok adalah tidak.
Apa kata Meta dan Google Ads tentang tempoh ujian
- Amalan terbaik ujian A/B Meta mengesyorkan ujian sekurang-kurangnya 7 hari, menyatakan ujian lebih pendek daripada itu mungkin menghasilkan keputusan yang tidak muktamad, dan mengehadkan ujian A/B pada 30 hari. Halaman yang sama mencadangkan menjalankannya lebih lama jika pelanggan biasanya mengambil masa lebih 7 hari untuk menukar.
- Meta biasanya mencadangkan anggaran kuasa 80% atau lebih tinggi, kuasa lalai di sini. Keputusan A/B-nya menunjukkan peratusan keyakinan, dan ia menganggap 65% atau lebih tinggi sebagai keputusan menang untuk ujian A/B. Angka itu datang daripada kaedah Meta sendiri dan bukan perkara yang sama dengan tahap keyakinan pada halaman ini, jadi keduanya tidak akan sepadan.
- Meta juga menasihati supaya tidak menguji secara tidak formal dengan menghidupkan dan mematikan set iklan, kerana khalayak boleh bertindih, dan mengesyorkan belanjawan yang sama untuk kedua-dua versi.
- Google Ads mengesyorkan membiarkan eksperimen berjalan selama 2 hingga 3 minggu, menunjukkan selang keyakinan 80% secara lalai dengan tahap lain atas permintaan, dan menanda keputusan signifikan dengan asterisk biru. Kaedah statistiknya menggunakan persampelan semula jackknife ke atas 20 baldi setiap lengan, jadi selangnya juga tidak akan sepadan dengan ujian-z dengan tepat.
Apa yang kalkulator ini tidak lakukan
- Ia membandingkan dua versi. Dengan tiga atau lebih, setiap perbandingan tambahan ialah satu lagi peluang pemenang palsu, dan ujian mudah di sini tidak menyesuaikan untuk itu.
- Ia menguji kadar penukaran, bukan hasil setiap pelawat atau nilai pesanan, yang memerlukan ujian berbeza.
- Ia bukan ujian berjujukan. Ia menganggap anda membaca keputusan sekali, pada saiz sampel yang anda rancang.
- Ia tidak boleh memberitahu sama ada pembahagian anda adil. Jika satu versi mendapat khalayak, belanjawan atau masa hari yang berbeza, tiada formula yang membetulkan itu.
Jika anda tidak mahu mengira nombor dengan tangan
Hermoso ialah pemasaran autopilot. Tanya ia apa yang perlu diskalakan, dijeda dan diuji seterusnya dan ia membaca setiap platform iklan yang telah anda sambungkan, meletakkan kempen dengan data terlalu sedikit dalam baldi tersendiri dan bukannya menilainya, serta memberikan setiap ujian dicadangkan satu hipotesis, satu perkara untuk diubah, metrik yang memutuskannya, satu belanjawan dan satu tempoh. Ia juga membuat varian imej dan video berjenama untuk diuji, dan membina kempen pada akaun iklan anda sendiri, dicipta dalam keadaan dijeda. Ia berfungsi dalam apl web, atau di dalam Claude, ChatGPT dan Cursor melalui pelayan MCP-nya. Setelah ujian mempunyai pemenang, kalkulator ROAS percuma memberitahu anda sama ada ia juga menguntungkan.
Alat percuma: · Kalkulator ROAS · Penyemak panjang teks iklan
Soalan lazim
Bagaimana saya tahu jika ujian A/B iklan saya signifikan secara statistik?
Masukkan pelawat dan penukaran bagi kedua-dua versi. Kalkulator menjalankan ujian z dua kadaran dan memberikan nilai p dua hala. Pada keyakinan 95%, nilai p di bawah 0.05 bermakna jurang itu tidak mungkin secara kebetulan. Untuk 200 daripada 10,000 berbanding 245 daripada 10,000, p ialah 0.031, jadi B menang.
Berapa ramai pelawat yang diperlukan ujian A/B?
Ia bergantung pada kadar penukaran anda dan peningkatan terkecil yang anda mahu kesan. Pada kadar penukaran 2%, mengesan peningkatan 20% pada keyakinan 95% dan kuasa 80% memerlukan 21,109 pelawat setiap versi. Peningkatan 10% memerlukan 80,682.
Mengapa kalkulator berkata data belum mencukupi?
Ujian z ialah penghampiran sampel besar. Kalkulator menunggu sehingga setiap versi mempunyai sekurang-kurangnya 5 penukaran dan 5 bukan penukaran, satu kriteria yang diberikan dalam NIST e-Handbook, sebelum ia memberikan keputusan.
Bolehkah saya hentikan ujian sebaik sahaja ia kelihatan signifikan?
Tidak jika anda mahu tahap keyakinan bermakna seperti yang dinyatakan. Menyemak berulang kali dan berhenti pada bacaan signifikan pertama memberi lebih banyak peluang kepada kebetulan untuk melepasi garisan, jadi kadar positif palsu sebenar berakhir lebih tinggi daripada yang anda pilih. Tetapkan saiz sampel dahulu dan baca keputusan sekali sahaja.
Berapa lama ujian A/B Meta patut berjalan?
Meta mengesyorkan sekurang-kurangnya 7 hari, berkata ujian yang lebih singkat mungkin tidak muktamad, dan membenarkan sehingga 30 hari. Google Ads mengesyorkan 2 hingga 3 minggu untuk eksperimen. Gunakan tab saiz sampel dengan trafik harian anda untuk melihat berapa lama ujian anda sendiri diperlukan.
Adakah apa-apa yang saya taip dihantar ke mana-mana?
Tidak. Pengiraan berjalan dalam pelayar anda. Tiada permintaan rangkaian yang membawa apa yang anda taip dan tiada apa-apa disimpan.
Hermoso memberitahu anda apa yang perlu diskala, dijeda dan diuji seterusnya merentas akaun iklan anda. Mula percuma, 250+ kredit percuma yang boleh diperoleh, tanpa kad.
Mulakan secara percuma → Lihat harga