दो सवाल, एक कैलकुलेटर
हर विज्ञापन टेस्ट इसी क्रम में दो चीज़ें पूछता है। शुरू होने से पहले: जो अंतर मेरे लिए मायने रखता है उसे ढूँढने के लिए कितने विज़िटर चाहिए? खत्म होने के बाद: A और B के बीच का अंतर असली है, या यह संयोग हो सकता है? ऊपर दिए दोनों टैब का इसी क्रम में उपयोग करें। पहले सैंपल साइज़ निकालना ही दूसरे सवाल के जवाब को मायने देता है।
“विज़िटर” लैंडिंग पेज विज़िटर, लिंक क्लिक या ऐसा कोई भी हो सकता है जिसे कन्वर्ट करने का उचित मौका मिला, बशर्ते दोनों वर्शन एक ही तरीके से गिने जाएँ। “कन्वर्ज़न” वे लोग हैं जिन्होंने वह काम किया जिसके लिए आप टेस्ट कर रहे हैं।
सार्थकता टेस्ट कैसे काम करता है
कैलकुलेटर एक टू-प्रोपोर्शन z-टेस्ट चलाता है, दो दरों की तुलना के लिए लार्ज-सैंपल टेस्ट जो NIST/SEMATECH e-Handbook of Statistical Methods में वर्णित है:
- पूल्ड दर p = (कन्वर्ज़न A + कन्वर्ज़न B) ÷ (विज़िटर A + विज़िटर B).
- z = (दर B − दर A) ÷ √(p × (1 − p) × (1/विज़िटर A + 1/विज़िटर B)).
- दो-तरफा p-वैल्यू = 2 × (1 − Φ(|z|)), जहाँ Φ स्टैंडर्ड नॉर्मल डिस्ट्रिब्यूशन है।
- अंतर के लिए अंतराल (दर B − दर A) ± z × √(दर A × (1 − दर A) ÷ विज़िटर A + दर B × (1 − दर B) ÷ विज़िटर B) है। बढ़त की रेंज इसे दर A से भाग देती है, जो दर A को ज्ञात मानती है, इसलिए यह एक अनुमान है।
हल किया गया उदाहरण. वर्शन A को 10,000 विज़िटर से 200 कन्वर्ज़न मिलते हैं (2.00%). वर्शन B को 10,000 से 245 मिलते हैं (2.45%), यानी 22.5% सापेक्ष बढ़त। पूल्ड दर 445 ÷ 20,000 = 2.225% है, स्टैंडर्ड एरर 0.209 प्रतिशत अंक है, और z = 0.45 ÷ 0.209 = 2.157. दो-तरफा p-वैल्यू 0.031 है, जो 0.05 से कम है, इसलिए 95% कॉन्फ़िडेंस पर B जीतता है। अंतर के लिए 95% अंतराल +0.04 से +0.86 प्रतिशत अंक तक चलता है: B बेहतर है, लेकिन असली बढ़त लगभग 2% से 43% तक कहीं भी हो सकती है।
यह टेस्ट एक अनुमान है जिसे पर्याप्त डेटा की जरूरत होती है। NIST की हैंडबुक एक कसौटी देती है: कम से कम 5 सफलताएँ और 5 विफलताएँ। जब तक हर वर्शन में 5 कन्वर्ज़न और 5 नॉन-कन्वर्ज़न न हों, कैलकुलेटर अपना फैसला रोककर अभी पर्याप्त डेटा नहीं है कहता है। इससे कम होने पर NIST छोटे सैंपल के लिए एक एक्ज़ैक्ट टेस्ट की ओर इशारा करता है, लेकिन विज्ञापन टेस्ट के लिए व्यावहारिक जवाब है इसे चलाते रहना।
सैंपल साइज़ कैसे निकाला जाता है
दो-तरफा टेस्ट के लिए, प्रति वर्शन विज़िटर:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
यहाँ p1 आपकी मौजूदा दर है, p2 वही दर है जिस पर लिफ्ट लागू की गई है, और p̄ उनका औसत है। यह सामान्य सन्निकटन है, बिना निरंतरता सुधार के, और इसका स्वरूप NIST हैंडबुक में दिए गए एकल-अनुपात नमूना आकार सूत्र जैसा ही है, जिसमें एक दूसरा समूह जोड़ा गया है। 95% विश्वास पर z1−α/2 का मान 1.959964 है, और 80% पावर पर z1−β का मान 0.841621 है।
हल किया गया उदाहरण। 2% रूपांतरण दर, और आप 20% लिफ्ट पकड़ना चाहते हैं, यानी 2.0% बनाम 2.4%। औसत दर 2.2% है। ऊपरी पंक्ति है 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811, जिसका वर्ग 0.3377 है, और इसे 0.004² से भाग देने पर प्रति संस्करण 21,109 विज़िटर मिलते हैं, कुल मिलाकर 42,218। प्रतिदिन 3,000 विज़िटर पर यह 15 दिन है।
आप जितनी लिफ्ट माँगते हैं वह सबसे ज़्यादा मायने रखती है। उसी 2% दर पर, 30% लिफ्ट के लिए प्रति संस्करण 9,798 चाहिए और 10% लिफ्ट के लिए 80,682। लिफ्ट को आधा करने से ट्रैफ़िक लगभग चौगुना हो जाता है, क्योंकि यह अंतर सूत्र के नीचे वर्ग रूप में बैठता है।
जल्दी रोकना फॉल्स पॉज़िटिव क्यों बढ़ाता है
95% विश्वास स्तर का मतलब है कि जब A और B वास्तव में एक जैसा रूपांतरण करते हैं, तब भी एक निश्चित नमूना आकार पर एक ही परीक्षण लगभग 5% बार विजेता घोषित कर देता है। वह 5% तभी सही है जब आप सिर्फ़ एक बार, अंत में देखें।
हर दिन परिणाम जाँचना और पहली बार सार्थक दिखने पर रोक देना एक अलग प्रक्रिया है। डेटा आने पर दरें घूमती रहती हैं, और हर बार देखना संयोगवश बने अंतर के रेखा पार करने का एक और मौका होता है। पहली बार पार होते ही रोक देने पर आपने सबसे भाग्यशाली पल चुन लिया है, इसलिए असली फॉल्स-पॉज़िटिव दर 5% से ऊपर चली जाती है, और जितनी बार आप देखते हैं यह उतनी ही बढ़ती है। स्क्रीन पर दिखने वाला p-value यह नहीं जानता कि आपने झाँका था, इसलिए यह ऐसे दिखता है मानो आपने एक ही बार देखा हो।
समाधान नीरस है और काम करता है: परीक्षण शुरू होने से पहले नमूना आकार तय करें, उसे उस आकार तक पहुँचने दें, और परिणाम एक बार पढ़ें। बीच में यह जाँचने के लिए देखना कि कुछ टूटा तो नहीं, ठीक है। संख्या अच्छी दिख रही है इसलिए रोक देना ठीक नहीं है।
परीक्षण की अवधि के बारे में Meta और Google Ads क्या कहते हैं
- Meta की A/B परीक्षण की सर्वोत्तम प्रथाएँ कम से कम 7 दिन के परीक्षण की सलाह देती हैं, कहती हैं कि इससे छोटे परीक्षण अनिर्णायक परिणाम दे सकते हैं, और A/B परीक्षणों को 30 दिन तक सीमित रखती हैं। यही पेज सुझाव देता है कि यदि ग्राहकों को रूपांतरण में आमतौर पर 7 दिन से अधिक लगते हैं तो परीक्षण लंबा चलाएँ।
- Meta आमतौर पर 80% या उससे अधिक की अनुमानित पावर का सुझाव देता है, जो यहाँ डिफ़ॉल्ट पावर है। इसके A/B परिणाम एक विश्वास प्रतिशत दिखाते हैं, और A/B परीक्षण के लिए यह 65% या उससे अधिक को विजयी परिणाम मानता है। वह आँकड़ा Meta की अपनी विधि से आता है और इस पेज पर दिए विश्वास स्तर जैसी चीज़ नहीं है, इसलिए दोनों मेल नहीं खाएँगे।
- Meta यह भी सलाह देता है कि विज्ञापन सेट चालू-बंद करके अनौपचारिक रूप से परीक्षण न करें, क्योंकि ऑडियंस ओवरलैप हो सकती हैं, और दोनों संस्करणों के लिए समान बजट की सिफ़ारिश करता है।
- Google Ads किसी प्रयोग को 2 से 3 सप्ताह तक चलाने की सलाह देता है, डिफ़ॉल्ट रूप से 80% विश्वास अंतराल दिखाता है और माँगने पर अन्य स्तर, और सार्थक परिणामों को नीले तारांकन से चिह्नित करता है। इसकी सांख्यिकीय विधि प्रति आर्म 20 बकेट पर जैकनाइफ रीसैंपलिंग का उपयोग करती है, इसलिए इसके अंतराल भी z-परीक्षण से बिल्कुल मेल नहीं खाएँगे।
यह कैलकुलेटर क्या नहीं करता
- यह दो संस्करणों की तुलना करता है। तीन या अधिक के साथ, हर अतिरिक्त तुलना फॉल्स विजेता का एक और मौका होती है, और यहाँ का सरल परीक्षण उसके लिए समायोजन नहीं करता।
- यह रूपांतरण दरों का परीक्षण करता है, प्रति विज़िटर राजस्व या ऑर्डर मूल्य का नहीं, जिनके लिए एक अलग परीक्षण चाहिए।
- यह अनुक्रमिक परीक्षण नहीं है। यह मानता है कि आप परिणाम एक ही बार, अपने नियोजित नमूना आकार पर पढ़ते हैं।
- यह नहीं बता सकता कि आपका विभाजन निष्पक्ष था या नहीं। यदि एक संस्करण को अलग ऑडियंस, बजट या दिन का समय मिला, तो कोई सूत्र उसे ठीक नहीं करता।
यदि आप खुद हाथ से संख्याएँ निकालना नहीं चाहते
Hermoso ऑटोपायलट पर मार्केटिंग है। इससे पूछें आगे क्या स्केल करना, रोकना और परीक्षण करना है और यह आपके द्वारा जुड़े हर विज्ञापन प्लेटफ़ॉर्म को पढ़ता है, बहुत कम डेटा वाले कैंपेन को आँकने के बजाय उन्हें अपनी अलग बकेट में रखता है, और हर सुझाए गए परीक्षण को एक परिकल्पना, बदलने वाली एक चीज़, निर्णय करने वाला मेट्रिक, एक बजट और एक अवधि देता है। यह परीक्षण के लिए ऑन-ब्रांड इमेज और वीडियो वेरिएंट भी बनाता है, और आपके अपने विज्ञापन खातों पर कैंपेन बनाता है, जो रुके हुए बनाए जाते हैं। यह वेब ऐप में, या MCP सर्वर के ज़रिए Claude, ChatGPT और Cursor के अंदर काम करता है। एक बार परीक्षण में विजेता तय हो जाने पर, मुफ़्त ROAS कैलकुलेटर बताता है कि यह लाभदायक भी है या नहीं।
मुफ़्त टूल: · ROAS कैलकुलेटर · विज्ञापन कॉपी लेंथ चेकर
अक्सर पूछे जाने वाले सवाल
मुझे कैसे पता चले कि मेरा ऐड A/B टेस्ट सांख्यिकीय रूप से सिग्निफिकेंट है?
दोनों वर्ज़न के लिए विज़िटर और कन्वर्ज़न डालें। कैलकुलेटर टू-प्रोपोर्शन z-टेस्ट चलाता है और टू-साइडेड p-वैल्यू देता है। 95% कॉन्फिडेंस पर, 0.05 से कम p-वैल्यू का मतलब है कि अंतर संयोग होने की संभावना कम है। 10,000 में से 200 बनाम 10,000 में से 245 के लिए, p 0.031 है, इसलिए B जीतता है।
A/B टेस्ट को कितने विज़िटर चाहिए?
यह आपकी कन्वर्ज़न रेट और आप जिस सबसे छोटी लिफ्ट का पता लगाना चाहते हैं उस पर निर्भर करता है। 2% कन्वर्ज़न रेट पर, 95% कॉन्फिडेंस और 80% पावर पर 20% लिफ्ट ढूंढने में प्रति वर्ज़न 21,109 विज़िटर लगते हैं। 10% लिफ्ट में 80,682 लगते हैं।
कैलकुलेटर क्यों कहता है कि अभी पर्याप्त डेटा नहीं है?
z-टेस्ट एक बड़े-सैंपल का अनुमान है। कैलकुलेटर तब तक इंतजार करता है जब तक हर वर्ज़न में कम से कम 5 कन्वर्ज़न और 5 नॉन-कन्वर्ज़न न हों, जो NIST e-Handbook में दिए गए मानदंडों में से एक है, तभी यह फैसला देता है।
क्या मैं टेस्ट को सिग्निफिकेंट दिखते ही रोक सकता हूं?
अगर आप चाहते हैं कि कॉन्फिडेंस लेवल का वही मतलब रहे जो वह कहता है, तो नहीं। बार-बार जांचना और पहली सिग्निफिकेंट रीडिंग पर रुक जाना संयोग को रेखा पार करने के ज्यादा मौके देता है, इसलिए असली फॉल्स-पॉजिटिव रेट आपके चुने हुए रेट से ज्यादा हो जाती है। पहले सैंपल साइज तय करें और रिजल्ट एक बार पढ़ें।
Meta A/B टेस्ट कितने समय तक चलना चाहिए?
Meta कम से कम 7 दिन की सलाह देता है, कहता है कि छोटे टेस्ट अनिर्णायक हो सकते हैं, और 30 दिन तक की अनुमति देता है। Google Ads एक्सपेरिमेंट के लिए 2 से 3 हफ्ते की सलाह देता है। अपने डेली ट्रैफिक के साथ सैंपल साइज टैब का उपयोग करके देखें कि आपके अपने टेस्ट को कितना समय चाहिए।
क्या मेरा टाइप किया हुआ कुछ भी कहीं भेजा जाता है?
नहीं। गणनाएं आपके ब्राउज़र में चलती हैं। आपके टाइप किए को ले जाने वाला कोई नेटवर्क रिक्वेस्ट नहीं है और कुछ भी स्टोर नहीं होता।
Hermoso आपको बताता है कि आपके ऐड अकाउंट में क्या स्केल करना है, क्या रोकना है और आगे क्या टेस्ट करना है। मुफ्त शुरू करें, 250+ कमाने लायक मुफ्त क्रेडिट, कार्ड नहीं।
मुफ़्त शुरू करें → कीमतें देखें