ऐड के लिए A/B टेस्ट कैलकुलेटर: सिग्निफिकेंस और सैंपल साइज

दो वर्ज़न के लिए विज़िटर और कन्वर्ज़न डालें और देखें कि अंतर असली है या नहीं, या अपनी कन्वर्ज़न रेट और जिस लिफ्ट की आपको परवाह है उसे डालकर देखें कि टेस्ट को कितने विज़िटर चाहिए। दोनों फॉर्मूले पूरे लिखे गए हैं, हल किए गए उदाहरणों के साथ।

मुफ़्त टूल आपके ब्राउज़र में गणना करता है। कुछ भी भेजा, संग्रहित या लॉग नहीं किया जाता: इस पेज के दूसरे छोर पर कोई सर्वर नहीं है।

दो सवाल, एक कैलकुलेटर

हर विज्ञापन टेस्ट इसी क्रम में दो चीज़ें पूछता है। शुरू होने से पहले: जो अंतर मेरे लिए मायने रखता है उसे ढूँढने के लिए कितने विज़िटर चाहिए? खत्म होने के बाद: A और B के बीच का अंतर असली है, या यह संयोग हो सकता है? ऊपर दिए दोनों टैब का इसी क्रम में उपयोग करें। पहले सैंपल साइज़ निकालना ही दूसरे सवाल के जवाब को मायने देता है।

“विज़िटर” लैंडिंग पेज विज़िटर, लिंक क्लिक या ऐसा कोई भी हो सकता है जिसे कन्वर्ट करने का उचित मौका मिला, बशर्ते दोनों वर्शन एक ही तरीके से गिने जाएँ। “कन्वर्ज़न” वे लोग हैं जिन्होंने वह काम किया जिसके लिए आप टेस्ट कर रहे हैं।

सार्थकता टेस्ट कैसे काम करता है

कैलकुलेटर एक टू-प्रोपोर्शन z-टेस्ट चलाता है, दो दरों की तुलना के लिए लार्ज-सैंपल टेस्ट जो NIST/SEMATECH e-Handbook of Statistical Methods में वर्णित है:

  • पूल्ड दर p = (कन्वर्ज़न A + कन्वर्ज़न B) ÷ (विज़िटर A + विज़िटर B).
  • z = (दर B − दर A) ÷ √(p × (1 − p) × (1/विज़िटर A + 1/विज़िटर B)).
  • दो-तरफा p-वैल्यू = 2 × (1 − Φ(|z|)), जहाँ Φ स्टैंडर्ड नॉर्मल डिस्ट्रिब्यूशन है।
  • अंतर के लिए अंतराल (दर B − दर A) ± z × √(दर A × (1 − दर A) ÷ विज़िटर A + दर B × (1 − दर B) ÷ विज़िटर B) है। बढ़त की रेंज इसे दर A से भाग देती है, जो दर A को ज्ञात मानती है, इसलिए यह एक अनुमान है।

हल किया गया उदाहरण. वर्शन A को 10,000 विज़िटर से 200 कन्वर्ज़न मिलते हैं (2.00%). वर्शन B को 10,000 से 245 मिलते हैं (2.45%), यानी 22.5% सापेक्ष बढ़त। पूल्ड दर 445 ÷ 20,000 = 2.225% है, स्टैंडर्ड एरर 0.209 प्रतिशत अंक है, और z = 0.45 ÷ 0.209 = 2.157. दो-तरफा p-वैल्यू 0.031 है, जो 0.05 से कम है, इसलिए 95% कॉन्फ़िडेंस पर B जीतता है। अंतर के लिए 95% अंतराल +0.04 से +0.86 प्रतिशत अंक तक चलता है: B बेहतर है, लेकिन असली बढ़त लगभग 2% से 43% तक कहीं भी हो सकती है।

यह टेस्ट एक अनुमान है जिसे पर्याप्त डेटा की जरूरत होती है। NIST की हैंडबुक एक कसौटी देती है: कम से कम 5 सफलताएँ और 5 विफलताएँ। जब तक हर वर्शन में 5 कन्वर्ज़न और 5 नॉन-कन्वर्ज़न न हों, कैलकुलेटर अपना फैसला रोककर अभी पर्याप्त डेटा नहीं है कहता है। इससे कम होने पर NIST छोटे सैंपल के लिए एक एक्ज़ैक्ट टेस्ट की ओर इशारा करता है, लेकिन विज्ञापन टेस्ट के लिए व्यावहारिक जवाब है इसे चलाते रहना।

सैंपल साइज़ कैसे निकाला जाता है

दो-तरफा टेस्ट के लिए, प्रति वर्शन विज़िटर:

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

यहाँ p1 आपकी मौजूदा दर है, p2 वही दर है जिस पर लिफ्ट लागू की गई है, और p̄ उनका औसत है। यह सामान्य सन्निकटन है, बिना निरंतरता सुधार के, और इसका स्वरूप NIST हैंडबुक में दिए गए एकल-अनुपात नमूना आकार सूत्र जैसा ही है, जिसमें एक दूसरा समूह जोड़ा गया है। 95% विश्वास पर z1−α/2 का मान 1.959964 है, और 80% पावर पर z1−β का मान 0.841621 है।

हल किया गया उदाहरण। 2% रूपांतरण दर, और आप 20% लिफ्ट पकड़ना चाहते हैं, यानी 2.0% बनाम 2.4%। औसत दर 2.2% है। ऊपरी पंक्ति है 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811, जिसका वर्ग 0.3377 है, और इसे 0.004² से भाग देने पर प्रति संस्करण 21,109 विज़िटर मिलते हैं, कुल मिलाकर 42,218। प्रतिदिन 3,000 विज़िटर पर यह 15 दिन है।

आप जितनी लिफ्ट माँगते हैं वह सबसे ज़्यादा मायने रखती है। उसी 2% दर पर, 30% लिफ्ट के लिए प्रति संस्करण 9,798 चाहिए और 10% लिफ्ट के लिए 80,682। लिफ्ट को आधा करने से ट्रैफ़िक लगभग चौगुना हो जाता है, क्योंकि यह अंतर सूत्र के नीचे वर्ग रूप में बैठता है।

जल्दी रोकना फॉल्स पॉज़िटिव क्यों बढ़ाता है

95% विश्वास स्तर का मतलब है कि जब A और B वास्तव में एक जैसा रूपांतरण करते हैं, तब भी एक निश्चित नमूना आकार पर एक ही परीक्षण लगभग 5% बार विजेता घोषित कर देता है। वह 5% तभी सही है जब आप सिर्फ़ एक बार, अंत में देखें।

हर दिन परिणाम जाँचना और पहली बार सार्थक दिखने पर रोक देना एक अलग प्रक्रिया है। डेटा आने पर दरें घूमती रहती हैं, और हर बार देखना संयोगवश बने अंतर के रेखा पार करने का एक और मौका होता है। पहली बार पार होते ही रोक देने पर आपने सबसे भाग्यशाली पल चुन लिया है, इसलिए असली फॉल्स-पॉज़िटिव दर 5% से ऊपर चली जाती है, और जितनी बार आप देखते हैं यह उतनी ही बढ़ती है। स्क्रीन पर दिखने वाला p-value यह नहीं जानता कि आपने झाँका था, इसलिए यह ऐसे दिखता है मानो आपने एक ही बार देखा हो।

समाधान नीरस है और काम करता है: परीक्षण शुरू होने से पहले नमूना आकार तय करें, उसे उस आकार तक पहुँचने दें, और परिणाम एक बार पढ़ें। बीच में यह जाँचने के लिए देखना कि कुछ टूटा तो नहीं, ठीक है। संख्या अच्छी दिख रही है इसलिए रोक देना ठीक नहीं है।

परीक्षण की अवधि के बारे में Meta और Google Ads क्या कहते हैं

यह कैलकुलेटर क्या नहीं करता

  • यह दो संस्करणों की तुलना करता है। तीन या अधिक के साथ, हर अतिरिक्त तुलना फॉल्स विजेता का एक और मौका होती है, और यहाँ का सरल परीक्षण उसके लिए समायोजन नहीं करता।
  • यह रूपांतरण दरों का परीक्षण करता है, प्रति विज़िटर राजस्व या ऑर्डर मूल्य का नहीं, जिनके लिए एक अलग परीक्षण चाहिए।
  • यह अनुक्रमिक परीक्षण नहीं है। यह मानता है कि आप परिणाम एक ही बार, अपने नियोजित नमूना आकार पर पढ़ते हैं।
  • यह नहीं बता सकता कि आपका विभाजन निष्पक्ष था या नहीं। यदि एक संस्करण को अलग ऑडियंस, बजट या दिन का समय मिला, तो कोई सूत्र उसे ठीक नहीं करता।

यदि आप खुद हाथ से संख्याएँ निकालना नहीं चाहते

Hermoso ऑटोपायलट पर मार्केटिंग है। इससे पूछें आगे क्या स्केल करना, रोकना और परीक्षण करना है और यह आपके द्वारा जुड़े हर विज्ञापन प्लेटफ़ॉर्म को पढ़ता है, बहुत कम डेटा वाले कैंपेन को आँकने के बजाय उन्हें अपनी अलग बकेट में रखता है, और हर सुझाए गए परीक्षण को एक परिकल्पना, बदलने वाली एक चीज़, निर्णय करने वाला मेट्रिक, एक बजट और एक अवधि देता है। यह परीक्षण के लिए ऑन-ब्रांड इमेज और वीडियो वेरिएंट भी बनाता है, और आपके अपने विज्ञापन खातों पर कैंपेन बनाता है, जो रुके हुए बनाए जाते हैं। यह वेब ऐप में, या MCP सर्वर के ज़रिए Claude, ChatGPT और Cursor के अंदर काम करता है। एक बार परीक्षण में विजेता तय हो जाने पर, मुफ़्त ROAS कैलकुलेटर बताता है कि यह लाभदायक भी है या नहीं।

मुफ़्त टूल: · ROAS कैलकुलेटर · विज्ञापन कॉपी लेंथ चेकर

अक्सर पूछे जाने वाले सवाल

मुझे कैसे पता चले कि मेरा ऐड A/B टेस्ट सांख्यिकीय रूप से सिग्निफिकेंट है?

दोनों वर्ज़न के लिए विज़िटर और कन्वर्ज़न डालें। कैलकुलेटर टू-प्रोपोर्शन z-टेस्ट चलाता है और टू-साइडेड p-वैल्यू देता है। 95% कॉन्फिडेंस पर, 0.05 से कम p-वैल्यू का मतलब है कि अंतर संयोग होने की संभावना कम है। 10,000 में से 200 बनाम 10,000 में से 245 के लिए, p 0.031 है, इसलिए B जीतता है।

A/B टेस्ट को कितने विज़िटर चाहिए?

यह आपकी कन्वर्ज़न रेट और आप जिस सबसे छोटी लिफ्ट का पता लगाना चाहते हैं उस पर निर्भर करता है। 2% कन्वर्ज़न रेट पर, 95% कॉन्फिडेंस और 80% पावर पर 20% लिफ्ट ढूंढने में प्रति वर्ज़न 21,109 विज़िटर लगते हैं। 10% लिफ्ट में 80,682 लगते हैं।

कैलकुलेटर क्यों कहता है कि अभी पर्याप्त डेटा नहीं है?

z-टेस्ट एक बड़े-सैंपल का अनुमान है। कैलकुलेटर तब तक इंतजार करता है जब तक हर वर्ज़न में कम से कम 5 कन्वर्ज़न और 5 नॉन-कन्वर्ज़न न हों, जो NIST e-Handbook में दिए गए मानदंडों में से एक है, तभी यह फैसला देता है।

क्या मैं टेस्ट को सिग्निफिकेंट दिखते ही रोक सकता हूं?

अगर आप चाहते हैं कि कॉन्फिडेंस लेवल का वही मतलब रहे जो वह कहता है, तो नहीं। बार-बार जांचना और पहली सिग्निफिकेंट रीडिंग पर रुक जाना संयोग को रेखा पार करने के ज्यादा मौके देता है, इसलिए असली फॉल्स-पॉजिटिव रेट आपके चुने हुए रेट से ज्यादा हो जाती है। पहले सैंपल साइज तय करें और रिजल्ट एक बार पढ़ें।

Meta A/B टेस्ट कितने समय तक चलना चाहिए?

Meta कम से कम 7 दिन की सलाह देता है, कहता है कि छोटे टेस्ट अनिर्णायक हो सकते हैं, और 30 दिन तक की अनुमति देता है। Google Ads एक्सपेरिमेंट के लिए 2 से 3 हफ्ते की सलाह देता है। अपने डेली ट्रैफिक के साथ सैंपल साइज टैब का उपयोग करके देखें कि आपके अपने टेस्ट को कितना समय चाहिए।

क्या मेरा टाइप किया हुआ कुछ भी कहीं भेजा जाता है?

नहीं। गणनाएं आपके ब्राउज़र में चलती हैं। आपके टाइप किए को ले जाने वाला कोई नेटवर्क रिक्वेस्ट नहीं है और कुछ भी स्टोर नहीं होता।

Hermoso आपको बताता है कि आपके ऐड अकाउंट में क्या स्केल करना है, क्या रोकना है और आगे क्या टेस्ट करना है। मुफ्त शुरू करें, 250+ कमाने लायक मुफ्त क्रेडिट, कार्ड नहीं।

मुफ़्त शुरू करें →   कीमतें देखें