دو سوالات، ایک کیلکولیٹر
ہر ایڈ ٹیسٹ اسی ترتیب میں دو چیزیں پوچھتا ہے۔ شروع ہونے سے پہلے: جس فرق کی مجھے پروا ہے اسے ڈھونڈنے کے لیے کتنے وزیٹرز درکار ہیں؟ ختم ہونے کے بعد: A اور B کے درمیان فرق حقیقی ہے، یا یہ اتفاق ہو سکتا ہے؟ اوپر دیے گئے دونوں ٹیبز اسی ترتیب میں استعمال کریں۔ پہلے سیمپل سائز نکالنا ہی وہ چیز ہے جو دوسرے سوال کے جواب کو با معنیٰ بناتی ہے۔
“وزیٹرز” لینڈنگ پیج کے وزیٹرز، لنک کلکس یا کوئی بھی ایسا شخص ہو سکتا ہے جسے کنورٹ کرنے کا منصفانہ موقع ملا، بشرطیکہ دونوں ورژنز کو ایک ہی طریقے سے گنا جائے۔ “کنورژنز” وہ لوگ ہیں جنہوں نے وہ کام کیا جس کے لیے آپ ٹیسٹ کر رہے ہیں۔
با معنیٰ پن کا ٹیسٹ کیسے کام کرتا ہے
کیلکولیٹر دو تناسب والا z-ٹیسٹ چلاتا ہے، دو ریٹس کے موازنے کے لیے بڑے سیمپل کا ٹیسٹ جو NIST/SEMATECH e-Handbook of Statistical Methods میں بیان کیا گیا ہے:
- Pooled ریٹ p = (کنورژنز A + کنورژنز B) ÷ (وزیٹرز A + وزیٹرز B)۔
- z = (ریٹ B − ریٹ A) ÷ √(p × (1 − p) × (1/وزیٹرز A + 1/وزیٹرز B))۔
- دو طرفہ p-value = 2 × (1 − Φ(|z|))، جہاں Φ معیاری نارمل تقسیم ہے۔
- فرق کے لیے انٹرول (ریٹ B − ریٹ A) ± z × √(ریٹ A × (1 − ریٹ A) ÷ وزیٹرز A + ریٹ B × (1 − ریٹ B) ÷ وزیٹرز B) ہے۔ اضافے کی رینج اسے ریٹ A سے تقسیم کرتی ہے، جو ریٹ A کو معلوم مانتی ہے، اس لیے یہ ایک تخمینہ ہے۔
حل شدہ مثال۔ ورژن A کو 10,000 وزیٹرز میں سے 200 کنورژنز ملتے ہیں (2.00%)۔ ورژن B کو 10,000 میں سے 245 ملتے ہیں (2.45%)، یعنی 22.5% نسبتی اضافہ۔ Pooled ریٹ 445 ÷ 20,000 = 2.225% ہے، معیاری خطا 0.209 فیصد پوائنٹس ہے، اور z = 0.45 ÷ 0.209 = 2.157۔ دو طرفہ p-value 0.031 ہے، جو 0.05 سے کم ہے، اس لیے 95% اعتماد پر B جیتتا ہے۔ فرق کے لیے 95% انٹرول +0.04 سے +0.86 فیصد پوائنٹس تک چلتا ہے: B بہتر ہے، لیکن حقیقی اضافہ تقریباً 2% سے 43% تک کہیں بھی ہو سکتا ہے۔
یہ ٹیسٹ ایک تخمینہ ہے جسے کافی ڈیٹا درکار ہے۔ NIST کی ہینڈبک ایک معیار دیتی ہے: کم از کم 5 کامیابیاں اور 5 ناکامیاں۔ کیلکولیٹر اپنا فیصلہ روکے رکھتا ہے اور ابھی کافی ڈیٹا نہیں کہتا ہے جب تک ہر ورژن میں 5 کنورژنز اور 5 نان کنورژنز نہ ہوں۔ اس سے کم ہونے پر، NIST ایک چھوٹے سیمپلز کے لیے درست ٹیسٹ کی طرف اشارہ کرتی ہے، لیکن ایڈ ٹیسٹ کے لیے عملی جواب یہی ہے کہ اسے جاری رکھا جائے۔
سیمپل سائز کیسے نکالا جاتا ہے
دو طرفہ ٹیسٹ کے لیے، فی ورژن وزیٹرز:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
یہاں p1 آپ کی موجودہ شرح ہے، p2 وہی شرح ہے جس پر لفٹ لاگو کی گئی ہے، اور p̄ ان دونوں کا اوسط ہے۔ یہ نارمل اپروکسیمیشن ہے، بغیر کنٹینیوئٹی کریکشن کے، اور اس کی شکل NIST ہینڈبک میں دیے گئے سنگل پروپورشن سیمپل سائز فارمولے جیسی ہے، جس میں ایک دوسرا گروپ شامل کر دیا گیا ہے۔ 95% اعتماد پر z1−α/2 1.959964 ہے، اور 80% پاور پر z1−β 0.841621 ہے۔
حل شدہ مثال۔ 2% کنورژن شرح، اور آپ 20% لفٹ پکڑنا چاہتے ہیں، یعنی 2.0% کے مقابلے میں 2.4%۔ اوسط شرح 2.2% ہے۔ اوپر کی لائن 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811 ہے، جس کا مربع 0.3377 ہے، اور 0.004² سے تقسیم کرنے پر فی ورژن 21,109 وزیٹرز ملتے ہیں، کل ملا کر 42,218۔ روزانہ 3,000 وزیٹرز پر یہ 15 دن ہیں۔
آپ جو لفٹ مانگتے ہیں وہ سب سے زیادہ اہم ہے۔ اسی 2% شرح پر، 30% لفٹ کے لیے فی ورژن 9,798 اور 10% لفٹ کے لیے 80,682 درکار ہیں۔ لفٹ کو آدھا کرنے سے ٹریفک تقریباً چار گنا ہو جاتی ہے، کیونکہ فارمولے کے نیچے یہ فرق مربع ہو کر بیٹھا ہے۔
جلدی رک جانا جھوٹے مثبت نتائج کو کیوں بڑھاتا ہے
95% اعتماد کی سطح کا مطلب ہے کہ جب A اور B واقعی ایک جیسا کنورٹ کرتے ہیں، تب بھی ایک مقررہ سیمپل سائز پر ایک ہی ٹیسٹ تقریباً 5% وقت کسی کو فاتح قرار دے دیتا ہے۔ یہ 5% تبھی درست ہے جب آپ صرف ایک بار، آخر میں دیکھیں۔
ہر روز نتیجہ چیک کرنا اور پہلی بار اہم دکھائی دیتے ہی رک جانا ایک مختلف طریقہ کار ہے۔ جیسے جیسے ڈیٹا آتا ہے شرحیں بھٹکتی رہتی ہیں، اور ہر نظر اتفاقیہ فرق کے لکیر پار کرنے کا ایک اور موقع ہوتی ہے۔ پہلے کراسنگ پر رک جائیں تو آپ نے سب سے خوش قسمت لمحہ چن لیا، لہٰذا اصل جھوٹے مثبت کی شرح 5% سے اوپر چلی جاتی ہے، اور جتنی زیادہ بار آپ دیکھیں اتنی بڑھتی ہے۔ اسکرین پر دکھنے والی p-ویلیو کو نہیں معلوم کہ آپ نے جھانکا، اس لیے وہ اب بھی ایسے پڑھی جاتی ہے جیسے آپ نے صرف ایک بار دیکھا ہو۔
حل بورنگ ہے مگر کام کرتا ہے: ٹیسٹ شروع ہونے سے پہلے سیمپل سائز طے کریں، اسے اس سائز تک پہنچنے دیں، اور نتیجہ ایک بار پڑھیں۔ درمیان میں یہ دیکھنے کے لیے جھانکنا کہ کچھ خراب تو نہیں ہوا ٹھیک ہے۔ نمبر اچھا دکھنے کی وجہ سے رک جانا ٹھیک نہیں۔
ٹیسٹ کی مدت کے بارے میں Meta اور Google Ads کیا کہتے ہیں
- Meta کی A/B ٹیسٹنگ بہترین روایات کم از کم 7 دن کے ٹیسٹ کی سفارش کرتی ہیں، کہتی ہیں کہ اس سے چھوٹے ٹیسٹ غیر حتمی نتائج دے سکتے ہیں، اور A/B ٹیسٹ کو 30 دن تک محدود رکھتی ہیں۔ یہی صفحہ تجویز کرتا ہے کہ اگر صارفین عام طور پر کنورٹ ہونے میں 7 دن سے زیادہ لیتے ہیں تو ٹیسٹ لمبا چلائیں۔
- Meta عام طور پر 80% یا اس سے زیادہ کی تخمینی پاور تجویز کرتا ہے، جو یہاں ڈیفالٹ پاور ہے۔ اس کے A/B نتائج ایک اعتماد فیصد دکھاتے ہیں، اور یہ A/B ٹیسٹ کے لیے 65% یا اس سے زیادہ کو فاتح نتیجہ مانتا ہے۔ یہ عدد Meta کے اپنے طریقے سے آتا ہے اور اس صفحے پر دی گئی اعتماد کی سطح جیسی چیز نہیں، اس لیے دونوں میل نہیں کھائیں گے۔
- Meta یہ بھی غیر رسمی طور پر ٹیسٹ کرنے سے منع کرتا ہے جس میں ایڈ سیٹس کو آن اور آف کیا جائے، کیونکہ آڈیئنسز اوورلیپ ہو سکتی ہیں، اور دونوں ورژنز کے لیے ایک جیسے بجٹ کی سفارش کرتا ہے۔
- Google Ads تجربہ 2 سے 3 ہفتے چلانے کی سفارش کرتا ہے، ڈیفالٹ کے طور پر 80% اعتماد کا وقفہ دکھاتا ہے اور درخواست پر دیگر سطحیں، اور اہم نتائج کو نیلے ایسٹرِسک سے نشان زد کرتا ہے۔ اس کا شماریاتی طریقہ فی آرم 20 بکٹس پر jackknife ری سیمپلنگ استعمال کرتا ہے، اس لیے اس کے وقفے بھی z-ٹیسٹ سے بالکل میل نہیں کھائیں گے۔
یہ کیلکولیٹر کیا نہیں کرتا
- یہ دو ورژنز کا موازنہ کرتا ہے۔ تین یا اس سے زیادہ کے ساتھ، ہر اضافی موازنہ جھوٹے فاتح کا ایک اور موقع ہے، اور یہاں کا سادہ ٹیسٹ اس کے لیے ایڈجسٹ نہیں کرتا۔
- یہ کنورژن شرحوں کا ٹیسٹ کرتا ہے، فی وزیٹر آمدنی یا آرڈر ویلیو کا نہیں، جن کے لیے مختلف ٹیسٹ درکار ہے۔
- یہ سیکوینشل ٹیسٹ نہیں ہے۔ یہ فرض کرتا ہے کہ آپ نتیجہ ایک بار، اپنے طے شدہ سیمپل سائز پر پڑھتے ہیں۔
- یہ نہیں بتا سکتا کہ آپ کی تقسیم منصفانہ تھی یا نہیں۔ اگر ایک ورژن کو مختلف آڈیئنس، بجٹ یا دن کا وقت ملا، تو کوئی فارمولا اسے ٹھیک نہیں کرتا۔
اگر آپ خود ہاتھ سے نمبر نہیں نکالنا چاہتے
Hermoso آٹو پائلٹ پر مارکیٹنگ ہے۔ اس سے پوچھیں کیا اسکیل کرنا، روکنا اور آگے ٹیسٹ کرنا ہے اور یہ آپ کے جوڑے ہوئے ہر ایڈ پلیٹ فارم کو پڑھتا ہے، بہت کم ڈیٹا والی مہمات کو جج کرنے کے بجائے ان کے الگ بکٹ میں رکھتا ہے، اور ہر مجوزہ ٹیسٹ کو ایک مفروضہ، بدلنے کی ایک چیز، فیصلہ کرنے والا میٹرک، ایک بجٹ اور ایک مدت دیتا ہے۔ یہ ٹیسٹ کرنے کے لیے آن-برانڈ امیج اور ویڈیو ویریئنٹس بھی بناتا ہے، اور آپ کے اپنے ایڈ اکاؤنٹس پر مہمات بناتا ہے، جو رکی ہوئی حالت میں تخلیق ہوتی ہیں۔ یہ ویب ایپ میں کام کرتا ہے، یا اپنے MCP سرور کے ذریعے Claude، ChatGPT اور Cursor کے اندر۔ ایک بار ٹیسٹ کا فاتح مل جائے، تو مفت ROAS کیلکولیٹر آپ کو بتاتا ہے کہ کیا یہ منافع بخش بھی ہے۔
مفت ٹولز: · ROAS کیلکولیٹر · ایڈ کاپی لینتھ چیکر
اکثر پوچھے جانے والے سوالات
میں کیسے جانوں کہ میرا ایڈ A/B ٹیسٹ شماریاتی طور پر اہم ہے؟
دونوں ورژنز کے وزیٹرز اور کنورژنز درج کریں۔ کیلکولیٹر ایک دو تناسبی z-test چلاتا ہے اور دو طرفہ p-value دیتا ہے۔ 95% کنفیڈنس پر، 0.05 سے کم p-value کا مطلب ہے کہ فرق کا اتفاق ہونا بعید ہے۔ 10,000 میں سے 200 کے مقابلے 10,000 میں سے 245 کے لیے p 0.031 ہے، لہٰذا B جیتتا ہے۔
ایک A/B ٹیسٹ کو کتنے وزیٹرز درکار ہیں؟
یہ آپ کی کنورژن ریٹ اور اس سب سے چھوٹی لِفٹ پر منحصر ہے جسے آپ شناخت کرنا چاہتے ہیں۔ 2% کنورژن ریٹ پر، 95% کنفیڈنس اور 80% پاور کے ساتھ 20% لِفٹ معلوم کرنے کے لیے فی ورژن 21,109 وزیٹرز درکار ہیں۔ 10% لِفٹ کے لیے 80,682 درکار ہیں۔
کیلکولیٹر یہ کیوں کہتا ہے کہ ابھی کافی ڈیٹا نہیں؟
z-test ایک بڑے سیمپل کا تخمینہ ہے۔ کیلکولیٹر اس وقت تک انتظار کرتا ہے جب تک ہر ورژن میں کم از کم 5 کنورژنز اور 5 نان کنورژنز نہ ہوں، جو NIST e-Handbook میں دی گئی ایک شرط ہے، اس سے پہلے کہ وہ فیصلہ دے۔
کیا میں ٹیسٹ اہم لگتے ہی روک سکتا ہوں؟
اگر آپ چاہتے ہیں کہ کنفیڈنس لیول کا مطلب وہی رہے جو وہ کہتا ہے تو نہیں۔ بار بار جانچنا اور پہلے ہی اہم نتیجے پر رکنا اتفاق کو حد پار کرنے کے زیادہ مواقع دیتا ہے، لہٰذا اصل غلط مثبت شرح آپ کے منتخب کردہ سے زیادہ ہو جاتی ہے۔ پہلے سیمپل سائز طے کریں اور نتیجہ ایک بار پڑھیں۔
ایک Meta A/B ٹیسٹ کتنا عرصہ چلنا چاہیے؟
Meta کم از کم 7 دن کی سفارش کرتا ہے، کہتا ہے کہ مختصر ٹیسٹ غیر حتمی ہو سکتے ہیں، اور 30 دن تک کی اجازت دیتا ہے۔ Google Ads تجربات کے لیے 2 سے 3 ہفتوں کی سفارش کرتا ہے۔ اپنے روزانہ ٹریفک کے ساتھ سیمپل سائز ٹیب استعمال کریں تاکہ دیکھ سکیں کہ آپ کے اپنے ٹیسٹ کو کتنا وقت درکار ہے۔
کیا میرا ٹائپ کیا ہوا کچھ کہیں بھیجا جاتا ہے؟
نہیں۔ حساب کتاب آپ کے براؤزر میں چلتا ہے۔ آپ جو ٹائپ کرتے ہیں اسے لے جانے والی کوئی نیٹ ورک درخواست نہیں اور کچھ محفوظ نہیں کیا جاتا۔
Hermoso آپ کو بتاتا ہے کہ آپ کے ایڈ اکاؤنٹس میں کیا اسکیل کریں، کیا روکیں اور آگے کیا ٹیسٹ کریں۔ مفت شروع کریں، 250+ کمائے جانے والے مفت کریڈٹس، کوئی کارڈ نہیں۔
مفت شروع کریں → قیمتیں دیکھیں