دو پرسش، یک ماشینحساب
هر تست تبلیغاتی دو چیز را، به این ترتیب، میپرسد. پیش از شروع: برای یافتن تفاوتی که برایم مهم است به چند بازدیدکننده نیاز دارم؟ پس از پایان: آیا فاصلهٔ میان A و B واقعی است یا میتواند تصادفی باشد؟ از دو زبانهٔ بالا به همین ترتیب استفاده کنید. محاسبهٔ حجم نمونه در ابتدا همان چیزی است که پاسخ پرسش دوم را معنادار میکند.
«بازدیدکنندگان» میتوانند بازدیدکنندگان صفحهٔ فرود، کلیکروی لینک یا هر کس دیگری باشند که فرصت منصفانهای برای تبدیل داشته است، بهشرطی که هر دو نسخه به یک شیوه شمرده شوند. «تبدیلها» کسانی هستند که همان کاری را کردهاند که آن را آزمایش میکنید.
تست معناداری چگونه کار میکند
ماشینحساب یک آزمون z برای دو نسبت اجرا میکند، همان آزمون نمونهٔ بزرگ برای مقایسهٔ دو نرخ که در NIST/SEMATECH e-Handbook of Statistical Methods توضیح داده شده است:
- نرخ ترکیبی p = (تبدیلهای A + تبدیلهای B) ÷ (بازدیدکنندگان A + بازدیدکنندگان B).
- z = (نرخ B − نرخ A) ÷ √(p × (1 − p) × (1/بازدیدکنندگان A + 1/بازدیدکنندگان B)).
- مقدار p دوطرفه = 2 × (1 − Φ(|z|))، که در آن Φ توزیع نرمال استاندارد است.
- بازهٔ تفاوت برابر است با (نرخ B − نرخ A) ± z × √(نرخ A × (1 − نرخ A) ÷ بازدیدکنندگان A + نرخ B × (1 − نرخ B) ÷ بازدیدکنندگان B). بازهٔ افزایش آن را بر نرخ A تقسیم میکند، که نرخ A را معلوم فرض میگیرد، پس یک تقریب است.
مثال حلشده. نسخهٔ A از ۱۰٬۰۰۰ بازدیدکننده ۲۰۰ تبدیل میگیرد (۲٫۰۰٪). نسخهٔ B از ۱۰٬۰۰۰ بازدیدکننده ۲۴۵ تبدیل میگیرد (۲٫۴۵٪)، یعنی ۲۲٫۵٪ افزایش نسبی. نرخ ترکیبی برابر است با 445 ÷ 20,000 = 2.225%، خطای استاندارد ۰٫۲۰۹ واحد درصدی است و z = 0.45 ÷ 0.209 = 2.157. مقدار p دوطرفه ۰٫۰۳۱ است، کمتر از ۰٫۰۵، پس با اطمینان ۹۵٪ B برنده است. بازهٔ ۹۵٪ برای تفاوت از +۰٫۰۴ تا +۰٫۸۶ واحد درصدی است: B بهتر است، اما افزایش واقعی میتواند هر جایی از حدود ۲٪ تا ۴۳٪ باشد.
این آزمون یک تقریب است که به دادهٔ کافی نیاز دارد. راهنمای NIST یک معیار میدهد: دستکم ۵ موفقیت و ۵ شکست. ماشینحساب تا زمانی که هر نسخه ۵ تبدیل و ۵ عدمتبدیل نداشته باشد، حکم خود را نگه میدارد و میگوید هنوز داده کافی نیست. با کمتر از این مقدار، NIST به یک آزمون دقیق برای نمونههای کوچک اشاره میکند، اما برای یک تست تبلیغاتی پاسخ عملی این است که آن را ادامه دهید.
حجم نمونه چگونه محاسبه میشود
برای یک آزمون دوطرفه، بازدیدکنندگان هر نسخه:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
در اینجا p1 نرخ فعلی شما است، p2 همان نرخ با اعمال افزایش است، و p̄ میانگین آنهاست. این تقریب نرمال است، بدون تصحیح پیوستگی، و همان شکل فرمول حجم نمونه تکنسبتی در راهنمای NIST را دارد، با افزوده شدن یک گروه دوم. در سطح اطمینان ۹۵٪، z1−α/2 برابر ۱.۹۵۹۹۶۴ است، و در توان ۸۰٪، z1−β برابر ۰.۸۴۱۶۲۱ است.
مثال حلشده. نرخ تبدیل ۲٪، و میخواهید افزایش ۲۰٪ را تشخیص دهید، یعنی ۲.۰٪ در برابر ۲.۴٪. نرخ میانگین ۲.۲٪ است. خط بالا برابر است با ۱.۹۵۹۹۶۴ × ۰.۲۰۷۴ + ۰.۸۴۱۶۲۱ × ۰.۲۰۷۴ = ۰.۵۸۱۱، که به توان دو میشود ۰.۳۳۷۷، و با تقسیم بر ۰.۰۰۴² به ۲۱٬۱۰۹ بازدیدکننده برای هر نسخه میرسیم، در مجموع ۴۲٬۲۱۸. با ۳٬۰۰۰ بازدیدکننده در روز، این یعنی ۱۵ روز.
افزایشی که درخواست میکنید بیشترین اهمیت را دارد. در همان نرخ ۲٪، افزایش ۳۰٪ به ۹٬۷۹۸ بازدیدکننده برای هر نسخه نیاز دارد و افزایش ۱۰٪ به ۸۰٬۶۸۲. نصف کردن افزایش تقریباً ترافیک را چهار برابر میکند، چون این فاصله به صورت مربع در مخرج فرمول قرار دارد.
چرا توقف زودهنگام مثبت کاذب را افزایش میدهد
سطح اطمینان ۹۵٪ به این معناست که وقتی A و B واقعاً به یک اندازه تبدیل میکنند، یک آزمون منفرد با حجم نمونه ثابت همچنان حدود ۵٪ مواقع یک برنده اعلام میکند. آن ۵٪ تنها زمانی درست است که یک بار، در پایان، نگاه کنید.
بررسی نتیجه هر روز و توقف در نخستین باری که معنادار نشان میدهد، رویهای متفاوت است. با ورود دادهها نرخها نوسان میکنند، و هر نگاه فرصتی دیگر است تا یک فاصله تصادفی از خط عبور کند. اگر در نخستین عبور متوقف شوید، خوششانسترین لحظه را انتخاب کردهاید، پس نرخ واقعی مثبت کاذب به بالای ۵٪ میرسد، و هرچه بیشتر نگاه کنید بزرگتر میشود. مقدار p روی صفحه نمیداند که سرک کشیدهاید، پس همچنان جوری خوانده میشود که انگار یک بار نگاه کردهاید.
راهحل کسلکننده است و جواب میدهد: حجم نمونه را پیش از شروع آزمون تعیین کنید، بگذارید به آن حجم برسد، و نتیجه را یک بار بخوانید. نگاه کردن در میانه برای اطمینان از خراب نبودن چیزی اشکالی ندارد. توقف به این دلیل که عدد خوب به نظر میرسد، اشکال دارد.
Meta و Google Ads درباره طول آزمون چه میگویند
- بهترین شیوههای آزمون A/B در Meta آزمونهایی با حداقل ۷ روز را توصیه میکنند، میگویند آزمونهای کوتاهتر از آن ممکن است نتایج بینتیجه بدهند، و آزمونهای A/B را به ۳۰ روز محدود میکنند. همان صفحه پیشنهاد میکند اگر مشتریان معمولاً بیش از ۷ روز برای تبدیل زمان میبرند، آزمون را طولانیتر اجرا کنید.
- Meta معمولاً توان تخمینی ۸۰٪ یا بالاتر را پیشنهاد میکند، که همان توان پیشفرض در اینجاست. نتایج A/B آن یک درصد اطمینان نشان میدهد، و ۶۵٪ یا بالاتر را بهعنوان نتیجه برنده برای یک آزمون A/B در نظر میگیرد. آن عدد از روش خودِ Meta میآید و همان چیزی نیست که سطح اطمینان در این صفحه است، پس این دو با هم مطابقت نخواهند داشت.
- Meta همچنین توصیه میکند که آزمون را بهصورت غیررسمی انجام ندهید، یعنی با روشن و خاموش کردن مجموعهتبلیغها، چون مخاطبان میتوانند با هم همپوشانی داشته باشند، و برای هر دو نسخه بودجه یکسان را توصیه میکند.
- Google Ads توصیه میکند که یک آزمایش ۲ تا ۳ هفته اجرا شود، بهطور پیشفرض بازه اطمینان ۸۰٪ را نشان میدهد و سطوح دیگر در صورت درخواست، و نتایج معنادار را با ستاره آبی مشخص میکند. روش آماری آن از نمونهگیری مجدد jackknife روی ۲۰ سطل در هر بازو استفاده میکند، پس بازههای آن هم دقیقاً با یک آزمون z مطابقت نخواهد داشت.
این ماشینحساب چه کاری انجام نمیدهد
- این دو نسخه را مقایسه میکند. با سه نسخه یا بیشتر، هر مقایسه اضافی فرصتی دیگر برای یک برنده کاذب است، و آزمون ساده در اینجا آن را تصحیح نمیکند.
- این نرخهای تبدیل را آزمون میکند، نه درآمد بهازای هر بازدیدکننده یا ارزش سفارش را، که به آزمونی متفاوت نیاز دارند.
- این یک آزمون ترتیبی نیست. فرض میکند که نتیجه را یک بار، در حجم نمونهای که برنامهریزی کردهاید، میخوانید.
- نمیتواند تشخیص دهد که تقسیم شما منصفانه بوده یا نه. اگر یک نسخه مخاطب، بودجه یا زمان روز متفاوتی داشته، هیچ فرمولی آن را درست نمیکند.
اگر ترجیح میدهید اعداد را دستی حساب نکنید
Hermoso بازاریابی روی حالت خودکار است. از آن بپرسید چه چیزی را مقیاس دهید، متوقف کنید و بعد آزمون کنید و هر پلتفرم تبلیغاتی را که متصل کردهاید میخواند، کمپینهایی با داده بسیار کم را بهجای قضاوت در سطل مخصوص خودشان قرار میدهد، و به هر آزمون پیشنهادی یک فرضیه، تنها چیزی که باید تغییر کند، معیاری که تصمیم میگیرد، یک بودجه و یک مدت میدهد. همچنین نسخههای تصویری و ویدیویی همراستا با برند برای آزمون میسازد، و روی حسابهای تبلیغاتی خودتان کمپین میسازد که متوقف ایجاد میشوند. در وباپلیکیشن کار میکند، یا درون Claude، ChatGPT و Cursor از طریق سرور MCP آن. وقتی یک آزمون برندهای داشته باشد، ماشینحساب ROAS رایگان به شما میگوید که آیا سودآور هم هست.
ابزارهای رایگان: · محاسبهگر ROAS · بررسیکننده طول متن تبلیغ
پرسشهای متداول
چطور بفهمم که تست A/B تبلیغم از نظر آماری معنادار است؟
بازدیدکنندهها و تبدیلهای هر دو نسخه را وارد کنید. ماشینحساب یک آزمون z دو-نسبتی اجرا میکند و یک p-value دوطرفه میدهد. در اطمینان ۹۵٪، p-value کمتر از ۰.۰۵ یعنی اختلاف بعید است تصادفی باشد. برای ۲۰۰ از ۱۰٬۰۰۰ در برابر ۲۴۵ از ۱۰٬۰۰۰، مقدار p برابر ۰.۰۳۱ است، پس B برنده میشود.
یک تست A/B به چند بازدیدکننده نیاز دارد؟
به نرخ تبدیل شما و کوچکترین رشدی که میخواهید تشخیص دهید بستگی دارد. با نرخ تبدیل ۲٪، یافتن رشد ۲۰٪ با اطمینان ۹۵٪ و توان ۸۰٪ به ۲۱٬۱۰۹ بازدیدکننده در هر نسخه نیاز دارد. رشد ۱۰٪ به ۸۰٬۶۸۲ نیاز دارد.
چرا ماشینحساب میگوید هنوز داده کافی نیست؟
آزمون z یک تقریب نمونهبزرگ است. ماشینحساب صبر میکند تا هر نسخه دستکم ۵ تبدیل و ۵ عدمتبدیل داشته باشد، یکی از معیارهای ذکرشده در NIST e-Handbook، و بعد حکم میدهد.
آیا میتوانم بهمحض اینکه نتیجه معنادار به نظر رسید تست را متوقف کنم؟
نه اگر میخواهید سطح اطمینان همان معنایی را بدهد که میگوید. بررسی مکرر و توقف در اولین خوانش معنادار، به تصادف فرصتهای بیشتری میدهد تا از خط عبور کند، پس نرخ واقعی مثبت کاذب در نهایت بالاتر از آنچه انتخاب کردید میشود. اول حجم نمونه را تعیین کنید و نتیجه را یکبار بخوانید.
یک تست A/B در Meta چقدر باید اجرا شود؟
Meta دستکم ۷ روز را توصیه میکند، میگوید تستهای کوتاهتر ممکن است بینتیجه بمانند و تا ۳۰ روز را مجاز میداند. Google Ads برای آزمایشها ۲ تا ۳ هفته را توصیه میکند. از تب حجم نمونه با ترافیک روزانهتان استفاده کنید تا ببینید تست خودتان چقدر زمان لازم دارد.
آیا چیزی که تایپ میکنم جایی ارسال میشود؟
نه. محاسبهها در مرورگر شما اجرا میشوند. هیچ درخواست شبکهای آنچه را تایپ میکنید نمیبرد و چیزی ذخیره نمیشود.
Hermoso به شما میگوید در سراسر حسابهای تبلیغاتیتان چه چیزی را گسترش دهید، متوقف کنید و بعد تست کنید. رایگان شروع کنید، بیش از ۲۵۰ اعتبار رایگان قابلکسب، بدون کارت.
رایگان شروع کنید → مشاهده قیمتها