ماشین‌حساب تست A/B برای تبلیغات: معناداری و حجم نمونه

بازدیدکننده‌ها و تبدیل‌های دو نسخه را وارد کنید تا ببینید آیا اختلاف واقعی است، یا نرخ تبدیل و رشدی را که برایتان مهم است وارد کنید تا ببینید تست به چند بازدیدکننده نیاز دارد. هر دو فرمول نوشته شده‌اند، همراه با مثال‌های حل‌شده.

ابزار رایگان در مرورگر شما محاسبه می‌شود. چیزی ارسال، ذخیره یا ثبت نمی‌شود: سر دیگر این صفحه سروری وجود ندارد.

دو پرسش، یک ماشین‌حساب

هر تست تبلیغاتی دو چیز را، به این ترتیب، می‌پرسد. پیش از شروع: برای یافتن تفاوتی که برایم مهم است به چند بازدیدکننده نیاز دارم؟ پس از پایان: آیا فاصلهٔ میان A و B واقعی است یا می‌تواند تصادفی باشد؟ از دو زبانهٔ بالا به همین ترتیب استفاده کنید. محاسبهٔ حجم نمونه در ابتدا همان چیزی است که پاسخ پرسش دوم را معنادار می‌کند.

«بازدیدکنندگان» می‌توانند بازدیدکنندگان صفحهٔ فرود، کلیک‌روی لینک یا هر کس دیگری باشند که فرصت منصفانه‌ای برای تبدیل داشته است، به‌شرطی که هر دو نسخه به یک شیوه شمرده شوند. «تبدیل‌ها» کسانی هستند که همان کاری را کرده‌اند که آن را آزمایش می‌کنید.

تست معناداری چگونه کار می‌کند

ماشین‌حساب یک آزمون z برای دو نسبت اجرا می‌کند، همان آزمون نمونهٔ بزرگ برای مقایسهٔ دو نرخ که در NIST/SEMATECH e-Handbook of Statistical Methods توضیح داده شده است:

  • نرخ ترکیبی p = (تبدیل‌های A + تبدیل‌های B) ÷ (بازدیدکنندگان A + بازدیدکنندگان B).
  • z = (نرخ B − نرخ A) ÷ √(p × (1 − p) × (1/بازدیدکنندگان A + 1/بازدیدکنندگان B)).
  • مقدار p دوطرفه = 2 × (1 − Φ(|z|))، که در آن Φ توزیع نرمال استاندارد است.
  • بازهٔ تفاوت برابر است با (نرخ B − نرخ A) ± z × √(نرخ A × (1 − نرخ A) ÷ بازدیدکنندگان A + نرخ B × (1 − نرخ B) ÷ بازدیدکنندگان B). بازهٔ افزایش آن را بر نرخ A تقسیم می‌کند، که نرخ A را معلوم فرض می‌گیرد، پس یک تقریب است.

مثال حل‌شده. نسخهٔ A از ۱۰٬۰۰۰ بازدیدکننده ۲۰۰ تبدیل می‌گیرد (۲٫۰۰٪). نسخهٔ B از ۱۰٬۰۰۰ بازدیدکننده ۲۴۵ تبدیل می‌گیرد (۲٫۴۵٪)، یعنی ۲۲٫۵٪ افزایش نسبی. نرخ ترکیبی برابر است با 445 ÷ 20,000 = 2.225%، خطای استاندارد ۰٫۲۰۹ واحد درصدی است و z = 0.45 ÷ 0.209 = 2.157. مقدار p دوطرفه ۰٫۰۳۱ است، کمتر از ۰٫۰۵، پس با اطمینان ۹۵٪ B برنده است. بازهٔ ۹۵٪ برای تفاوت از ‎+۰٫۰۴ تا ‎+۰٫۸۶ واحد درصدی است: B بهتر است، اما افزایش واقعی می‌تواند هر جایی از حدود ۲٪ تا ۴۳٪ باشد.

این آزمون یک تقریب است که به دادهٔ کافی نیاز دارد. راهنمای NIST یک معیار می‌دهد: دست‌کم ۵ موفقیت و ۵ شکست. ماشین‌حساب تا زمانی که هر نسخه ۵ تبدیل و ۵ عدم‌تبدیل نداشته باشد، حکم خود را نگه می‌دارد و می‌گوید هنوز داده کافی نیست. با کمتر از این مقدار، NIST به یک آزمون دقیق برای نمونه‌های کوچک اشاره می‌کند، اما برای یک تست تبلیغاتی پاسخ عملی این است که آن را ادامه دهید.

حجم نمونه چگونه محاسبه می‌شود

برای یک آزمون دوطرفه، بازدیدکنندگان هر نسخه:

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

در اینجا p1 نرخ فعلی شما است، p2 همان نرخ با اعمال افزایش است، و p̄ میانگین آن‌هاست. این تقریب نرمال است، بدون تصحیح پیوستگی، و همان شکل فرمول حجم نمونه تک‌نسبتی در راهنمای NIST را دارد، با افزوده شدن یک گروه دوم. در سطح اطمینان ۹۵٪، z1−α/2 برابر ۱.۹۵۹۹۶۴ است، و در توان ۸۰٪، z1−β برابر ۰.۸۴۱۶۲۱ است.

مثال حل‌شده. نرخ تبدیل ۲٪، و می‌خواهید افزایش ۲۰٪ را تشخیص دهید، یعنی ۲.۰٪ در برابر ۲.۴٪. نرخ میانگین ۲.۲٪ است. خط بالا برابر است با ۱.۹۵۹۹۶۴ × ۰.۲۰۷۴ + ۰.۸۴۱۶۲۱ × ۰.۲۰۷۴ = ۰.۵۸۱۱، که به توان دو می‌شود ۰.۳۳۷۷، و با تقسیم بر ۰.۰۰۴² به ۲۱٬۱۰۹ بازدیدکننده برای هر نسخه می‌رسیم، در مجموع ۴۲٬۲۱۸. با ۳٬۰۰۰ بازدیدکننده در روز، این یعنی ۱۵ روز.

افزایشی که درخواست می‌کنید بیشترین اهمیت را دارد. در همان نرخ ۲٪، افزایش ۳۰٪ به ۹٬۷۹۸ بازدیدکننده برای هر نسخه نیاز دارد و افزایش ۱۰٪ به ۸۰٬۶۸۲. نصف کردن افزایش تقریباً ترافیک را چهار برابر می‌کند، چون این فاصله به صورت مربع در مخرج فرمول قرار دارد.

چرا توقف زودهنگام مثبت کاذب را افزایش می‌دهد

سطح اطمینان ۹۵٪ به این معناست که وقتی A و B واقعاً به یک اندازه تبدیل می‌کنند، یک آزمون منفرد با حجم نمونه ثابت همچنان حدود ۵٪ مواقع یک برنده اعلام می‌کند. آن ۵٪ تنها زمانی درست است که یک بار، در پایان، نگاه کنید.

بررسی نتیجه هر روز و توقف در نخستین باری که معنادار نشان می‌دهد، رویه‌ای متفاوت است. با ورود داده‌ها نرخ‌ها نوسان می‌کنند، و هر نگاه فرصتی دیگر است تا یک فاصله تصادفی از خط عبور کند. اگر در نخستین عبور متوقف شوید، خوش‌شانس‌ترین لحظه را انتخاب کرده‌اید، پس نرخ واقعی مثبت کاذب به بالای ۵٪ می‌رسد، و هرچه بیشتر نگاه کنید بزرگ‌تر می‌شود. مقدار p روی صفحه نمی‌داند که سرک کشیده‌اید، پس همچنان جوری خوانده می‌شود که انگار یک بار نگاه کرده‌اید.

راه‌حل کسل‌کننده است و جواب می‌دهد: حجم نمونه را پیش از شروع آزمون تعیین کنید، بگذارید به آن حجم برسد، و نتیجه را یک بار بخوانید. نگاه کردن در میانه برای اطمینان از خراب نبودن چیزی اشکالی ندارد. توقف به این دلیل که عدد خوب به نظر می‌رسد، اشکال دارد.

Meta و Google Ads درباره طول آزمون چه می‌گویند

  • بهترین شیوه‌های آزمون A/B در Meta آزمون‌هایی با حداقل ۷ روز را توصیه می‌کنند، می‌گویند آزمون‌های کوتاه‌تر از آن ممکن است نتایج بی‌نتیجه بدهند، و آزمون‌های A/B را به ۳۰ روز محدود می‌کنند. همان صفحه پیشنهاد می‌کند اگر مشتریان معمولاً بیش از ۷ روز برای تبدیل زمان می‌برند، آزمون را طولانی‌تر اجرا کنید.
  • Meta معمولاً توان تخمینی ۸۰٪ یا بالاتر را پیشنهاد می‌کند، که همان توان پیش‌فرض در اینجاست. نتایج A/B آن یک درصد اطمینان نشان می‌دهد، و ۶۵٪ یا بالاتر را به‌عنوان نتیجه برنده برای یک آزمون A/B در نظر می‌گیرد. آن عدد از روش خودِ Meta می‌آید و همان چیزی نیست که سطح اطمینان در این صفحه است، پس این دو با هم مطابقت نخواهند داشت.
  • Meta همچنین توصیه می‌کند که آزمون را به‌صورت غیررسمی انجام ندهید، یعنی با روشن و خاموش کردن مجموعه‌تبلیغ‌ها، چون مخاطبان می‌توانند با هم همپوشانی داشته باشند، و برای هر دو نسخه بودجه یکسان را توصیه می‌کند.
  • Google Ads توصیه می‌کند که یک آزمایش ۲ تا ۳ هفته اجرا شود، به‌طور پیش‌فرض بازه اطمینان ۸۰٪ را نشان می‌دهد و سطوح دیگر در صورت درخواست، و نتایج معنادار را با ستاره آبی مشخص می‌کند. روش آماری آن از نمونه‌گیری مجدد jackknife روی ۲۰ سطل در هر بازو استفاده می‌کند، پس بازه‌های آن هم دقیقاً با یک آزمون z مطابقت نخواهد داشت.

این ماشین‌حساب چه کاری انجام نمی‌دهد

  • این دو نسخه را مقایسه می‌کند. با سه نسخه یا بیشتر، هر مقایسه اضافی فرصتی دیگر برای یک برنده کاذب است، و آزمون ساده در اینجا آن را تصحیح نمی‌کند.
  • این نرخ‌های تبدیل را آزمون می‌کند، نه درآمد به‌ازای هر بازدیدکننده یا ارزش سفارش را، که به آزمونی متفاوت نیاز دارند.
  • این یک آزمون ترتیبی نیست. فرض می‌کند که نتیجه را یک بار، در حجم نمونه‌ای که برنامه‌ریزی کرده‌اید، می‌خوانید.
  • نمی‌تواند تشخیص دهد که تقسیم شما منصفانه بوده یا نه. اگر یک نسخه مخاطب، بودجه یا زمان روز متفاوتی داشته، هیچ فرمولی آن را درست نمی‌کند.

اگر ترجیح می‌دهید اعداد را دستی حساب نکنید

Hermoso بازاریابی روی حالت خودکار است. از آن بپرسید چه چیزی را مقیاس دهید، متوقف کنید و بعد آزمون کنید و هر پلتفرم تبلیغاتی را که متصل کرده‌اید می‌خواند، کمپین‌هایی با داده بسیار کم را به‌جای قضاوت در سطل مخصوص خودشان قرار می‌دهد، و به هر آزمون پیشنهادی یک فرضیه، تنها چیزی که باید تغییر کند، معیاری که تصمیم می‌گیرد، یک بودجه و یک مدت می‌دهد. همچنین نسخه‌های تصویری و ویدیویی هم‌راستا با برند برای آزمون می‌سازد، و روی حساب‌های تبلیغاتی خودتان کمپین می‌سازد که متوقف ایجاد می‌شوند. در وب‌اپلیکیشن کار می‌کند، یا درون Claude، ChatGPT و Cursor از طریق سرور MCP آن. وقتی یک آزمون برنده‌ای داشته باشد، ماشین‌حساب ROAS رایگان به شما می‌گوید که آیا سودآور هم هست.

ابزارهای رایگان: · محاسبه‌گر ROAS · بررسی‌کننده طول متن تبلیغ

پرسش‌های متداول

چطور بفهمم که تست A/B تبلیغم از نظر آماری معنادار است؟

بازدیدکننده‌ها و تبدیل‌های هر دو نسخه را وارد کنید. ماشین‌حساب یک آزمون z دو-نسبتی اجرا می‌کند و یک p-value دوطرفه می‌دهد. در اطمینان ۹۵٪، p-value کمتر از ۰.۰۵ یعنی اختلاف بعید است تصادفی باشد. برای ۲۰۰ از ۱۰٬۰۰۰ در برابر ۲۴۵ از ۱۰٬۰۰۰، مقدار p برابر ۰.۰۳۱ است، پس B برنده می‌شود.

یک تست A/B به چند بازدیدکننده نیاز دارد؟

به نرخ تبدیل شما و کوچک‌ترین رشدی که می‌خواهید تشخیص دهید بستگی دارد. با نرخ تبدیل ۲٪، یافتن رشد ۲۰٪ با اطمینان ۹۵٪ و توان ۸۰٪ به ۲۱٬۱۰۹ بازدیدکننده در هر نسخه نیاز دارد. رشد ۱۰٪ به ۸۰٬۶۸۲ نیاز دارد.

چرا ماشین‌حساب می‌گوید هنوز داده کافی نیست؟

آزمون z یک تقریب نمونه‌بزرگ است. ماشین‌حساب صبر می‌کند تا هر نسخه دست‌کم ۵ تبدیل و ۵ عدم‌تبدیل داشته باشد، یکی از معیارهای ذکرشده در NIST e-Handbook، و بعد حکم می‌دهد.

آیا می‌توانم به‌محض اینکه نتیجه معنادار به نظر رسید تست را متوقف کنم؟

نه اگر می‌خواهید سطح اطمینان همان معنایی را بدهد که می‌گوید. بررسی مکرر و توقف در اولین خوانش معنادار، به تصادف فرصت‌های بیشتری می‌دهد تا از خط عبور کند، پس نرخ واقعی مثبت کاذب در نهایت بالاتر از آنچه انتخاب کردید می‌شود. اول حجم نمونه را تعیین کنید و نتیجه را یک‌بار بخوانید.

یک تست A/B در Meta چقدر باید اجرا شود؟

Meta دست‌کم ۷ روز را توصیه می‌کند، می‌گوید تست‌های کوتاه‌تر ممکن است بی‌نتیجه بمانند و تا ۳۰ روز را مجاز می‌داند. Google Ads برای آزمایش‌ها ۲ تا ۳ هفته را توصیه می‌کند. از تب حجم نمونه با ترافیک روزانه‌تان استفاده کنید تا ببینید تست خودتان چقدر زمان لازم دارد.

آیا چیزی که تایپ می‌کنم جایی ارسال می‌شود؟

نه. محاسبه‌ها در مرورگر شما اجرا می‌شوند. هیچ درخواست شبکه‌ای آنچه را تایپ می‌کنید نمی‌برد و چیزی ذخیره نمی‌شود.

Hermoso به شما می‌گوید در سراسر حساب‌های تبلیغاتی‌تان چه چیزی را گسترش دهید، متوقف کنید و بعد تست کنید. رایگان شروع کنید، بیش از ۲۵۰ اعتبار رایگان قابل‌کسب، بدون کارت.

رایگان شروع کنید →   مشاهده قیمت‌ها