מחשבון בדיקת A/B למודעות: מובהקות וגודל מדגם

הזינו מבקרים והמרות לשתי גרסאות כדי לראות אם הפער אמיתי, או הזינו את שיעור ההמרה שלכם ואת השיפור שחשוב לכם כדי לראות כמה מבקרים הבדיקה צריכה. שתי הנוסחאות כתובות במלואן, עם דוגמאות מפורטות.

כלי חינמי מחשב בדפדפן שלך. שום דבר לא נשלח, נשמר או נרשם: אין שרת בצד השני של העמוד הזה.

שתי שאלות, מחשבון אחד

כל בדיקת מודעה שואלת שני דברים, בסדר הזה. לפני שהיא מתחילה: כמה מבקרים דרושים כדי לזהות את ההבדל שחשוב לי? אחרי שהיא מסתיימת: האם ההפרש בין A ל-B אמיתי, או שזה עשוי להיות מקרי? השתמשו בשתי הלשוניות שלמעלה בסדר הזה. חישוב גודל המדגם תחילה הוא מה שנותן משמעות לתשובה לשאלה השנייה.

“מבקרים” יכולים להיות מבקרים בדף הנחיתה, קליקים על קישורים או כל מי שקיבל הזדמנות הוגנת לבצע המרה, כל עוד שתי הגרסאות נספרות באותה דרך. “המרות” הן האנשים שעשו את הפעולה שאתם בודקים.

איך עובדת בדיקת המובהקות

המחשבון מריץ בדיקת z לשתי פרופורציות, בדיקת המדגם הגדול להשוואת שני שיעורים המתוארת ב-NIST/SEMATECH e-Handbook of Statistical Methods:

  • שיעור מאוחד p = (המרות A + המרות B) ÷ (מבקרים A + מבקרים B).
  • z = (שיעור B − שיעור A) ÷ √(p × (1 − p) × (1/מבקרים A + 1/מבקרים B)).
  • ערך p דו-צדדי = 2 × (1 − Φ(|z|)), כאשר Φ היא ההתפלגות הנורמלית הסטנדרטית.
  • הרווח להפרש הוא (שיעור B − שיעור A) ± z × √(שיעור A × (1 − שיעור A) ÷ מבקרים A + שיעור B × (1 − שיעור B) ÷ מבקרים B). טווח השיפור מחלק זאת בשיעור A, מה שמתייחס לשיעור A כידוע, ולכן זה קירוב.

דוגמה מעובדת. גרסה A מקבלת 200 המרות מתוך 10,000 מבקרים (2.00%). גרסה B מקבלת 245 מתוך 10,000 (2.45%), שיפור יחסי של 22.5%. השיעור המאוחד הוא 445 ÷ 20,000 = 2.225%, שגיאת התקן היא 0.209 נקודות אחוז, ו-z = 0.45 ÷ 0.209 = 2.157. ערך p הדו-צדדי הוא 0.031, מתחת ל-0.05, ולכן ברמת ביטחון של 95% B מנצחת. הרווח של 95% להפרש נע מ-+0.04 עד +0.86 נקודות אחוז: B טובה יותר, אבל השיפור האמיתי יכול להיות בכל מקום בין כ-2% לכ-43%.

הבדיקה היא קירוב שדורש מספיק נתונים. המדריך של NIST נותן קריטריון אחד: לפחות 5 הצלחות ו-5 כישלונות. המחשבון מעכב את הפסיקה שלו ואומר עדיין אין מספיק נתונים עד שלכל גרסה יש 5 המרות ו-5 אי-המרות. עם פחות מכך, NIST מפנה לבדיקה מדויקת למדגמים קטנים, אבל בבדיקת מודעה התשובה המעשית היא להמשיך להריץ אותה.

איך מחושב גודל המדגם

לבדיקה דו-צדדית, מבקרים לכל גרסה:

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

כאן p1 הוא השיעור הנוכחי שלך, p2 הוא אותו שיעור עם השיפור שהוחל, ו-p̄ הוא הממוצע שלהם. זהו הקירוב הנורמלי, ללא תיקון רציפות, ויש לו אותה צורה כמו נוסחת גודל המדגם לפרופורציה בודדת במדריך של NIST, עם קבוצה שנייה שנוספה. ברמת ביטחון של 95% ערך z1−α/2 הוא 1.959964, ובעוצמה של 80% ערך z1−β הוא 0.841621.

דוגמה מעובדת. שיעור המרה של 2%, ואתה רוצה לזהות שיפור של 20%, כלומר 2.0% מול 2.4%. השיעור הממוצע הוא 2.2%. השורה העליונה היא 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811, בריבוע זה 0.3377, וחלוקה ב-0.004² נותנת 21,109 מבקרים לכל גרסה, 42,218 בסך הכול. ב-3,000 מבקרים ביום זה 15 ימים.

השיפור שאתה מבקש לזהות הוא הגורם החשוב ביותר. באותו שיעור של 2%, שיפור של 30% דורש 9,798 לכל גרסה ושיפור של 10% דורש 80,682. חצייה של השיפור מכפילה בערך פי ארבעה את התנועה הדרושה, כי הפער יושב בריבוע במכנה של הנוסחה.

למה עצירה מוקדמת מנפחת תוצאות חיוביות שגויות

רמת ביטחון של 95% משמעותה שכאשר A ו-B ממירים באמת באותו שיעור, בדיקה בודדת בגודל מדגם קבוע עדיין מכריזה על מנצח בכ-5% מהמקרים. אותם 5% נכונים רק אם מסתכלים פעם אחת, בסוף.

בדיקת התוצאה כל יום ועצירה בפעם הראשונה שהיא מראה מובהקות היא נוהל אחר. השיעורים משוטטים ככל שהנתונים נכנסים, וכל התבוננות היא עוד הזדמנות שפער מקרי יחצה את הקו. עצור בחצייה הראשונה ובחרת את הרגע בעל המזל הטוב ביותר, כך ששיעור התוצאות החיוביות השגויות האמיתי בסופו של דבר עולה מעל 5%, והוא גדל ככל שמסתכלים יותר פעמים. ערך ה-p על המסך לא יודע שהצצת, אז הוא עדיין מראה כאילו הסתכלת פעם אחת.

הפתרון משעמם והוא עובד: קבע את גודל המדגם לפני שהבדיקה מתחילה, תן לה להגיע לגודל הזה, וקרא את התוצאה פעם אחת. בדיקה באמצע כדי לוודא ששום דבר לא נשבר היא בסדר. עצירה כי המספר נראה טוב היא לא.

מה Meta ו-Google Ads אומרים על משך הבדיקה

  • השיטות העבודה המומלצות לבדיקות A/B של Meta ממליצות על בדיקות של 7 ימים לפחות, אומרות שבדיקות קצרות מכך עלולות להניב תוצאות לא חד-משמעיות, ומגבילות בדיקות A/B ל-30 ימים. אותו עמוד מציע להריץ זמן ארוך יותר אם לרוב לוקח ללקוחות יותר מ-7 ימים להמיר.
  • Meta בדרך כלל מציעה עוצמה מוערכת של 80% ומעלה, העוצמה המוגדרת כברירת מחדל כאן. תוצאות ה-A/B שלה מציגות אחוז ביטחון, והיא מתייחסת ל-65% ומעלה כתוצאה מנצחת בבדיקת A/B. הנתון הזה מגיע מהשיטה של Meta עצמה ואינו אותו דבר כמו רמת הביטחון בעמוד זה, ולכן השניים לא יתאימו.
  • Meta גם ממליצה נגד בדיקה לא פורמלית על ידי הפעלה וכיבוי של קבוצות מודעות, כי קהלים יכולים לחפוף, וממליצה על אותו תקציב לשתי הגרסאות.
  • Google Ads ממליצה לתת לניסוי לרוץ 2 עד 3 שבועות, מציגה רווח בר-סמך של 80% כברירת מחדל עם רמות אחרות לפי בקשה, ומסמנת תוצאות מובהקות בכוכבית כחולה. השיטה הסטטיסטית שלה משתמשת בדגימה חוזרת מסוג jackknife על פני 20 דליים לכל זרוע, כך שגם הרווחים שלה לא יתאימו בדיוק למבחן z.

מה המחשבון הזה לא עושה

  • הוא משווה שתי גרסאות. עם שלוש או יותר, כל השוואה נוספת היא עוד הזדמנות למנצח שגוי, והמבחן הפשוט כאן לא מתקן את זה.
  • הוא בודק שיעורי המרה, לא הכנסה למבקר או ערך הזמנה, שדורשים מבחן אחר.
  • זה אינו מבחן סדרתי. הוא מניח שאתה קורא את התוצאה פעם אחת, בגודל המדגם שתכננת.
  • הוא לא יכול לומר אם הפיצול שלך היה הוגן. אם גרסה אחת קיבלה קהל, תקציב או שעה ביום שונים, שום נוסחה לא מתקנת את זה.

אם אתה מעדיף לא לחשב את המספרים ידנית

Hermoso הוא שיווק בטייס אוטומטי. שאל אותו מה להרחיב, להשהות ולבדוק בהמשך והוא קורא כל פלטפורמת פרסום שחיברת, מכניס קמפיינים עם מעט מדי נתונים לדלי משלהם במקום לשפוט אותם, ונותן לכל בדיקה מוצעת השערה, הדבר האחד שיש לשנות, המדד שמכריע, תקציב ומשך. הוא גם יוצר וריאציות תמונה ווידאו תואמות מותג לבדיקה, ובונה קמפיינים בחשבונות הפרסום שלך, שנוצרים מושהים. הוא עובד באפליקציית הווב, או בתוך Claude, ChatGPT ו-Cursor דרך שרת ה-MCP שלו. כשלבדיקה יש מנצח, מחשבון ה-ROAS החינמי אומר לך אם היא גם רווחית.

כלים חינמיים: · מחשבון ROAS · בודק אורך טקסט מודעות

שאלות נפוצות

איך אני יודע אם בדיקת ה-A/B של המודעה שלי מובהקת סטטיסטית?

הזינו מבקרים והמרות לשתי הגרסאות. המחשבון מריץ מבחן z לשתי פרופורציות ונותן ערך p דו-צדדי. ברמת ביטחון של 95%, ערך p מתחת ל-0.05 אומר שהפער כנראה אינו מקרי. עבור 200 מתוך 10,000 מול 245 מתוך 10,000, ערך ה-p הוא 0.031, אז B מנצחת.

כמה מבקרים בדיקת A/B צריכה?

זה תלוי בשיעור ההמרה שלכם ובשיפור הקטן ביותר שאתם רוצים לזהות. בשיעור המרה של 2%, זיהוי שיפור של 20% ברמת ביטחון של 95% ועוצמה של 80% דורש 21,109 מבקרים לכל גרסה. שיפור של 10% דורש 80,682.

למה המחשבון אומר שעדיין אין מספיק נתונים?

מבחן ה-z הוא קירוב למדגם גדול. המחשבון ממתין עד שלכל גרסה יש לפחות 5 המרות ו-5 אי-המרות, אחד הקריטריונים המופיעים ב-NIST e-Handbook, לפני שהוא נותן פסק דין.

האם אני יכול לעצור בדיקה ברגע שהיא נראית מובהקת?

לא אם אתם רוצים שרמת הביטחון תהיה מה שהיא אומרת. בדיקה חוזרת ועצירה בקריאה המובהקת הראשונה נותנת למקריות יותר הזדמנויות לחצות את הקו, כך שהשיעור האמיתי של תוצאות חיוביות שגויות בסופו של דבר גבוה מזה שבחרתם. קבעו את גודל המדגם תחילה וקראו את התוצאה פעם אחת.

כמה זמן בדיקת A/B של Meta צריכה לרוץ?

Meta ממליצה על לפחות 7 ימים, אומרת שבדיקות קצרות יותר עלולות להיות לא חד-משמעיות, ומאפשרת עד 30 יום. Google Ads ממליצה על 2 עד 3 שבועות לניסויים. השתמשו בלשונית גודל המדגם עם התנועה היומית שלכם כדי לראות כמה זמן הבדיקה שלכם צריכה.

האם משהו שאני מקליד נשלח לאיזשהו מקום?

לא. החישובים רצים בדפדפן שלכם. אין בקשת רשת שנושאת את מה שאתם מקלידים ושום דבר לא נשמר.

Hermoso אומר לכם מה להרחיב, להשהות ולבדוק הלאה בכל חשבונות המודעות שלכם. התחילו בחינם, 250+ קרדיטים חינמיים שניתן להרוויח, בלי כרטיס.

התחילו בחינם →   צפייה בתמחור