حاسبة اختبار A/B للإعلانات: الدلالة الإحصائية وحجم العينة

أدخل الزوار والتحويلات لنسختين لمعرفة ما إذا كان الفرق حقيقياً، أو أدخل معدل التحويل والتحسّن الذي يهمك لمعرفة عدد الزوار الذي يحتاجه الاختبار. كلتا المعادلتين مكتوبتان بالكامل، مع أمثلة محلولة.

أداة مجانية تحسبها في متصفحك. لا يُرسَل شيء ولا يُخزَّن ولا يُسجَّل: لا يوجد خادم على الطرف الآخر من هذه الصفحة.

سؤالان، وحاسبة واحدة

كل اختبار إعلان يطرح سؤالين، بهذا الترتيب. قبل أن يبدأ: كم زائراً يحتاج لكشف الفرق الذي يهمني؟ بعد أن ينتهي: هل الفجوة بين A وB حقيقية، أم أنها قد تكون صدفة؟ استخدم التبويبين أعلاه بهذا الترتيب. حساب حجم العينة أولاً هو ما يجعل الإجابة عن السؤال الثاني ذات معنى.

“الزوار” قد يكونون زوار صفحة الهبوط أو النقرات على الروابط أو أي شخص آخر أتيحت له فرصة عادلة للتحويل، طالما تُحتسب النسختان بالطريقة نفسها. “التحويلات” هم الأشخاص الذين قاموا بالإجراء الذي تختبره.

كيف يعمل اختبار الدلالة

تُجري الحاسبة اختبار z لنسبتين، وهو اختبار العينات الكبيرة لمقارنة معدلين الموصوف في دليل NIST/SEMATECH الإلكتروني للطرق الإحصائية:

  • المعدل المجمّع p = (تحويلات A + تحويلات B) ÷ (زوار A + زوار B).
  • z = (معدل B − معدل A) ÷ √(p × (1 − p) × (1/زوار A + 1/زوار B)).
  • قيمة p ثنائية الجانب = 2 × (1 − Φ(|z|))، حيث Φ هي التوزيع الطبيعي المعياري.
  • فترة الفرق هي (معدل B − معدل A) ± z × √(معدل A × (1 − معدل A) ÷ زوار A + معدل B × (1 − معدل B) ÷ زوار B). ويقسم نطاق الارتفاع ذلك على معدل A، وهو ما يعامل معدل A كقيمة معلومة، لذا فهو تقريبي.

مثال محلول. تحقق النسخة A 200 تحويل من 10,000 زائر (2.00%). وتحقق النسخة B 245 من 10,000 (2.45%)، أي ارتفاع نسبي بنسبة 22.5%. المعدل المجمّع هو 445 ÷ 20,000 = 2.225%، والخطأ المعياري 0.209 نقطة مئوية، وz = 0.45 ÷ 0.209 = 2.157. قيمة p ثنائية الجانب هي 0.031، وهي أقل من 0.05، لذا تفوز B بثقة 95%. تمتد فترة الثقة 95% للفرق من +0.04 إلى +0.86 نقطة مئوية: B أفضل، لكن الارتفاع الحقيقي قد يكون في أي مكان بين نحو 2% و43%.

الاختبار تقريبي ويحتاج إلى بيانات كافية. يقدّم دليل NIST معياراً واحداً: 5 نجاحات و5 إخفاقات على الأقل. تحجب الحاسبة حكمها وتقول لا توجد بيانات كافية بعد حتى يكون لكل نسخة 5 تحويلات و5 حالات عدم تحويل. وإذا كان العدد أقل من ذلك، يشير NIST إلى اختبار دقيق للعينات الصغيرة، لكن الإجابة العملية لاختبار الإعلان هي الاستمرار في تشغيله.

كيف يُحسب حجم العينة

لاختبار ثنائي الجانب، عدد الزوار لكل نسخة:

ن = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

هنا p1 هو معدلك الحالي، وp2 هو ذلك المعدل بعد تطبيق التحسين، وp̄ هو متوسطهما. إنها التقريب الطبيعي، دون تصحيح الاستمرارية، ولها الشكل نفسه الذي لصيغة حجم العينة لنسبة واحدة في دليل NIST، مع إضافة مجموعة ثانية. عند ثقة 95% تكون z1−α/2 هي 1.959964، وعند قدرة 80% تكون z1−β هي 0.841621.

مثال محلول. معدل تحويل 2%، وتريد رصد تحسين بنسبة 20%، أي 2.0% مقابل 2.4%. المعدل المتوسط هو 2.2%. السطر العلوي هو 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811، وتربيعه 0.3377، والقسمة على 0.004² تعطي 21,109 زائرًا لكل نسخة، أي 42,218 إجمالًا. وبمعدل 3,000 زائر يوميًا، هذا 15 يومًا.

التحسين الذي تطلبه هو الأهم. على المعدل نفسه البالغ 2%، يحتاج تحسين بنسبة 30% إلى 9,798 لكل نسخة، ويحتاج تحسين بنسبة 10% إلى 80,682. تقليل التحسين إلى النصف يضاعف الزيارات أربع مرات تقريبًا، لأن الفجوة تقع مربّعة في مقام الصيغة.

لماذا يضخّم التوقف المبكر النتائج الإيجابية الخاطئة

مستوى ثقة 95% يعني أنه عندما يحقق A وB معدل التحويل نفسه فعليًا، فإن اختبارًا واحدًا بحجم عينة ثابت يعلن فائزًا نحو 5% من الوقت. تلك الـ5% صحيحة فقط إذا نظرت مرة واحدة، في النهاية.

التحقق من النتيجة كل يوم والتوقف في أول مرة تظهر فيها دلالة إحصائية هو إجراء مختلف. تتذبذب المعدلات مع ورود البيانات، وكل نظرة هي فرصة أخرى لأن تعبر فجوة عشوائية الخط. توقّف عند أول عبور وتكون قد اخترت أكثر اللحظات حظًا، فينتهي المعدل الحقيقي للنتائج الإيجابية الخاطئة فوق 5%، ويزداد كلما نظرت أكثر. قيمة p على الشاشة لا تعلم أنك اختلست النظر، فتبدو كأنك نظرت مرة واحدة.

الحل ممل لكنه ناجع: حدّد حجم العينة قبل بدء الاختبار، ودعه يصل إلى ذلك الحجم، واقرأ النتيجة مرة واحدة. لا بأس بالنظر في المنتصف للتأكد من عدم وجود خلل. أما التوقف لأن الرقم يبدو جيدًا فلا.

ما تقوله Meta وGoogle Ads عن مدة الاختبار

  • توصي أفضل ممارسات اختبار A/B من Meta بإجراء اختبارات مدتها 7 أيام على الأقل، وتقول إن الاختبارات الأقصر من ذلك قد تؤدي إلى نتائج غير حاسمة، وتحدّد سقف اختبارات A/B بـ30 يومًا. وتقترح الصفحة نفسها تشغيلًا أطول إذا كان العملاء عادة يستغرقون أكثر من 7 أيام للتحويل.
  • تقترح Meta عادةً قدرة تقديرية بنسبة 80% أو أعلى، وهي القدرة الافتراضية هنا. تعرض نتائج A/B لديها نسبة ثقة، وتعتبر 65% أو أعلى نتيجة فائزة لاختبار A/B. يأتي هذا الرقم من منهجية Meta الخاصة وليس هو نفسه مستوى الثقة في هذه الصفحة، لذا لن يتطابق الاثنان.
  • كما تنصح Meta بعدم الاختبار بشكل غير رسمي عبر تشغيل مجموعات الإعلانات وإيقافها، لأن الجماهير قد تتداخل، وتوصي بالميزانية نفسها للنسختين.
  • توصي Google Ads بترك التجربة تعمل من أسبوعين إلى 3 أسابيع، وتعرض فاصل ثقة 80% افتراضيًا مع مستويات أخرى عند الطلب، وتميّز النتائج ذات الدلالة بنجمة زرقاء. وتستخدم منهجيتها الإحصائية إعادة أخذ عينات بطريقة jackknife عبر 20 سلة لكل ذراع، لذا لن تتطابق فواصلها أيضًا مع اختبار z تمامًا.

ما لا تفعله هذه الحاسبة

  • تقارن بين نسختين. ومع ثلاث نسخ أو أكثر، تصبح كل مقارنة إضافية فرصة أخرى لفائز زائف، والاختبار البسيط هنا لا يعدّل لذلك.
  • تختبر معدلات التحويل، لا الإيراد لكل زائر أو قيمة الطلب، وهذه تحتاج إلى اختبار مختلف.
  • ليست اختبارًا متتابعًا. تفترض أنك تقرأ النتيجة مرة واحدة، عند حجم العينة الذي خططت له.
  • لا يمكنها أن تخبرك ما إذا كان تقسيمك عادلًا. إذا حصلت إحدى النسخ على جمهور أو ميزانية أو وقت من اليوم مختلف، فلا صيغة تصلح ذلك.

إذا كنت تفضّل ألا تحسب الأرقام يدويًا

Hermoso هو التسويق على الطيار الآلي. اسأله ما الذي تُوسّعه وتُوقفه وتختبره تاليًا فيقرأ كل منصة إعلانية ربطتها، ويضع الحملات ذات البيانات القليلة جدًا في سلة خاصة بها بدلًا من الحكم عليها، ويمنح كل اختبار مقترح فرضية، والشيء الواحد الذي يجب تغييره، والمقياس الذي يحسمه، وميزانية، ومدة. كما يصنع نسخًا من الصور والفيديو متوافقة مع علامتك لاختبارها، ويبني الحملات على حسابات إعلاناتك الخاصة، مُنشأة في وضع الإيقاف. يعمل في تطبيق الويب، أو داخل Claude وChatGPT وCursor عبر خادم MCP الخاص به. وبمجرد أن يكون للاختبار فائز، تخبرك حاسبة ROAS المجانية ما إذا كان مربحًا أيضًا.

الأدوات المجانية: · حاسبة ROAS · فاحص طول نص الإعلان

الأسئلة الشائعة

كيف أعرف إن كان اختبار A/B لإعلاني ذا دلالة إحصائية؟

أدخل الزوار والتحويلات لكلتا النسختين. تُجري الحاسبة اختبار z لنسبتين وتعطي قيمة p ثنائية الجانب. عند ثقة 95%، فإن قيمة p أقل من 0.05 تعني أن الفرق من غير المرجح أن يكون صدفة. لـ 200 من 10,000 مقابل 245 من 10,000، تكون p هي 0.031، فتفوز B.

كم عدد الزوار الذي يحتاجه اختبار A/B؟

يعتمد على معدل التحويل لديك وأصغر تحسّن تريد اكتشافه. عند معدل تحويل 2%، فإن اكتشاف تحسّن بنسبة 20% عند ثقة 95% وقوة 80% يتطلب 21,109 زائراً لكل نسخة. وتحسّن بنسبة 10% يتطلب 80,682.

لماذا تقول الحاسبة إن البيانات غير كافية بعد؟

اختبار z هو تقريب للعينات الكبيرة. تنتظر الحاسبة حتى تحتوي كل نسخة على 5 تحويلات على الأقل و5 حالات عدم تحويل، وهو أحد المعايير المذكورة في دليل NIST الإلكتروني، قبل أن تعطي حكماً.

هل يمكنني إيقاف الاختبار بمجرد أن يبدو ذا دلالة؟

ليس إذا أردت أن يعني مستوى الثقة ما يقوله. فالتحقق المتكرر والتوقف عند أول قراءة ذات دلالة يعطي الصدفة فرصاً أكثر لتجاوز الخط، فينتهي المعدل الحقيقي للإيجابيات الكاذبة أعلى من الذي اخترته. حدّد حجم العينة أولاً واقرأ النتيجة مرة واحدة.

كم يجب أن يستمر اختبار A/B على Meta؟

توصي Meta بـ 7 أيام على الأقل، وتقول إن الاختبارات الأقصر قد تكون غير حاسمة، وتسمح بما يصل إلى 30 يوماً. وتوصي Google Ads بأسبوعين إلى ثلاثة أسابيع للتجارب. استخدم علامة تبويب حجم العينة مع حركة المرور اليومية لديك لمعرفة المدة التي يحتاجها اختبارك.

هل يُرسَل أي شيء أكتبه إلى أي مكان؟

لا. تُجرى الحسابات في متصفحك. ليس هناك أي طلب شبكة يحمل ما تكتبه ولا يُخزَّن شيء.

يخبرك Hermoso بما يجب توسيعه وإيقافه مؤقتاً واختباره تالياً عبر حسابات إعلاناتك. ابدأ مجاناً، أكثر من 250 رصيداً مجانياً قابلاً للكسب، دون بطاقة.

ابدأ مجاناً →   عرض الأسعار