เครื่องคำนวณ A/B test สำหรับโฆษณา: นัยสำคัญและขนาดกลุ่มตัวอย่าง

ใส่จำนวนผู้เข้าชมและคอนเวอร์ชันของสองเวอร์ชันเพื่อดูว่าช่องว่างนั้นเป็นจริงหรือไม่ หรือใส่อัตราคอนเวอร์ชันและการเพิ่มขึ้นที่คุณสนใจเพื่อดูว่าการทดสอบต้องการผู้เข้าชมจำนวนเท่าใด ทั้งสองสูตรเขียนไว้ครบถ้วน พร้อมตัวอย่างที่คำนวณไว้แล้ว

เครื่องมือฟรี คำนวณในเบราว์เซอร์ของคุณ ไม่มีการส่ง เก็บ หรือบันทึกอะไร: ไม่มีเซิร์ฟเวอร์อยู่อีกฝั่งของหน้านี้

สองคำถาม หนึ่งเครื่องคำนวณ

การทดสอบโฆษณาทุกครั้งถามสองสิ่งตามลำดับนี้ ก่อน เริ่ม: ต้องใช้ผู้เข้าชมกี่คนเพื่อหาความแตกต่างที่ฉันสนใจ? หลัง จบ: ช่องว่างระหว่าง A และ B เป็นของจริงหรืออาจเป็นความบังเอิญ? ใช้สองแท็บด้านบนตามลำดับนั้น การคำนวณขนาดตัวอย่างก่อนคือสิ่งที่ทำให้คำตอบของคำถามที่สองมีความหมาย

“ผู้เข้าชม” อาจเป็นผู้เข้าชมหน้าแลนดิ้ง การคลิกลิงก์ หรือใครก็ตามที่ได้รับโอกาสแปลงอย่างเป็นธรรม ตราบใดที่นับทั้งสองเวอร์ชันด้วยวิธีเดียวกัน “การแปลง” คือคนที่ทำสิ่งที่คุณกำลังทดสอบ

การทดสอบนัยสำคัญทำงานอย่างไร

เครื่องคำนวณทำการทดสอบ z แบบสองสัดส่วน ซึ่งเป็นการทดสอบตัวอย่างขนาดใหญ่สำหรับเปรียบเทียบอัตราสองค่าที่อธิบายไว้ใน NIST/SEMATECH e-Handbook of Statistical Methods:

  • อัตรารวม p = (การแปลง A + การแปลง B) ÷ (ผู้เข้าชม A + ผู้เข้าชม B)
  • z = (อัตรา B − อัตรา A) ÷ √(p × (1 − p) × (1/ผู้เข้าชม A + 1/ผู้เข้าชม B))
  • ค่า p สองด้าน = 2 × (1 − Φ(|z|)) โดยที่ Φ คือการแจกแจงปกติมาตรฐาน
  • ช่วงสำหรับความแตกต่างคือ (อัตรา B − อัตรา A) ± z × √(อัตรา A × (1 − อัตรา A) ÷ ผู้เข้าชม A + อัตรา B × (1 − อัตรา B) ÷ ผู้เข้าชม B) ช่วงการเพิ่มขึ้นหารค่านั้นด้วยอัตรา A ซึ่งถือว่าอัตรา A เป็นค่าที่ทราบแล้ว จึงเป็นการประมาณ

ตัวอย่างที่คำนวณแล้ว เวอร์ชัน A ได้การแปลง 200 ครั้งจากผู้เข้าชม 10,000 คน (2.00%) เวอร์ชัน B ได้ 245 ครั้งจาก 10,000 คน (2.45%) เป็นการเพิ่มขึ้นสัมพัทธ์ 22.5% อัตรารวมคือ 445 ÷ 20,000 = 2.225% ค่าความคลาดเคลื่อนมาตรฐานคือ 0.209 จุดเปอร์เซ็นต์ และ z = 0.45 ÷ 0.209 = 2.157 ค่า p สองด้านคือ 0.031 ต่ำกว่า 0.05 ดังนั้นที่ความเชื่อมั่น 95% B ชนะ ช่วง 95% สำหรับความแตกต่างอยู่ที่ +0.04 ถึง +0.86 จุดเปอร์เซ็นต์ B ดีกว่า แต่การเพิ่มขึ้นจริงอาจอยู่ที่ประมาณ 2% ถึง 43%

การทดสอบนี้เป็นการประมาณที่ต้องใช้ข้อมูลเพียงพอ คู่มือของ NIST ให้ เกณฑ์หนึ่ง: ความสำเร็จอย่างน้อย 5 ครั้งและความล้มเหลวอย่างน้อย 5 ครั้ง เครื่องคำนวณจะพักการตัดสินและแสดงว่า ยังมีข้อมูลไม่เพียงพอ จนกว่าแต่ละเวอร์ชันจะมีการแปลง 5 ครั้งและไม่แปลง 5 ครั้ง หากน้อยกว่านั้น NIST ชี้ไปที่ การทดสอบที่แม่นยำสำหรับตัวอย่างขนาดเล็ก แต่สำหรับการทดสอบโฆษณา คำตอบในทางปฏิบัติคือปล่อยให้มันทำงานต่อไป

คำนวณขนาดตัวอย่างอย่างไร

สำหรับการทดสอบสองด้าน ผู้เข้าชมต่อเวอร์ชัน:

n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²

ในที่นี้ p1 คืออัตราปัจจุบันของคุณ p2 คืออัตราดังกล่าวเมื่อใส่ค่าการเพิ่มเข้าไป และ p̄ คือค่าเฉลี่ยของทั้งสอง เป็นการประมาณแบบปกติโดยไม่มีการแก้ค่าความต่อเนื่อง และมีรูปแบบเดียวกับสูตรขนาดตัวอย่างสำหรับสัดส่วนเดี่ยวในคู่มือ NIST โดยเพิ่มกลุ่มที่สองเข้ามา ที่ระดับความเชื่อมั่น 95% ค่า z1−α/2 เท่ากับ 1.959964 และที่กำลัง 80% ค่า z1−β เท่ากับ 0.841621

ตัวอย่างการคำนวณ อัตราการแปลง 2% และคุณต้องการจับการเพิ่มขึ้น 20% ก็คือ 2.0% เทียบกับ 2.4% อัตราเฉลี่ยคือ 2.2% ส่วนบนคือ 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811 ยกกำลังสองได้ 0.3377 และหารด้วย 0.004² ได้ 21,109 ผู้เข้าชมต่อเวอร์ชัน รวม 42,218 ที่ 3,000 ผู้เข้าชมต่อวันก็คือ 15 วัน

ค่าการเพิ่มที่คุณขอนั้นสำคัญที่สุด บนอัตรา 2% เดียวกัน การเพิ่ม 30% ต้องใช้ 9,798 ต่อเวอร์ชัน และการเพิ่ม 10% ต้องใช้ 80,682 การลดค่าการเพิ่มลงครึ่งหนึ่งทำให้ทราฟฟิกเพิ่มราวสี่เท่า เพราะช่องว่างอยู่ในรูปยกกำลังสองที่ด้านล่างของสูตร

ทำไมการหยุดเร็วเกินไปจึงเพิ่มผลบวกลวง

ระดับความเชื่อมั่น 95% หมายความว่าเมื่อ A และ B แปลงได้เท่ากันจริง การทดสอบครั้งเดียวที่ขนาดตัวอย่างคงที่ก็ยังระบุผู้ชนะได้ราว 5% ของเวลา ตัวเลข 5% นั้นจะจริงก็ต่อเมื่อคุณดูผลเพียงครั้งเดียวตอนจบ

การตรวจผลทุกวันและหยุดทันทีที่มันขึ้นว่ามีนัยสำคัญเป็นวิธีที่ต่างออกไป อัตราจะแกว่งไปมาขณะที่ข้อมูลไหลเข้ามา และการดูแต่ละครั้งก็เป็นอีกโอกาสหนึ่งที่ช่องว่างจากความบังเอิญจะข้ามเส้น หากคุณหยุดตอนข้ามเส้นครั้งแรก คุณก็เลือกช่วงเวลาที่โชคดีที่สุด ดังนั้นอัตราผลบวกลวงจริงจึงลงเอยเกิน 5% และยิ่งดูบ่อยก็ยิ่งโต ค่า p-value บนหน้าจอไม่รู้ว่าคุณแอบดู มันจึงยังอ่านเหมือนกับว่าคุณดูเพียงครั้งเดียว

วิธีแก้นั้นน่าเบื่อแต่ได้ผล คือกำหนดขนาดตัวอย่างก่อนเริ่มทดสอบ ปล่อยให้ถึงขนาดนั้น แล้วอ่านผลครั้งเดียว การดูระหว่างทางเพื่อตรวจว่าไม่มีอะไรเสียนั้นทำได้ แต่การหยุดเพราะตัวเลขดูดีนั้นไม่ควร

Meta และ Google Ads ว่าอย่างไรเรื่องระยะเวลาทดสอบ

  • แนวทางปฏิบัติที่ดีที่สุดสำหรับการทดสอบ A/B ของ Meta แนะนำให้ทดสอบอย่างน้อย 7 วัน ระบุว่าการทดสอบสั้นกว่านั้นอาจให้ผลที่สรุปไม่ได้ และจำกัดการทดสอบ A/B ไว้ที่ 30 วัน หน้าเดียวกันแนะนำให้ทดสอบนานขึ้นหากลูกค้ามักใช้เวลาแปลงนานกว่า 7 วัน
  • Meta มักแนะนำให้ประมาณกำลังไว้ที่ 80% หรือสูงกว่า ซึ่งเป็นค่าเริ่มต้นที่ใช้ที่นี่ ผล A/B ของ Meta จะแสดงเป็นเปอร์เซ็นต์ความเชื่อมั่น และถือว่า 65% ขึ้นไปเป็นผลที่ชนะสำหรับการทดสอบ A/B ตัวเลขนั้นมาจากวิธีการของ Meta เองและไม่ใช่สิ่งเดียวกับระดับความเชื่อมั่นบนหน้านี้ ทั้งสองจึงจะไม่ตรงกัน
  • Meta ยัง ไม่แนะนำให้ทดสอบแบบไม่เป็นทางการ ด้วยการเปิดปิดชุดโฆษณา เพราะกลุ่มเป้าหมายอาจทับซ้อนกัน และแนะนำให้ใช้งบเท่ากันทั้งสองเวอร์ชัน
  • Google Ads แนะนำให้ปล่อยการทดลองทำงาน 2 ถึง 3 สัปดาห์ แสดงช่วงความเชื่อมั่น 80% เป็นค่าเริ่มต้นโดยมีระดับอื่นให้เลือกเมื่อร้องขอ และทำเครื่องหมายผลที่มีนัยสำคัญด้วยดอกจันสีน้ำเงิน วิธีการทางสถิติของมันใช้การสุ่มตัวอย่างซ้ำแบบ jackknife ข้าม 20 ถังต่อแขน ดังนั้นช่วงของมันจึงไม่ตรงกับ z-test เป๊ะเช่นกัน

สิ่งที่เครื่องคำนวณนี้ทำไม่ได้

  • มันเปรียบเทียบสองเวอร์ชัน เมื่อมีสามเวอร์ชันขึ้นไป การเปรียบเทียบเพิ่มแต่ละครั้งก็เป็นอีกโอกาสหนึ่งของผู้ชนะลวง และการทดสอบแบบง่ายที่นี่ไม่ได้ปรับแก้เรื่องนั้น
  • มันทดสอบอัตราการแปลง ไม่ใช่รายได้ต่อผู้เข้าชมหรือมูลค่าคำสั่งซื้อ ซึ่งต้องใช้การทดสอบที่ต่างออกไป
  • มันไม่ใช่การทดสอบแบบลำดับ มันสมมติว่าคุณอ่านผลครั้งเดียวที่ขนาดตัวอย่างที่คุณวางแผนไว้
  • มันบอกไม่ได้ว่าการแบ่งของคุณยุติธรรมหรือไม่ หากเวอร์ชันหนึ่งได้กลุ่มเป้าหมาย งบ หรือช่วงเวลาที่ต่างออกไป ไม่มีสูตรใดแก้ไขได้

หากคุณไม่อยากคำนวณตัวเลขด้วยมือ

Hermoso คือการตลาดแบบอัตโนมัติ ถามมันว่า ควรขยาย หยุด และทดสอบอะไรต่อไป แล้วมันจะอ่านทุกแพลตฟอร์มโฆษณาที่คุณเชื่อมต่อไว้ จัดแคมเปญที่มีข้อมูลน้อยเกินไปไว้ในกลุ่มของมันเองแทนที่จะตัดสิน และให้การทดสอบที่แนะนำแต่ละรายการพร้อมสมมติฐาน สิ่งเดียวที่ต้องเปลี่ยน ตัวชี้วัดที่ใช้ตัดสิน งบ และระยะเวลา นอกจากนี้ยังสร้างภาพและวิดีโอเวอร์ชันต่างๆ ที่ตรงกับแบรนด์เพื่อทดสอบ และสร้างแคมเปญบนบัญชีโฆษณาของคุณเองในสถานะหยุดชั่วคราว มันทำงานในเว็บแอป หรือภายใน Claude, ChatGPT และ Cursor ผ่าน เซิร์ฟเวอร์ MCP เมื่อการทดสอบมีผู้ชนะแล้ว เครื่องคำนวณ ROAS แบบฟรีจะบอกคุณว่ามันทำกำไรด้วยหรือไม่

เครื่องมือฟรี: · เครื่องคำนวณ ROAS · ตัวตรวจความยาวข้อความโฆษณา

คำถามที่พบบ่อย

ฉันจะรู้ได้อย่างไรว่า A/B test ของโฆษณามีนัยสำคัญทางสถิติ?

ใส่จำนวนผู้เข้าชมและคอนเวอร์ชันของทั้งสองเวอร์ชัน เครื่องคำนวณจะรันการทดสอบ two-proportion z-test และให้ค่า p-value แบบสองด้าน ที่ระดับความเชื่อมั่น 95% ค่า p-value ต่ำกว่า 0.05 หมายความว่าช่องว่างนั้นไม่น่าจะเกิดจากความบังเอิญ สำหรับ 200 จาก 10,000 เทียบกับ 245 จาก 10,000 ค่า p เท่ากับ 0.031 ดังนั้น B ชนะ

A/B test ต้องการผู้เข้าชมจำนวนเท่าใด?

ขึ้นอยู่กับอัตราคอนเวอร์ชันของคุณและการเพิ่มขึ้นที่น้อยที่สุดที่คุณต้องการตรวจจับ ที่อัตราคอนเวอร์ชัน 2% การหาการเพิ่มขึ้น 20% ที่ความเชื่อมั่น 95% และกำลังการทดสอบ 80% ต้องใช้ผู้เข้าชม 21,109 คนต่อเวอร์ชัน การเพิ่มขึ้น 10% ต้องใช้ 80,682 คน

ทำไมเครื่องคำนวณจึงบอกว่าข้อมูลยังไม่เพียงพอ?

z-test เป็นการประมาณค่าแบบกลุ่มตัวอย่างขนาดใหญ่ เครื่องคำนวณจะรอจนกว่าแต่ละเวอร์ชันมีคอนเวอร์ชันอย่างน้อย 5 ครั้งและไม่คอนเวอร์ชันอย่างน้อย 5 ครั้ง ซึ่งเป็นเกณฑ์หนึ่งที่ระบุใน NIST e-Handbook ก่อนจะให้ข้อสรุป

ฉันหยุดการทดสอบได้ทันทีที่ดูเหมือนมีนัยสำคัญได้ไหม?

ไม่ได้ หากคุณต้องการให้ระดับความเชื่อมั่นมีความหมายตามที่ระบุ การตรวจสอบซ้ำ ๆ และหยุดเมื่อเห็นค่าที่มีนัยสำคัญครั้งแรกเป็นการเปิดโอกาสให้ความบังเอิญผ่านเส้นมากขึ้น ทำให้อัตราผลบวกลวงจริงสูงกว่าที่คุณเลือกไว้ ให้กำหนดขนาดกลุ่มตัวอย่างก่อนและอ่านผลเพียงครั้งเดียว

A/B test ของ Meta ควรรันนานเท่าใด?

Meta แนะนำอย่างน้อย 7 วัน ระบุว่าการทดสอบที่สั้นกว่านั้นอาจไม่ได้ข้อสรุป และอนุญาตได้สูงสุด 30 วัน Google Ads แนะนำ 2 ถึง 3 สัปดาห์สำหรับการทดลอง ใช้แท็บขนาดกลุ่มตัวอย่างร่วมกับทราฟฟิกรายวันของคุณเพื่อดูว่าการทดสอบของคุณต้องใช้เวลานานเท่าใด

สิ่งที่ฉันพิมพ์ถูกส่งไปที่ไหนหรือไม่?

ไม่ การคำนวณทำงานในเบราว์เซอร์ของคุณ ไม่มีคำขอเครือข่ายที่นำสิ่งที่คุณพิมพ์ออกไป และไม่มีการจัดเก็บข้อมูลใด ๆ

Hermoso บอกคุณว่าควรขยาย หยุด และทดสอบอะไรต่อไปในบัญชีโฆษณาของคุณ เริ่มฟรี มีเครดิตฟรีที่หาได้มากกว่า 250 เครดิต ไม่ต้องใช้บัตร

เริ่มฟรี →   ดูราคา