Hai câu hỏi, một công cụ tính
Mỗi thử nghiệm quảng cáo đặt ra hai câu hỏi, theo thứ tự này. Trước khi bắt đầu: cần bao nhiêu lượt truy cập để phát hiện chênh lệch mà tôi quan tâm? Sau khi kết thúc: khoảng cách giữa A và B là thật, hay có thể chỉ do ngẫu nhiên? Dùng hai tab phía trên theo đúng thứ tự đó. Việc tính cỡ mẫu trước chính là điều làm cho câu trả lời cho câu hỏi thứ hai có ý nghĩa.
“Lượt truy cập” có thể là lượt truy cập trang đích, lượt nhấp vào liên kết hoặc bất kỳ ai khác có cơ hội chuyển đổi công bằng, miễn là cả hai phiên bản được đếm theo cùng một cách. “Chuyển đổi” là những người đã làm điều bạn đang thử nghiệm.
Bài kiểm định ý nghĩa hoạt động thế nào
Công cụ tính chạy một bài kiểm định z hai tỷ lệ, bài kiểm định mẫu lớn để so sánh hai tỷ lệ được mô tả trong NIST/SEMATECH e-Handbook of Statistical Methods:
- Tỷ lệ gộp p = (chuyển đổi A + chuyển đổi B) ÷ (lượt truy cập A + lượt truy cập B).
- z = (tỷ lệ B − tỷ lệ A) ÷ √(p × (1 − p) × (1/lượt truy cập A + 1/lượt truy cập B)).
- Giá trị p hai phía = 2 × (1 − Φ(|z|)), trong đó Φ là phân phối chuẩn tắc.
- Khoảng cho chênh lệch là (tỷ lệ B − tỷ lệ A) ± z × √(tỷ lệ A × (1 − tỷ lệ A) ÷ lượt truy cập A + tỷ lệ B × (1 − tỷ lệ B) ÷ lượt truy cập B). Khoảng mức tăng chia giá trị đó cho tỷ lệ A, coi tỷ lệ A là đã biết, nên đây là một phép xấp xỉ.
Ví dụ minh họa. Phiên bản A đạt 200 chuyển đổi từ 10.000 lượt truy cập (2,00%). Phiên bản B đạt 245 từ 10.000 (2,45%), mức tăng tương đối 22,5%. Tỷ lệ gộp là 445 ÷ 20.000 = 2,225%, sai số chuẩn là 0,209 điểm phần trăm, và z = 0,45 ÷ 0,209 = 2,157. Giá trị p hai phía là 0,031, nhỏ hơn 0,05, nên ở độ tin cậy 95% thì B thắng. Khoảng 95% cho chênh lệch chạy từ +0,04 đến +0,86 điểm phần trăm: B tốt hơn, nhưng mức tăng thực sự có thể nằm ở đâu đó từ khoảng 2% đến 43%.
Bài kiểm định là một phép xấp xỉ cần đủ dữ liệu. Sổ tay của NIST đưa ra một tiêu chí: ít nhất 5 lần thành công và 5 lần thất bại. Công cụ tính giữ lại kết luận và báo chưa đủ dữ liệu cho đến khi mỗi phiên bản có 5 chuyển đổi và 5 không chuyển đổi. Với số liệu ít hơn thế, NIST chỉ dẫn đến một bài kiểm định chính xác cho mẫu nhỏ, nhưng với một thử nghiệm quảng cáo thì câu trả lời thực tế là cứ tiếp tục chạy.
Cỡ mẫu được tính như thế nào
Với kiểm định hai phía, số lượt truy cập cho mỗi phiên bản:
n = (z1−α/2 × √(2 × p̄ × (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2)))² ÷ (p2 − p1)²
Ở đây p1 là tỷ lệ hiện tại của bạn, p2 là tỷ lệ đó sau khi áp mức tăng, và p̄ là trung bình của chúng. Đây là xấp xỉ chuẩn, không hiệu chỉnh tính liên tục, và có cùng dạng với công thức cỡ mẫu một tỷ lệ trong sổ tay NIST, có thêm một nhóm thứ hai. Ở độ tin cậy 95% thì z1−α/2 là 1.959964, và ở lực kiểm định 80% thì z1−β là 0.841621.
Ví dụ minh họa. Tỷ lệ chuyển đổi 2%, và bạn muốn phát hiện mức tăng 20%, tức 2.0% so với 2.4%. Tỷ lệ trung bình là 2.2%. Dòng trên là 1.959964 × 0.2074 + 0.841621 × 0.2074 = 0.5811, bình phương lên là 0.3377, chia cho 0.004² cho ra 21,109 khách truy cập mỗi phiên bản, tổng cộng 42,218. Với 3,000 khách mỗi ngày thì mất 15 ngày.
Mức tăng bạn yêu cầu là quan trọng nhất. Với cùng tỷ lệ 2%, mức tăng 30% cần 9,798 mỗi phiên bản còn mức tăng 10% cần 80,682. Giảm một nửa mức tăng thì lưu lượng cần tăng khoảng gấp bốn, vì khoảng cách nằm ở dạng bình phương dưới mẫu số của công thức.
Vì sao dừng sớm làm tăng dương tính giả
Độ tin cậy 95% nghĩa là khi A và B thực sự chuyển đổi như nhau, một lần kiểm định với cỡ mẫu cố định vẫn chọn ra kẻ thắng khoảng 5% số lần. Con số 5% đó chỉ đúng nếu bạn xem một lần duy nhất, ở cuối.
Kiểm tra kết quả mỗi ngày và dừng ngay lần đầu thấy có ý nghĩa là một quy trình khác. Các tỷ lệ dao động khi dữ liệu đổ về, và mỗi lần xem là thêm một cơ hội để khoảng cách ngẫu nhiên vượt qua ngưỡng. Dừng ở lần vượt đầu tiên nghĩa là bạn đã chọn đúng thời điểm may mắn nhất, nên tỷ lệ dương tính giả thực tế cao hơn 5%, và càng xem nhiều lần nó càng tăng. Giá trị p trên màn hình không biết bạn đã liếc nhìn, nên nó vẫn hiện như thể bạn chỉ xem một lần.
Cách khắc phục thì nhàm chán nhưng hiệu quả: quyết định cỡ mẫu trước khi bắt đầu kiểm định, để nó đạt tới cỡ đó, rồi đọc kết quả một lần. Nhìn vào giữa chừng để kiểm tra có gì hỏng không thì được. Dừng vì con số trông đẹp thì không.
Meta và Google Ads nói gì về thời lượng kiểm định
- Các phương pháp tốt nhất về A/B testing của Meta khuyến nghị kiểm định kéo dài ít nhất 7 ngày, cho rằng kiểm định ngắn hơn có thể ra kết quả không rõ ràng, và giới hạn A/B test ở 30 ngày. Cũng trang đó gợi ý chạy lâu hơn nếu khách hàng thường mất hơn 7 ngày để chuyển đổi.
- Meta thường gợi ý lực kiểm định ước tính từ 80% trở lên, cũng là lực mặc định ở đây. Kết quả A/B của Meta hiển thị tỷ lệ độ tin cậy, và coi 65% trở lên là kết quả thắng cho một A/B test. Con số đó đến từ phương pháp riêng của Meta và không giống mức độ tin cậy trên trang này, nên hai bên sẽ không khớp.
- Meta cũng khuyên không nên kiểm định thủ công bằng cách bật tắt các nhóm quảng cáo, vì đối tượng có thể trùng lặp, và khuyến nghị dùng cùng ngân sách cho cả hai phiên bản.
- Google Ads khuyến nghị để thử nghiệm chạy 2 đến 3 tuần, mặc định hiển thị khoảng tin cậy 80% với các mức khác theo yêu cầu, và đánh dấu kết quả có ý nghĩa bằng dấu sao màu xanh. Phương pháp thống kê của họ dùng tái chọn mẫu jackknife trên 20 nhóm mỗi nhánh, nên khoảng của họ cũng sẽ không khớp chính xác với kiểm định z.
Công cụ này không làm được gì
- Nó so sánh hai phiên bản. Với ba phiên bản trở lên, mỗi phép so sánh thêm là thêm một cơ hội có kẻ thắng giả, và kiểm định đơn giản ở đây không điều chỉnh cho điều đó.
- Nó kiểm định tỷ lệ chuyển đổi, không phải doanh thu trên mỗi khách hay giá trị đơn hàng, vốn cần một kiểm định khác.
- Nó không phải kiểm định tuần tự. Nó giả định bạn đọc kết quả một lần, ở đúng cỡ mẫu đã định.
- Nó không thể cho biết việc chia nhóm có công bằng hay không. Nếu một phiên bản nhận đối tượng, ngân sách hay thời điểm trong ngày khác nhau, không công thức nào khắc phục được.
Nếu bạn không muốn tự tính con số bằng tay
Hermoso là marketing tự động. Hỏi nó cần mở rộng, tạm dừng và kiểm định gì tiếp theo, nó sẽ đọc mọi nền tảng quảng cáo bạn đã kết nối, đưa các chiến dịch có quá ít dữ liệu vào nhóm riêng thay vì đánh giá, và trao cho mỗi kiểm định được gợi ý một giả thuyết, một thứ duy nhất cần thay đổi, chỉ số quyết định, một ngân sách và một thời lượng. Nó cũng tạo các biến thể ảnh và video đúng với thương hiệu để kiểm định, và dựng chiến dịch trên tài khoản quảng cáo của chính bạn, tạo ở trạng thái tạm dừng. Nó hoạt động trong web app, hoặc bên trong Claude, ChatGPT và Cursor qua máy chủ MCP của nó. Khi một kiểm định đã có kẻ thắng, công cụ tính ROAS miễn phí sẽ cho bạn biết nó có sinh lời hay không.
Công cụ miễn phí: · Công cụ tính ROAS · Trình kiểm tra độ dài nội dung quảng cáo
Câu hỏi thường gặp
Làm sao biết A/B test quảng cáo của tôi có ý nghĩa thống kê?
Nhập số khách truy cập và số chuyển đổi cho cả hai phiên bản. Công cụ chạy phép kiểm z hai tỷ lệ và đưa ra giá trị p hai phía. Ở mức tin cậy 95%, giá trị p dưới 0,05 nghĩa là khoảng cách khó có khả năng là do ngẫu nhiên. Với 200 trên 10.000 so với 245 trên 10.000, p là 0,031, nên B thắng.
Một A/B test cần bao nhiêu khách truy cập?
Điều đó phụ thuộc vào tỷ lệ chuyển đổi của bạn và mức tăng nhỏ nhất mà bạn muốn phát hiện. Ở tỷ lệ chuyển đổi 2%, để tìm được mức tăng 20% với độ tin cậy 95% và công suất 80% cần 21.109 khách truy cập cho mỗi phiên bản. Mức tăng 10% cần 80.682.
Vì sao công cụ báo chưa đủ dữ liệu?
Phép kiểm z là một xấp xỉ cho mẫu lớn. Công cụ chờ cho đến khi mỗi phiên bản có ít nhất 5 chuyển đổi và 5 không chuyển đổi, một tiêu chí được nêu trong NIST e-Handbook, trước khi đưa ra kết luận.
Tôi có thể dừng một test ngay khi nó trông có ý nghĩa thống kê không?
Không, nếu bạn muốn mức tin cậy đúng với ý nghĩa của nó. Kiểm tra nhiều lần và dừng ngay khi lần đầu tiên thấy có ý nghĩa sẽ cho sự ngẫu nhiên nhiều cơ hội vượt ngưỡng hơn, nên tỷ lệ dương tính giả thực tế cuối cùng cao hơn mức bạn đã chọn. Hãy đặt cỡ mẫu trước và chỉ đọc kết quả một lần.
Một A/B test trên Meta nên chạy bao lâu?
Meta khuyến nghị ít nhất 7 ngày, cho biết các test ngắn hơn có thể không có kết luận, và cho phép tối đa 30 ngày. Google Ads khuyến nghị 2 đến 3 tuần cho các thử nghiệm. Dùng tab cỡ mẫu với lưu lượng hằng ngày của bạn để xem test của riêng bạn cần bao lâu.
Có gì tôi gõ vào được gửi đi đâu không?
Không. Các phép tính chạy trong trình duyệt của bạn. Không có yêu cầu mạng nào mang đi những gì bạn nhập và không có gì được lưu trữ.
Hermoso cho bạn biết nên mở rộng, tạm dừng và test gì tiếp theo trên các tài khoản quảng cáo của bạn. Bắt đầu miễn phí, hơn 250 tín dụng miễn phí có thể kiếm được, không cần thẻ.
Bắt đầu miễn phí → Xem bảng giá