Clew

BerandaAlatKalkulator A/B test

Kalkulator A/B test dengan signifikansi, ukuran sampel, dan durasi

Cek apakah selisih tingkat konversi signifikan, hitung berapa pengunjung dan hari yang dibutuhkan tes, lalu lihat hasilnya dengan statistik Bayesian. Grafik distribusi dengan interval kepercayaan dan persentil, seperti kalkulator klasik.

● Gratis, tanpa daftarDiperbarui:

A — kontrol

B — varian

Tingkat kepercayaan
Hipotesis
Uji dua sisi menangkap kenaikan maupun penurunan. Pilih satu sisi sejak awal, sebelum tes dimulai.

—

 

Konversi A— 
Konversi B— 
Selisih— 
Kenaikan relatif— 
p-value— 
Power— 
Distribusi tingkat konversi A dan Barea berwarna — interval kepercayaan
Distribusi tingkat konversi A dan B
A — kontrolB — varianputus-putus — batas interval, garis penuh — median
Persentil distribusi
persentil ke-2,5ke-50 (median)persentil ke-97,5
A———
B———
B − A———
Distribusi selisih B − A, poin persentaseinterval tidak memuat nol — signifikan
Distribusi selisih B − A, poin persentase

Jangan mengintip. Ambil keputusan sekali saja, saat ukuran sampel yang dihitung di awal sudah tercapai. Mengecek p-value setiap hari dan berhenti di hasil “signifikan” pertama melipatgandakan false positive.

Semua dihitung di browser Anda — data yang Anda masukkan tidak dikirim ke mana pun.

Cara memakai

  1. Pilih modeSebelum peluncuran, gunakan “Sampel & durasi” untuk mengetahui berapa pengunjung dan hari yang dibutuhkan. Setelah tes, gunakan “Cek hasil” atau “Bayesian”.
  2. Masukkan dataPengunjung dan konversi untuk kontrol (A) dan varian (B). Konversi adalah pengguna yang mencapai tujuan, bukan jumlah event.
  3. Baca kesimpulannyaKesimpulan di bagian atas menjelaskan hasil dengan kata-kata; di bawahnya ada p-value, interval, dan grafik distribusi. Arahkan kursor ke grafik untuk melihat nilai dan persentil.
  4. Bagikan tautanInput tersimpan di URL halaman. “Salin tautan” memberi alamat tempat rekan tim melihat perhitungan yang persis sama.

Cara kalkulator menguji signifikansi

“Cek hasil” memakai uji z dua proporsi klasik, uji yang sama dengan kebanyakan kalkulator A/B. Hipotesis nolnya: tingkat konversi A dan B sama, dan selisih yang teramati hanyalah noise dari sampling.

Pertama dihitung tingkat konversi pA = xA / nA dan pB = xB / nB. Untuk uji, standard error selisih memakai tingkat gabungan — di bawah hipotesis nol kedua grup memiliki satu tingkat konversi yang sama:

p̂ = (x_A + x_B) / (n_A + n_B) SE₀ = √( p̂ · (1 − p̂) · (1/n_A + 1/n_B) ) z = (p_B − p_A) / SE₀ p-value = 2 · (1 − Φ(|z|)) — uji dua sisi p-value = 1 − Φ(z) — satu sisi, H₁: p_B > p_A

Φ adalah fungsi distribusi kumulatif normal standar. Selisih dianggap signifikan jika p-value lebih kecil dari α = 1 − tingkat kepercayaan.

Interval kepercayaan

Interval dihitung tanpa penggabungan — setiap grup memakai variansnya sendiri (interval Wald):

SE_A = √( p_A (1 − p_A) / n_A ) CI_A = p_A ± z₁₋α/₂ · SE_A SE_Δ = √( SE_A² + SE_B² ) CI_Δ = (p_B − p_A) ± z₁₋α/₂ · SE_Δ

Interval untuk kenaikan relatif pB/pA − 1 memakai metode delta. Distribusi normal N(p, SE) inilah yang ditampilkan grafik: area berwarna adalah interval kepercayaan, garis putus-putus adalah batasnya (persentil ke-2,5 dan ke-97,5 pada 95%), dan garis penuh adalah median.

Power dan pengecekan sampel

“Power” di sini adalah observed (post-hoc) power: probabilitas tes berukuran ini mendeteksi selisih sebesar yang teramati. Angka ini petunjuk apakah data sudah cukup, bukan bukti untuk hipotesis — observed power adalah fungsi langsung dari p-value dan tidak menambah informasi baru.

Kalkulator juga mengecek SRM (sample ratio mismatch) dengan uji χ² untuk pembagian traffic yang rata. Jika pengunjung terbagi jelas tidak rata, kemungkinan besar randomisasinya rusak dan membandingkan konversi tidak ada artinya.

Ukuran sampel dan durasi tes

Jumlah pengunjung yang dibutuhkan bergantung pada empat angka: konversi dasar, efek minimum terdeteksi (MDE), tingkat signifikansi α, dan power 1 − β. Kalkulator memakai rumus aproksimasi normal untuk membandingkan dua proporsi — sama dengan kalkulator Evan Miller, sehingga hasilnya cocok:

δ = MDE (absolut; MDE relatif dikalikan p) n = ( z₁₋α/₂ · √(2p(1 − p)) + z₁₋β · √(p(1 − p) + (p + δ)(1 − p − δ)) )² / δ²

n adalah jumlah pengunjung di setiap varian. Durasi tes = n × jumlah varian ÷ pengunjung per hari.

Jika varian lebih dari dua, setiap perbandingan dengan kontrol adalah satu peluang lagi untuk keliru. Kalkulator menerapkan koreksi Bonferroni: α dibagi jumlah perbandingan. Koreksi ini konservatif, tetapi sederhana dan jujur; harganya adalah sampel yang lebih besar.

Patokan praktis:

  • Jalankan tes dalam minggu penuh — minimal 7 hari, idealnya 14: audiens hari kerja dan akhir pekan berbeda.
  • Memperkecil MDE menjadi setengahnya membutuhkan traffic kira-kira empat kali lipat. Jika tes akan memakan waktu enam bulan, uji perubahan yang lebih berani atau metrik yang lebih dekat ke aksi.
  • Untuk onboarding, metrik dengan nilai dasar tinggi — menyelesaikan langkah, aksi kunci pertama — lebih cocok daripada pembayaran: pengunjung yang dibutuhkan beberapa kali lebih sedikit.

Pendekatan Bayesian: probabilitas B lebih baik

Mode Bayesian menjawab pertanyaan yang biasanya diajukan orang: seberapa besar peluang B lebih baik dari A? Tingkat konversi setiap varian digambarkan dengan distribusi beta. Dengan prior Beta(α, β) dan x konversi dari n pengunjung, posteriornya adalah Beta(α + x, β + n − x) — model konjugat beta-binomial.

P(B > A) = ∫ f_B(x) · F_A(x) dx Risiko memilih B = E[ max(p_A − p_B, 0) ] Risiko tetap memakai A = E[ max(p_B − p_A, 0) ]

Probabilitas mengalahkan kontrol dihitung dengan integrasi numerik dan dicek dalam tes kami terhadap rumus eksak Evan Miller untuk parameter bilangan bulat serta simulasi Monte Carlo. Expected loss adalah rata-rata konversi yang hilang jika pilihan ternyata salah. Aturan berhenti yang praktis: akhiri tes saat risiko varian yang dipilih berada di bawah ambang yang tidak berarti bagi bisnis.

Inferensi Bayesian tidak membenarkan proses yang asal-asalan: mengintip dan berhenti “di 95% pertama” juga merusaknya. Prior seragam Beta(1, 1) hampir tidak memengaruhi hasil jika konversi sudah ratusan; prior informatif hanya masuk akal jika jujur mencerminkan tes sebelumnya.

Cara membaca hasil dan kesalahan yang perlu dihindari

Apa arti “signifikan secara statistik”

p-value 0,03 berarti: jika sebenarnya tidak ada selisih, jarak sebesar ini atau lebih akan muncul di sekitar 3% tes. Itu bukan probabilitas B lebih baik, dan bukan besar efeknya. Besar efek terlihat dari interval kepercayaan: “+0,2 sampai +1,4 poin” lebih jujur daripada “+16%, signifikan”.

Kesalahan yang sering terjadi

  • Mengintip. Mengecek signifikansi setiap hari dan berhenti di p < 0,05 pertama adalah cara pasti mendapatkan kemenangan palsu. Hitung ukuran sampel di awal dan putuskan sekali saja.
  • Berhenti saat “signifikan” sebelum genap seminggu. Efek kebaruan dan pola hari dalam seminggu mendistorsi hari-hari pertama tes.
  • Terlalu banyak metrik dan segmen. Cek dua puluh metrik dan satu akan tampak “signifikan” secara kebetulan. Pilih metrik utama sebelum peluncuran; anggap segmen sebagai ide untuk tes berikutnya.
  • Pembagian tidak rata (SRM). Jika ukuran grup berbeda lebih dari yang wajar karena kebetulan, cari bug di pembagian traffic, bukan pemenang.
  • Menghitung event sebagai konversi. Pengguna yang mengeklik lima kali tetap satu konversi. Uji ini mengasumsikan observasi yang independen.
  • “Tidak signifikan” = “tidak ada efek”. Hasil tidak signifikan pada sampel kecil hanya berarti datanya kurang. Lihat intervalnya: jika mencakup −5% sampai +10%, tes belum memutuskan apa pun.

Jika Anda menguji onboarding — tur dibanding tanpa tur, atau dua versi checklist — bandingkan aktivasi (aksi kunci pertama), bukan “menyelesaikan tur”. Cara meningkatkannya: cara meningkatkan aktivasi pengguna SaaS.

Sumber

  1. Fleiss J. L., Levin B., Paik M. C. Statistical Methods for Rates and Proportions. Edisi ke-3. Wiley, 2003 — uji z dua proporsi dan ukuran sampel.
  2. Miller E. Sample Size Calculator — evanmiller.org/ab-testing/sample-size.html; Miller E. Formulas for Bayesian A/B Testing — evanmiller.org/bayesian-ab-testing.html.
  3. Kohavi R., Tang D., Xu Y. Trustworthy Online Controlled Experiments. Cambridge University Press, 2020 — SRM, mengintip hasil, memilih metrik.
  4. Marsaglia G. Evaluating the Normal Distribution. Journal of Statistical Software, 11(4), 2004 — menghitung Φ(x).
  5. Press W. H. et al. Numerical Recipes. Edisi ke-3, §6.4 — fungsi beta tak lengkap.

Pertanyaan umum

Bagaimana cara mengecek signifikansi statistik A/B test?

Masukkan pengunjung dan konversi kedua grup di “Cek hasil”. Kalkulator menjalankan uji z dua proporsi dan menampilkan p-value: jika di bawah 1 − tingkat kepercayaan (misalnya 0,05 pada 95%), selisihnya signifikan secara statistik. Perhatikan juga interval kepercayaan selisih — itu menunjukkan seberapa besar efeknya.

Berapa lama A/B test sebaiknya berjalan?

Sampai ukuran sampel yang dihitung di awal tercapai, dan tidak kurang dari 7 hari penuh. Di “Sampel & durasi”, masukkan konversi dasar, efek minimum, dan traffic harian — kalkulator menampilkan pengunjung per varian dan durasi dalam hari.

Tingkat kepercayaan mana yang dipakai: 90, 95, atau 99%?

Standarnya 95%. 90% cocok untuk perubahan murah yang bisa dibatalkan, saat kemenangan palsu tidak mahal; 99% untuk keputusan berisiko seperti harga. Makin tinggi tingkat kepercayaan, makin besar sampel yang dibutuhkan.

Apa beda uji satu sisi dan dua sisi?

Uji dua sisi mengecek apakah B berbeda dari A ke arah mana pun; uji satu sisi hanya mengecek apakah B lebih baik. Uji satu sisi butuh data lebih sedikit, tetapi harus dipilih sebelum peluncuran dan tidak akan menandai penurunan. Jika ragu, pakai dua sisi.

Apa itu MDE?

Minimum detectable effect adalah selisih konversi terkecil yang bisa dideteksi tes dengan andal (pada power yang dipilih). Tetapkan sebelum tes: makin kecil MDE, makin banyak pengunjung yang dibutuhkan — kira-kira berbanding terbalik dengan kuadrat efeknya.

Apakah hasilnya sama dengan kalkulator Evan Miller?

Ya. Ukuran sampel memakai rumus yang sama; tes otomatis kami membandingkan hasilnya dengan kalkulator tersebut pada beberapa set parameter, dengan selisih paling banyak satu pengunjung karena presisi fungsi invers normal.

Apakah pendekatan Bayesian lebih baik dari frequentist?

Tidak lebih baik; ia menjawab pertanyaan yang berbeda. Uji frequentist menunjukkan seberapa mengejutkan data jika tidak ada selisih; Bayesian menunjukkan seberapa besar peluang B lebih baik dan berapa risiko kerugiannya. Yang kedua lebih mudah dijelaskan ke bisnis, tetapi keduanya butuh aturan berhenti dan disiplin.

Bisakah saya menguji lebih dari dua varian?

Bisa. Isi jumlah varian di “Sampel & durasi”: kalkulator menerapkan koreksi Bonferroni dan memperbesar sampel. Saat mengecek hasil, bandingkan setiap varian dengan kontrol secara terpisah, memakai α yang dibagi jumlah perbandingan.

Lainnya di A/B testing

Tur, tooltip, dan checklist yang dampaknya terlihat di angka.

Coba Clew gratisCara kerjanyaPaket gratis selamanya · tanpa kartu kredit

Product tour, popup, dan onboarding di era AI

7 pola lengkap dengan jumlah langkah, aturan teks, dan metrik, apa yang diubah AI, serta checklist sebelum terbit. PDF, 2 halaman. Isi panduan →

Panduannya dalam bahasa Inggris.