HomeMga toolA/B test calculator
A/B test calculator na may significance, sample size at tagal
Alamin kung significant ang pagkakaiba ng conversion rate, kung ilang visitor at araw ang kailangan ng test, at tingnan ang resulta gamit ang Bayesian statistics. Mga distribution chart na may confidence interval at percentile, tulad ng mga klasikong calculator.
—
| ika-2.5 percentile | ika-50 (median) | ika-97.5 percentile | |
|---|---|---|---|
| A | — | — | — |
| B | — | — | — |
| B − A | — | — | — |
Huwag mang-peek. Magpasya nang minsan, kapag naabot ang sample size na kinalkula nang maaga. Ang pagsuri sa p-value araw-araw at paghinto sa unang “significant” ay nagpaparami ng false positive.
—
Effect na matutukoy ng test gamit ang inyong traffic
Parehong formula ng calculator ni Evan Miller (two-sided test, normal approximation). Kung higit sa dalawa ang variant, hinahati ang significance level sa bilang ng paghahambing sa control (Bonferroni correction).
—
Kinakalkula ang lahat sa inyong browser — hindi ipinapadala kahit saan ang inyong inilagay.
Paano gamitin
- Pumili ng modeBago maglunsad, gamitin ang “Sample size at tagal” para alamin kung ilang visitor at araw ang kailangan. Pagkatapos ng test, gamitin ang “Suriin ang resulta” o “Bayesian”.
- Ilagay ang dataMga visitor at conversion para sa control (A) at variant (B). Ang conversion ay user na nakumpleto ang goal, hindi bilang ng event.
- Basahin ang verdictIpinapaliwanag ng verdict sa itaas ang resulta sa mga salita; sa ibaba ay ang p-value, mga interval at distribution chart. I-hover ang chart para makita ang value at percentile.
- Ibahagi ang linkNaka-save ang mga input sa URL ng page. Ang “Kopyahin ang link” ay nagbibigay ng URL kung saan nakikita ng teammate ang eksaktong parehong kalkulasyon.
Paano sinusuri ng calculator ang significance
Gumagamit ang “Suriin ang resulta” ng klasikong two-proportion z-test, ang parehong test ng karamihan ng A/B calculator. Ang null hypothesis: pantay ang conversion rate ng A at B, at ang naobserbahang pagkakaiba ay ingay ng sampling.
Unang kinakalkula ang rate pA = xA / nA at pB = xB / nB. Para sa test, ang standard error ng pagkakaiba ay gumagamit ng pooled rate — sa ilalim ng null hypothesis, parehong conversion rate ang dalawang grupo:
Ang Φ ay ang CDF ng standard normal distribution. Significant ang pagkakaiba kapag ang p-value ay mas mababa sa α = 1 − confidence level.
Mga confidence interval
Kinakalkula ang mga interval nang walang pooling — bawat grupo ay may sariling variance (Wald interval):
Gumagamit ng delta method ang interval para sa relative lift pB/pA − 1. Ang mga normal distribution na N(p, SE) ay ipinapakita sa mga chart: ang may kulay na area ay ang confidence interval, ang putol-putol na linya ay ang mga hangganan (ika-2.5 at ika-97.5 percentile sa 95%), at ang tuloy na linya ay ang median.
Power at pagsusuri ng sample
Ang “Power” ay observed (post-hoc) power: ang probability na matutukoy ng test na may parehong laki ang pagkakaibang katumbas ng naobserbahan. Ito ay pahiwatig kung sapat ang data, hindi ebidensya para sa hypothesis — ang observed power ay direktang function ng p-value at walang bagong impormasyon.
Sinusuri rin ng calculator ang SRM (sample ratio mismatch) gamit ang χ² test para sa pantay na hati ng traffic. Kung kapansin-pansing hindi pantay ang hati ng visitor, malamang na sira ang randomization at walang saysay ang paghahambing ng conversion.
Sample size at tagal ng test
Ang bilang ng kailangang visitor ay nakadepende sa apat na numero: baseline conversion, minimum detectable effect (MDE), significance level α at power 1 − β. Gumagamit ang calculator ng normal-approximation formula para sa paghahambing ng dalawang proportion — ang parehong formula ng calculator ni Evan Miller, kaya magkatugma ang resulta:
Ang n ay bilang ng visitor sa bawat variant. Tagal ng test = n × bilang ng variant ÷ visitor bawat araw.
Kung higit sa dalawa ang variant, bawat paghahambing sa control ay dagdag na tsansa na magkamali. Inilalapat ng calculator ang Bonferroni correction: hinahati ang α sa bilang ng paghahambing. Konserbatibo ito, ngunit simple at tapat; ang kapalit ay mas malaking sample.
Mga praktikal na tuntunin:
- Patakbuhin ang test sa buong linggo — hindi bababa sa 7 araw, mainam 14: magkaiba ang audience sa weekday at weekend.
- Ang pagbawas ng MDE sa kalahati ay nangangailangan ng humigit-kumulang apat na beses na traffic. Kung anim na buwan ang test, subukan ang mas matapang na pagbabago o metric na mas malapit sa aksyon.
- Para sa onboarding, mas mainam ang mga metric na may mataas na baseline — pagkumpleto ng step, unang key action — kaysa pagbabayad: mas kaunting visitor ang kailangan, ilang beses na mas kaunti.
Bayesian na paraan: ang probability na mas mahusay ang B
Sinasagot ng Bayesian mode ang tanong na karaniwang itinatanong: gaano posible na mas mahusay ang B kaysa A? Inilalarawan ang conversion rate ng bawat variant gamit ang beta distribution. Na may prior na Beta(α, β) at x conversion mula n visitor, ang posterior ay Beta(α + x, β + n − x) — ang conjugate beta-binomial model.
Kinakalkula ang probability to beat control sa pamamagitan ng numerical integration at sinusuri sa aming mga test laban sa exact formula ni Evan Miller para sa integer parameter at Monte Carlo simulation. Ang expected loss ay ang average na conversion na mawawala kung maling pagpili. Isang praktikal na stopping rule: ihinto ang test kapag ang risk ng napiling variant ay nasa ilalim ng threshold na hindi mahalaga sa business.
Hindi dahilan ang Bayesian inference para sa pabayang proseso: ang pag-peek at paghinto “sa unang 95%” ay nakakasira rin dito. Halos walang epekto ang uniform prior na Beta(1, 1) kapag may daan-daang conversion; ang informative prior ay makatwiran lamang kung tapat na sumasalamin sa mga nakaraang test.
Paano basahin ang resulta at mga pagkakamaling dapat iwasan
Ano ang kahulugan ng “statistically significant”
Ang p-value na 0.03 ay nangangahulugan: kung tunay na walang pagkakaiba, ang pagitang ganito o mas malaki ay lilitaw sa humigit-kumulang 3% ng mga test. Ito ay hindi probability na mas mahusay ang B, at hindi laki ng effect. Ang laki ay nasa confidence interval: ang “+0.2 hanggang +1.4 pp” ay mas tapat kaysa “+16%, significant”.
Mga karaniwang pagkakamali
- Pag-peek. Ang pagsuri ng significance araw-araw at paghinto sa unang p < 0.05 ay tiyak na daan tungo sa pekeng tagumpay. Kalkulahin nang maaga ang sample size at magpasya nang minsan.
- Paghinto sa “significant” bago buong linggo. Ang novelty effect at pattern ng araw sa linggo ay nagbabaluktot sa mga unang araw ng test.
- Labis na metric at segment. Suriin ang dalawampung metric at makakita ng isang “significant” nang nagkataon. Piliin ang primary metric bago maglunsad; ituring ang mga segment bilang ideya para sa susunod na test.
- Hindi pantay na hati (SRM). Kung ang laki ng grupo ay nagkakaiba nang higit sa pinapayagan ng pagkakataon, maghanap ng bug sa paghati ng traffic, hindi ng nanalo.
- Pagbilang ng event bilang conversion. Ang user na nag-click limang beses ay isang conversion. Ipinagpapalagay ng test na independent ang mga obserbasyon.
- “Hindi significant” = “walang effect”. Ang resultang hindi significant sa maliit na sample ay nangangahulugan lamang na hindi sapat ang data. Tingnan ang interval: kung sumasaklaw mula −5% hanggang +10%, walang ipinasya ang test.
Kung sinusubok ang onboarding — tour laban sa walang tour, o dalawang bersyon ng checklist — ihambing ang activation (ang unang key action), hindi “nakumpleto ang tour”. Paano itaas ito: paano pataasin ang user activation sa SaaS.
Mga source
- Fleiss J. L., Levin B., Paik M. C. Statistical Methods for Rates and Proportions. 3rd ed. Wiley, 2003 — two-proportion z-test at sample size.
- Miller E. Sample Size Calculator — evanmiller.org/ab-testing/sample-size.html; Miller E. Formulas for Bayesian A/B Testing — evanmiller.org/bayesian-ab-testing.html.
- Kohavi R., Tang D., Xu Y. Trustworthy Online Controlled Experiments. Cambridge University Press, 2020 — SRM, peeking, pagpili ng metric.
- Marsaglia G. Evaluating the Normal Distribution. Journal of Statistical Software, 11(4), 2004 — pagkalkula ng Φ(x).
- Press W. H. et al. Numerical Recipes. 3rd ed., §6.4 — incomplete beta function.
Mga madalas na tanong
Paano suriin ang statistical significance ng A/B test?
Ilagay ang mga visitor at conversion ng parehong grupo sa “Suriin ang resulta”. Nagpapatakbo ang calculator ng two-proportion z-test at ibinabalik ang p-value: kung mas mababa sa 1 − confidence level (halimbawa 0.05 sa 95%), statistically significant ang pagkakaiba. Tingnan din ang confidence interval ng pagkakaiba — ipinapakita nito ang laki ng effect.
Gaano matagal dapat tumakbo ang A/B test?
Hanggang maabot ang sample size na kinalkula nang maaga, at hindi bababa sa 7 buong araw. Sa “Sample size at tagal”, ilagay ang baseline conversion, minimum effect at traffic bawat araw — ibinabalik ng calculator ang visitor bawat variant at tagal sa araw.
Anong confidence level ang gagamitin: 90, 95 o 99%?
Ang standard ay 95%. Ang 90% ay angkop para sa murang pagbabagong maibabalik, kung saan maliit ang kapalit ng pekeng tagumpay; ang 99% para sa riskong pasya tulad ng presyo. Kung mas mataas ang confidence level, mas malaking sample ang kailangan.
Ano ang pagkakaiba ng one-sided at two-sided test?
Sinusuri ng two-sided test kung naiiba ang B sa A sa alinmang direksyon; sinusuri ng one-sided lamang kung mas mahusay ang B. Mas kaunting data ang kailangan ng one-sided, ngunit dapat piliin bago maglunsad at hindi nito nahuhuli ang pagbaba. Kung hindi tiyak, gamitin ang two-sided.
Ano ang MDE?
Ang minimum detectable effect ay ang pinakamaliit na pagkakaiba ng conversion na mapagkakatiwalaang matutukoy ng test (sa napiling power). Itakda bago ang test: kung mas maliit ang MDE, mas maraming visitor ang kailangan — humigit-kumulang inversely proportional sa square ng effect.
Tumutugma ba ang resulta sa calculator ni Evan Miller?
Oo. Gumagamit ang sample size ng parehong formula; inihahambing ng aming mga automated test ang resulta sa kanyang calculator sa ilang set ng parameter, na may pagkakaiba na hindi hihigit sa isang visitor dahil sa precision ng inverse normal function.
Mas mahusay ba ang Bayesian kaysa frequentist?
Hindi mas mahusay; ibang tanong ang sinasagot nito. Sinasabi ng frequentist test kung gaano nakakagulat ang data kung walang pagkakaiba; sinasabi ng Bayesian kung gaano posible na mas mahusay ang B at gaano ang panganib na mawalan. Mas madaling ipaliwanag ang ikalawa sa business, ngunit parehong nangangailangan ng stopping rule at disiplina.
Maaari bang subukan ang higit sa dalawang variant?
Oo. Itakda ang bilang ng variant sa “Sample size at tagal”: inilalapat ng calculator ang Bonferroni correction at pinapalaki ang sample. Kapag sinusuri ang resulta, ihambing nang hiwalay ang bawat variant sa control, gamit ang α na hinati sa bilang ng paghahambing.
Higit pa sa A/B testing
- RICE at ICE prioritization calculator
Aling item sa backlog ang mauuna ayon sa RICE o ICE score?
- Calculator ng activation at revenue
Gaano karaming revenue ang hatid ng pagtaas ng activation rate?
- Funnel conversion calculator
Sa aling step ng funnel nawawala ang mga user, at aling step ang unang dapat ayusin?
- Survey sample size calculator
Ilang sagot ang kailangan ng survey para sa isang margin of error?