🧪 A/B 測試計算器

輸入對照組(A)與實驗組(B)的訪客數和轉換數,即時計算統計顯著性、p-value 和信賴區間,判斷實驗結果是否可靠。

什麼是 A/B 測試計算器?

A/B 測試計算器讓你輸入對照組(A)與實驗組(B)的訪客數與轉換數,即時計算統計顯著性、p-value 與信賴區間,判斷兩組的差異是否「真的有效」,而非只是隨機波動。它幫你在做產品或行銷決策前,先確認實驗結果是否可靠。

很多人看到 B 組轉換率較高就以為「贏了」,但若樣本不足,差異可能只是偶然。這個工具讓你用統計而非直覺下判斷。

適用情境

如何使用

  1. 輸入 A 組的訪客數與轉換數。
  2. 輸入 B 組的訪客數與轉換數。
  3. 工具計算兩組轉換率、p-value 與信賴區間。
  4. 依統計顯著性判斷差異是否可靠。

使用技巧

名詞解釋

統計顯著性
觀察到的差異不太可能只是隨機造成的程度。
p-value
若兩組其實無差異,觀察到此結果(或更極端)的機率。
信賴區間
真實轉換率差異可能落在的範圍。

常見問題 FAQ

什麼是 A/B 測試的統計顯著性?

統計顯著性(Statistical Significance)表示實驗組和對照組之間的差異不太可能是隨機誤差造成的。通常以 p-value 衡量:p < 0.05 代表在 95% 信賴水準下顯著,即只有 5% 的機率是偶然差異。

p-value 是什麼意思?

p-value 是「假設兩組沒有真正差異,出現目前或更極端結果的機率」。p-value 越小,代表這個差異越不可能是巧合。一般行銷和產品決策以 p < 0.05(95% 信賴)為標準,科學研究則要求更嚴格的 p < 0.01 或 p < 0.001。

需要多少樣本量才夠?

樣本量取決於期望的效果大小(Minimum Detectable Effect)、轉換率基準、信賴水準和統計效力。一般建議每組至少 1,000 名訪客,若轉換率較低(如 1-2%)則需要更多。可用 A/B 測試樣本量計算器事先規劃。

信賴區間代表什麼?

95% 信賴區間表示:如果重複實驗 100 次,有 95 次實驗組和對照組的轉換率真實差值會落在此區間內。若區間不包含 0,則在 95% 信賴水準下,兩組有顯著差異。

p-value 多少算顯著?

常見以 p-value < 0.05(即 95% 信心水準)作為顯著門檻,代表觀察到的差異不太可能純由隨機造成。但門檻可依情境調整。

轉換率較高就代表贏了嗎?

不一定。若樣本數不足,較高的轉換率可能只是隨機波動。需透過統計顯著性確認,才能判斷差異是否可靠。

資料會上傳嗎?

不會。所有計算都在你的瀏覽器本機完成,實驗數據不會上傳或儲存。

顯著就代表效果很大嗎?

不是。顯著只代表「差異不太可能是隨機」,不代表差異「很大」。仍要看實際的提升幅度與信賴區間,評估是否值得採用。