數據分析 進階 11 分鐘

A/B 測試結果怎麼判斷?別只看統計顯著

從資料可信度、效果大小、信賴區間、商業門檻與護欄指標判讀 A/B 測試,並用完整案例示範為什麼顯著不等於值得上線。

發布 2026/07/22 最後查核 2026/07/22
尚未開始
預計閱讀 11 分鐘

先說結論:顯著只是其中一關,不是「版本 B 可以上線」

當 A/B 測試顯示版本 B 勝出,不要只找一個小於門檻的 p 值。完整判斷至少要依序回答五件事:分組與資料是否可信、差異有多大、不確定範圍多寬、這個效果是否超過商業門檻,以及其他重要結果有沒有被犧牲

最終決策可以整理成三種,而不只有「贏」或「輸」:

  1. 上線:資料可信,主要效果的合理範圍足以支撐成本,護欄也沒有不可接受的退步。
  2. 不上線:資料可信,但效果太小、方向不利,或代價超過收益。
  3. 暫不定論:資料品質有問題、區間仍跨過重要門檻,或實驗設計沒有能力回答原問題。

p 值回答的是:假設兩版真的沒有差異,目前或更極端的資料有多不尋常。它不是「B 比 A 好的機率」,也不是「這次結果為假的機率」。因此,統計顯著可以協助排除隨機波動,卻不會替你定義商業價值、檢查追蹤錯誤或決定是否承擔上線成本。

兩個實驗版本依序經過資料可信度、不確定性、效果價值、風險護欄與上線決策五道檢查
實驗結果不是看到一個亮燈就衝向上線;每一道閘門回答不同問題,缺一項都可能把漂亮數字變成錯誤決策。

先分清楚四個常被混在一起的問題

問題合適證據可以回答什麼不能單獨回答什麼
有沒有差異?假設檢定與 p 值在無差異假設下,資料是否足夠不尋常B 一定更好或值得上線
差多少?絕對差、相對差觀察到的效果大小真實效果的精確值
有多不確定?信賴區間與資料、方法相容的效果範圍每個區間都有固定 95% 機率含真值
值不值得?商業門檻、護欄、成本這個效果是否足以改變決策未測量的長期結果一定不受影響

American Statistical Association 的聲明指出,科學或商業決策不應只依 p 值是否越過單一門檻;p 值也不衡量效果大小或結果重要性。這兩點在行銷實驗特別關鍵:流量很大時,微小差異也可能顯著;流量很小時,具有商業價值的差異則可能因區間太寬而尚未顯著。

效果大小要同時寫絕對差與相對差

假設 A 版購買率為 5.0%,B 版為 5.5%:

  • 絕對提升是 0.5 個百分點
  • 相對提升是 10%,因為 5.5% ÷ 5.0% − 1 = 10%。

只寫「提升 10%」很容易讓人誤以為增加 10 個百分點。兩種表示都要保留,並補上原始分母與期間,才能把效果換算成訂單、收入或成本。

信賴區間比單一勝負標記多告訴你一件事

美國國家標準暨技術研究院(NIST)在信賴區間說明中指出:若以相同程序反覆抽樣並建立區間,約有指定比例的區間會涵蓋真實參數。對已經算出的單一 95% 區間,更精確的讀法不是「真值有 95% 機率在裡面」,而是這個區間呈現目前資料與方法所能支持的效果範圍

若購買率差異估計為 +0.5 個百分點,95% 信賴區間為 +0.06 至 +0.94 個百分點,兩端都大於零,所以在對應的雙尾檢定下會達到 5% 顯著門檻;但若企業至少需要 +0.3 個百分點才值得付出維護成本,區間下限仍低於門檻,決策其實沒有「顯著」兩個字看起來那麼確定。

上線門檻要在看結果前定義

左側人物只因單一亮起的結果就急著上線,右側分析者同時衡量效果範圍、商業門檻與風險護欄
顯著性只處理隨機不確定性的一部分;成熟決策還要把效果範圍放到成本與護欄上比較。

最低值得偵測的效果,應來自「小於多少就不會改變決策」。它不是看完結果後,把門檻移到剛好能宣布勝出的地方。規劃時至少先寫:

  • 主要指標與計數單位,例如每位被分派使用者的購買率。
  • 最低值得偵測的絕對差,例如至少增加 0.3 個百分點。
  • 可接受的誤判風險與檢定方向。
  • 想要的檢定力,也就是確實存在指定效果時能偵測到它的能力。
  • 實驗要跑多久、涵蓋哪些完整商業週期。
  • 不能明顯變差的護欄,例如退款率、客訴、頁面速度或毛利。

NIST 的比例樣本數公式顯示,所需樣本量取決於基準比例、想偵測的差異、顯著水準與檢定力。差異越小,通常需要的樣本越大;所以「每版都收一千人」不是通用規則。

以基準購買率 5%、雙尾 5% 顯著水準與 80% 檢定力做常態近似教學試算:要偵測 +1.0 個百分點,每版約需 8,158 人;偵測 +0.5 個百分點,每版約需 31,234 人;偵測 +0.3 個百分點,每版則約需 85,199 人。實際平台可能使用不同統計方法、序列檢定、群集隨機或不等分流,不能直接把這組近似數字套用到所有工具。

完整案例:結果顯著,仍不代表立刻全面上線

以下是虛構教學案例,只示範判讀與驗算,不是 MKT Notes 或任何企業的實驗結果。

一家訂閱電商測試新版結帳摘要。實驗前已定義:主要指標是「被分派使用者在七天內完成購買的比例」;最低值得上線的效果是絕對增加 0.3 個百分點;每筆保留訂單的貢獻為 600 元;新版每月維護與授權成本為 150,000 元。退款率與頁面錯誤率是護欄。

版本被分派使用者購買購買率退款率頁面錯誤率
A 版20,0001,0005.0%4.0%0.3%
B 版20,0001,1005.5%4.1%0.4%

觀察到的絕對差是 5.5% − 5.0% = +0.5 個百分點,相對差是 +10%。以兩個比例的常態近似計算,z 值約 2.24,雙尾 p 值約 0.025;差異的 95% 信賴區間約為 +0.06 至 +0.94 個百分點。這個簡化手算用於教學,正式分析仍要使用和隨機單位、重複觀察與平台設計相符的方法。

觀察到的效果 +0.5 個百分點;95% 區間約 +0.06 至 +0.94

區間沒有跨過零,所以達到常見顯著門檻;但下限仍低於預先設定的 +0.3 個百分點商業門檻。

若每月有 200,000 位符合條件的使用者,點估計代表約多 1,000 筆訂單,貢獻約 600,000 元;扣除 150,000 元成本後,點估計看來有利。但依區間換算:

情境購買率絕對提升每月新增訂單新增貢獻扣除成本後
區間下限0.06 個百分點約 120 筆約 72,000 元約 −78,000 元
點估計0.50 個百分點約 1,000 筆約 600,000 元約 +450,000 元
區間上限0.94 個百分點約 1,880 筆約 1,128,000 元約 +978,000 元

四捨五入後,下限情境仍可能不敷成本。再加上此實驗每版只有 20,000 人,少於事前以 +0.5 個百分點、80% 檢定力估算的每版約 31,234 人;目前「剛好顯著」不應被改寫成穩定、精確的 +10% 承諾。

合適結論是:B 有正向證據,但真實商業價值仍不夠精確;先確認資料品質與護欄,再依預先規則跑完所需樣本或重複實驗,而不是立刻全面上線。 若業務願意承擔風險,也可採漸進式發布並持續監測,但這是風險選擇,不是統計顯著自動產生的答案。

先驗證資料可信,才有資格解讀 p 值

隨機分派的目的,是讓版本差異成為兩組之間最主要的系統性差異。下列問題若未排除,後面的精密計算可能只是在精確描述錯誤資料:

  1. A、B 的實際分配比例是否符合原定比例?若預計各半,卻出現無法由隨機波動合理解釋的失衡,應先調查分派、曝光或紀錄遺漏。Microsoft 的研究把這種樣本分配比例異常視為多種資料品質問題的警訊。
  2. 隨機單位與分析單位是否一致?若按使用者分派,卻把每一次工作階段當獨立樣本,可能低估不確定性。
  3. 兩版是否真的看見預期差異?若 B 的元件沒有正常載入,平手只證明實作失敗,不證明設計無效。
  4. 事件定義、時區、去重與觀察窗口是否一致?可先沿用GA4 事件與關鍵事件的規格流程建立可驗證口徑。
  5. 實驗期間是否有其他只影響一組的活動、故障或資料遺漏?若跨系統數字不一致,先看歸因窗口與報表差異的對帳方法

護欄也不能等主要指標勝出後才臨時挑選。新版可能提高購買率,卻增加退款、付款失敗、客服量或頁面延遲;上線決策要把這些代價和主要改善一起衡量。Microsoft 的實驗模式也區分主要結果、診斷、資料品質與護欄指標,以避免只最佳化單一結果。

八步判讀流程:從假設走到可監測的決策

團隊沿著預先定義、隨機分組、資料檢查、完整觀察、決策與上線監測六站循環,把結果回饋到下一次假設
可信實驗不是報表最後一頁,而是從事前設計開始、在上線後繼續驗證的學習循環。

1. 在啟動前寫下決策規則

定義核心問題、目標族群、隨機單位、主要指標、效果門檻、護欄、檢定方向、樣本量、最短期間與停止規則。不要看完結果才更換主要指標。

2. 確認實作與事件規格

測試兩版曝光、主要事件、去重、分母、時區與觀察窗口;必要時先做兩版完全相同的 A/A 測試,驗證分派和分析系統在沒有產品差異時不會經常製造假訊號。

3. 檢查分配與資料品質

先看樣本比例、曝光率、資料遺漏、異常機器流量與兩版實際功能覆蓋。資料品質失敗時,標記結果不可判讀,不要硬找贏家。

4. 跑完預定期間與樣本

需要安全監測時可以提早查看重大傷害,但不能沿用固定終點檢定、每小時刷新,看到顯著就停。Microsoft 提醒重複檢查會涉及多重檢定與提早查看問題;若要連續監測,應使用支援序列分析的方法與事先停止規則。

5. 先報原始數字,再報衍生統計

列出每版人數、事件數、比率、絕對差、相對差、信賴區間與 p 值。讀者應能從原始分子與分母重算核心結果。

6. 把區間放到商業門檻上

將區間下限、點估計與上限換算為訂單、毛利、成本或其他可決策單位。若整段區間都低於門檻,通常不上線;整段都高於門檻且護欄安全,證據較完整;跨越門檻則保留不確定結論。

7. 一起檢查護欄與預定分群

檢查事先定義的風險結果與重要客群。不要在數十個臨時切分中只挑一個顯著片段;探索性發現可以形成下一個假設,但不該假裝成原實驗已確認的結論。

8. 記錄決策,並監測外推是否成立

保存假設、版本、期間、結果、限制、決策者與回看日期。即使上線,實驗只直接支持受測期間與族群;全面發布後仍要看主要結果與護欄是否維持。Microsoft 的實驗後指南也建議在結果出乎預期或難以解釋時重新隨機並重跑,而不是勉強替驚人數字找故事。

六個常見誤判與限制

p 小於 0.05,就說 B 有 95% 機率比較好

錯。p 值是在無差異假設成立時衡量資料的不尋常程度,不是版本勝率。若需要直接表達某種勝率,必須使用相符的統計模型、先驗假設與報告方式,不能替傳統 p 值換標籤。

結果不顯著,就宣布兩版完全相同

「未能排除無差異」不等於證明完全相同。先看區間:它可能同時容許有價值的改善與有害退步,代表資料還不精確;要證明差異小到可忽略,需事先定義等效範圍並使用合適方法。

樣本越大,商業價值一定越大

樣本增加通常讓隨機不確定範圍變窄,不會把微小效果變成值得投資的效果。大型網站尤其要防止「極小但顯著」取代成本收益判斷。

看到正向趨勢就提早停,看到負向就繼續等

這會讓停止規則依結果方向改變,提高挑中幸運波動的機會。安全事件可以依預定規則提早終止;一般成效判讀則應遵守事前終點或使用正確的序列方法。

同時看很多指標,挑一個顯著當成功

測試的指標、版本與分群越多,至少一個偶然越過門檻的機會越高。主要指標與少量護欄應事先指定;大量探索結果要標記為探索性,並用新實驗確認。

實驗有效,就能保證長期與全體市場有效

實驗建立的是特定族群、版本、期間與執行情境下的因果證據。新奇效應、季節、渠道組成與全面上線後的系統互動都可能改變結果;因此仍需漸進發布、長期監測與必要時重複實驗。

最後帶走:用五句話報告,不再只貼勝負標籤

下次收到 A/B 測試報表,要求結論至少寫成五句:

  1. 資料可信度:分配、曝光、事件與觀察窗口是否通過檢查。
  2. 觀察效果:A 與 B 的原始數字、絕對差和相對差是多少。
  3. 不確定性:信賴區間多寬,p 值使用哪種檢定與停止規則。
  4. 商業價值:效果範圍相對事前門檻、成本與護欄代表什麼。
  5. 決策與限制:上線、不上線或暫不定論,接著要監測或補哪一項證據。

真正成熟的實驗結論,不是「B 顯著勝出」,而是:在資料可信與規則事先定義的前提下,我們估計 B 的效果落在哪個範圍;這個範圍是否足以改變商業決策;若仍不足,下一步要取得什麼證據。

SOURCE LOG

資料來源

  1. American Statistical Association:統計顯著與 p 值聲明
  2. NIST:信賴區間的定義與正確解讀
  3. NIST:假設檢定與信賴區間的關係
  4. NIST:比例檢定所需樣本數
  5. Microsoft Research:實驗前的可信度設計模式
  6. Microsoft Research:實驗進行中的監測與提早查看問題
  7. Microsoft Research:實驗後的可信度檢查與上線決策
  8. Microsoft Research:樣本分配比例異常的診斷研究
  9. Microsoft Research:線上實驗常見的指標解讀陷阱