昨天我們用五位真人、放聲思考、觀察而不引導,回答了「使用者卡在哪、為什麼卡」;今天要處理的是另一半問題——當你已經有兩個看起來都合理的版本,到底「哪一個真的更好」,而且要用數字證明。可用性測試是少人、質性、找出「為什麼」;A/B 測試是大量、量化、驗證「哪個版本贏」。前者給你洞察與方向,後者給你證據與信心。這兩件事不是二選一,而是一條完整因果鏈的前後段:先靠質性看懂現象,再靠量化確認規模。
📖 學
A/B 測試是什麼、何時該用
A/B 測試是一種線上控制實驗:把真實流量隨機分成兩組(或多組),A 組看到原版(對照組 control),B 組看到新版(實驗組 treatment),在相同時間、相同條件下比較某個指標的差異,再用統計方法判斷這個差異是不是真的、而非隨機波動。它的核心不是「做兩個版本」,而是「隨機分流 + 統計推論」這套嚴謹的因果檢定機制——因為隨機,兩組除了你改的那個變數之外,其他條件(裝置、時段、新舊客)在期望值上都一樣,所以指標差異才能歸因到你的改動。
A/B 測試最適合用在「改動明確、流量夠大、有可量化目標」的情境:按鈕文案、版面排列、結帳流程、推薦演算法、Email 主旨。它不適合用在流量太小的產品(樣本永遠湊不齊)、影響要很久才顯現的改動(如品牌信任),或是你根本還不知道要改什麼的探索階段——那是可用性測試與使用者訪談的守備範圍。一句話:A/B 測試是「優化與驗證」的工具,不是「發現與探索」的工具。
先有假設與指標,才動手實驗
好的實驗從一個可否證的假設開始,而不是從「來試試看」開始。假設的標準句型是:「因為〔觀察/洞察〕,我們相信〔改動〕會讓〔某指標〕〔往某方向變化〕,幅度約〔多少〕。」例如:「因為可用性測試看到使用者找不到結帳按鈕,我們相信把按鈕放到固定底欄會讓結帳完成率提升約 5%。」注意這個假設剛好接住了昨天的質性洞察——質性告訴你「該改什麼、為什麼」,量化負責確認「改了有沒有用、有多少」。
指標要分層設計,避免只盯一個數字自我感覺良好。北極星指標(North Star) 是實驗真正想推動的核心成功指標,通常貼近商業價值,如結帳完成率、留存率。護欄指標(guardrail metrics) 則是「不能被犧牲」的底線,如頁面載入時間、退訂率、客訴量、錯誤率——很多改動會讓主指標上升卻偷偷傷害護欄指標(例如用誘導式設計 dark pattern 衝高點擊,卻拉高退款與客訴)。沒有護欄指標,你可能贏了戰役卻輸了戰爭。此外還要區分「驅動指標」與「代理指標」:短期能測到的代理指標(如點擊率)不見得等於你真正在乎的長期價值,別把手段當成目的。
隨機分流與對照組:實驗的地基
隨機分流是整個 A/B 測試可信度的地基,一旦分流不隨機,後面的統計全都作廢。正確做法是用穩定的雜湊(hash)把每個使用者 ID 對應到固定的組別,確保同一個人整個實驗期間都看到同一版(否則體驗錯亂、資料也髒),而且分組要與任何會影響指標的特徵無關。常見的分流錯誤包括:用「早上來的人進 A、下午進 B」(混入時段效應)、用「iOS 進 A、Android 進 B」(那不是 A/B 測試,是在比兩種裝置)、或改版部署有先後導致兩組時間窗不一致。
對照組的意義在於提供一個「如果什麼都不改會怎樣」的反事實基準。很多人忽略:市場、季節、行銷活動、競品都在同時變動,你光看新版上線後數字漲了不能證明是你的功勞——搞不好整體大盤都在漲。有了同時併行的對照組,兩組承受相同的外部干擾,相減之後才能把「你的改動」這個訊號從雜訊裡分離出來。這也是為什麼「先全量上線、再對比上線前後」是不可靠的:那是前後測,不是控制實驗。
統計顯著性、樣本數與 MDE 怎麼算
判斷差異真假,靠的是統計檢定而非肉眼。p 值是「假設兩版其實沒差(虛無假設為真),你卻觀察到目前這麼大或更大差異的機率」;p 值越小,代表這個差異越不像是隨機湊出來的。業界慣例把顯著水準設在 p < 0.05(即 95% 信心),意思是我們願意承擔 5% 的機率把「其實沒差」誤判成「有差」(型一錯誤,false positive)。要提醒的是:p < 0.05 不代表「新版有 95% 機率更好」,這是最常見的誤讀。信賴區間比單一 p 值更有用,它直接告訴你效果的可能範圍,例如「提升 +3%,95% 信賴區間為 +1% 到 +5%」——區間不跨過 0 才算顯著,而區間寬窄還順便告訴你估計有多精確。
樣本數不是拍腦袋,而是由四個量互相牽制決定的:顯著水準(通常 5%)、統計檢定力(power,通常設 80%)——也就是「當差異真的存在時,你有 80% 機率偵測得到」,避免型二錯誤(false negative,有效卻沒測出來);基準轉換率;以及 最小可偵測效果(MDE)——你「至少想偵測到多小的提升」。四者關係很直覺:你想偵測的效果越小(MDE 越小)、想要的信心與檢定力越高,需要的樣本就越大、實驗要跑越久。實務上務必在開跑前用樣本數計算機(如 Optimizely 的 sample size calculator)算出「每組需要多少人、大概要跑幾天」,並且把週期效應納入——至少跑滿整數個星期,避免只涵蓋工作日或只涵蓋週末造成偏差。
A/A 測試與護欄:先確認你的尺是準的
A/A 測試是把兩組都給一模一樣的版本,用來檢查你的實驗系統本身有沒有問題。理論上兩組指標應該沒有顯著差異;如果 A/A 竟然「測出」顯著差異,代表你的分流不隨機、指標計算有 bug、或流量分配失衡(這叫 sample ratio mismatch,SRM——例如你設定 50/50,實際跑出 52/48,往往是實作有洞)。先跑 A/A 校準,等於先確認你手上這把尺是準的,再拿去量真正的改動,否則後面所有結論都建立在流沙上。護欄指標的角色前面提過,這裡補一個實務關鍵:把護欄指標和 SRM 檢查做成實驗平台的「自動守門員」,任何實驗只要踩到底線就自動示警,不必等人肉巡田水。
常見陷阱與如何避免
偷看資料(peeking) 是最致命也最普遍的陷阱:實驗還沒跑到預定樣本,你每天盯著看,一看到「顯著」就想收手。問題在於,只要你反覆多次檢查,遲早會撞上一次隨機造成的假顯著——這會把實際的假陽性率從 5% 一路推高到 20~30%。解方是實驗前就定好樣本數與結束時間、跑完才看結論;若真的需要中途看,要改用序列檢定(sequential testing)這類專為「連續監看」設計的方法。多重比較是同一個道理的另一面:你同時測 20 個指標或 20 個變體,即使全都無效,純靠運氣也大概會有一個冒出 p < 0.05——測越多、假陽性越多,需要用 Bonferroni 或 FDR 校正來壓低。
辛普森悖論指的是整體看起來 B 贏,但拆到每個子群卻是 A 贏(或相反),通常肇因於各組在不同時間、不同族群的流量比例不均。Novelty effect(新奇效應) 則是新版一上線因為「看起來新鮮」而短暫衝高,幾週後回落到原水準——所以短期領先要留意是不是曇花一現,實驗要跑夠久看它穩不穩。還有一個策略性的坑是 局部最佳化陷阱:A/B 測試很擅長在現有設計附近做微調爬坡,把按鈕從藍調到綠、位置左移右移,但它幫不了你跳出當前這座小山、想像一個全新的框架——一直優化細節,可能永遠爬不上真正更高的那座山。
順帶破除三個常見迷思。迷思一「看到領先就能停」:前面說了,提早收手是把噪音當訊號,務必跑滿。迷思二「A/B 測試能取代設計判斷」:實驗只能從你端上桌的選項裡挑出較好的一個,它不會替你生出好點子,好的假設仍來自設計洞察、研究與品味——garbage in, garbage out。迷思三「小樣本也能下結論」:流量不夠時,再漂亮的百分比差異都可能只是隨機,樣本不足時最誠實的結論是「測不出來」,而不是硬拗一個方向。
A/B 測試與可用性測試如何互補
把兩者放在同一條產品決策的因果鏈上,分工就清楚了:可用性測試是「望遠鏡也是顯微鏡」,少數幾位使用者就能讓你看見「他們卡在哪、心裡在想什麼」,回答的是為什麼(why);A/B 測試是「磅秤」,用成千上萬真實流量告訴你「這個改動的效果有多大、是不是真的」,回答的是多少、哪個(how much / which)。質性找出問題與方向,量化確認規模與勝負——先質後量、循環往復,才是成熟的研究節奏。
實務上最漂亮的組合拳是:先用可用性測試發現「使用者找不到篩選器」,據此形成假設與新設計,再用 A/B 測試驗證新版是否真的提升轉換;若 A/B 測試出現「B 版數字更差卻不知為何」,再回頭用可用性測試觀察真人操作找原因。NN/g 甚至提醒:A/B 測試看似「更快出結果」,但它只告訴你 A 贏 B,不會告訴你「為什麼贏、要怎麼改得更好」,少了質性那一段,你會贏得莫名其妙、也輸得莫名其妙。兩者一質一量、一快一慢、一個給洞察一個給證據,缺一不可。
🧠 記
- A/B 測試的核心是「隨機分流 + 統計推論」,靠對照組提供反事實基準,把你的改動從市場雜訊裡分離出來。
- 先有可否證的假設,再設分層指標:北極星是主目標,護欄指標守住不能被犧牲的底線(載入速度、退訂、客訴)。
- 樣本數由顯著水準、檢定力(80%)、基準率、MDE 四者共同決定;想偵測的效果越小,需要的樣本越大、時間越久。
- p < 0.05 不等於「新版有 95% 機率更好」;信賴區間比單一 p 值更能說明效果範圍與精確度。
- 開跑前先做 A/A 測試校準系統、檢查 SRM,確認尺是準的再量;定好樣本數與結束時間,跑完才看,別偷看。
- 小心 peeking、多重比較、辛普森悖論、novelty effect 與局部最佳化陷阱;A/B 測不出好點子,好假設來自設計判斷。
✍️ 實踐
挑一個你手上真實、流量足夠的改動(例如某頁的主要 CTA),走完一次「假設 → 指標 → 樣本 → 結論」的完整流程,不要跳步:
- 寫假設:用「因為〔昨天可用性測試或數據看到的洞察〕,我們相信〔改動〕會讓〔北極星指標〕提升約〔X%〕」的句型寫一句,X 就是你的 MDE。
- 定指標:列 1 個北極星指標 + 2~3 個護欄指標(至少含一個速度或客訴類),寫清楚各自怎麼計算、資料從哪來。
- 算樣本:用線上樣本數計算機,輸入目前基準轉換率、MDE、95% 顯著、80% 檢定力,算出每組需要多少人、預估要跑幾天;若不足兩週就跑滿至少一到兩個完整週期。
- 設守門:規劃 A/A 或 SRM 檢查,並明訂「開跑前就鎖定結束條件,中途不偷看、不提早收」。
- 跑完覆盤:結束後看信賴區間而非只看 p 值,並自問「若數字反直覺,我要回頭用哪種質性方法找原因」。
把這五步寫成一頁實驗計畫(one-pager),之後每個實驗都套同一份模板,團隊的實驗品質會肉眼可見地穩定下來。
🔗 延伸學習
- A/B Testing 101 — Nielsen Norman Group:NN/g 對 A/B 測試的定義、指標與適用時機,質量互補視角的權威入門。
- Is A/B Testing Faster than Usability Testing at Getting Results?(影片)— NN/g:直接談「A/B 測『哪個贏』、可用性測『為什麼』」兩者分工,完美對應今天主題。
- Trustworthy A/B Tests: Pitfalls in Online Controlled Experiments(Kohavi, PDF):微軟實驗大師 Ron Kohavi 整理的實務陷阱清單,含 peeking、SRM 等經典坑。
- Sample size calculations for experiments — Optimizely:樣本數、MDE、檢定力如何互相牽制的實作說明與計算邏輯。
💬 問 AI
想更快內化,把你手上的真實實驗丟給 AI 當「實驗設計陪練」,請它挑毛病、幫你算樣本、預想陷阱。試試以下提示詞:
你是資深實驗平台(experimentation)顧問。我想為以下改動設計一次嚴謹的 A/B 測試:
- 產品/頁面:〔描述〕
- 我觀察到的問題或質性洞察:〔貼上可用性測試或數據發現〕
- 我打算做的改動:〔描述〕
- 目前基準轉換率:〔數字〕,每日流量約:〔數字〕
請依序協助我:
1. 用「因為…我們相信…會讓…提升約…」句型,把它改寫成一個可否證的假設。
2. 建議 1 個北極星指標與 2~3 個護欄指標,並說明各自為何重要。
3. 給定 95% 顯著、80% 檢定力與我提供的基準率,幫我推估在不同 MDE(如 2%/5%/10%)下,每組需要的樣本數與預估天數。
4. 針對我這個實驗,列出最可能踩到的 3 個陷阱(如 peeking、SRM、novelty effect、辛普森悖論),以及具體避免方法。
5. 最後提醒我:哪些問題「A/B 測不出來、要回頭用質性可用性測試」才能回答。