「跑了三天,A 版本贏了兩成,可以結束了嗎?」這是我們最常被問的問題,答案通常是不行。理由不是保守,而是在樣本不足的階段,兩成的差距很可能只是隨機波動,而依此做的決定會把資源投在錯誤的方向。
先建立直覺。丟一枚公正的硬幣十次,出現七次正面並不罕見;丟一千次,出現七百次正面幾乎不可能。測試也是一樣:樣本越小,隨機波動越容易看起來像真實差異。提早收手,本質上是在小樣本裡讀出不存在的訊號。
一個實用的直覺是:基準轉換率百分之三、想偵測相對提升兩成,每組大約需要數千次曝光。如果你的月流量只有幾千,這個測試需要跑好幾個月,而在那段時間裡市場與季節都會變化。
每一次查看結果並決定是否停止,都等於做了一次判斷。查看的次數越多,至少有一次出現隨機極端值的機率就越高。這就是為什麼「每天看、看到贏了就停」的做法幾乎必然會得到假陽性。
正確的做法是事前決定樣本數與結束條件,跑到條件滿足才看結論。如果一定要中途監看,應該只看資料收集是否正常,不看勝負。
最後一項在低頻生意裡經常是唯一可行的選擇。重點是承認這是推論而非證據,並設定觀察期與撤回條件。
第五項最常被忽略。測試期間剛好遇到一檔促銷或一次媒體曝光,整組資料就失去比較基礎。
代價有三層。第一層是把資源投在沒有效果的版本上。第二層是團隊建立了錯誤的因果認知,這個認知會影響後續好幾個決定。第三層最嚴重:一旦組織習慣用小樣本下結論,未來所有測試的可信度都會下降。
有兩種情況。第一是出現明顯的技術問題,例如某一版本有錯誤導致無法完成流程。第二是結果朝負面方向大幅偏離,繼續跑會造成實質損失。這兩種都是止損,不是下結論。
關於在資料不足時仍要做決定的方法,站內的 資料不足時的三種決策方法 有完整說明。
假設目前的表單完成率是百分之四,你希望偵測出相對百分之二十五的提升,也就是提高到百分之五。在常用的錯誤容忍設定下,每組大約需要三千多次的曝光,兩組合計超過六千。如果你的月造訪量是四千,這個測試需要跑一個半月以上。
如果改成偵測相對百分之五十的提升,也就是提高到百分之六,需要的樣本會降到每組約九百。這說明了一件事:在低流量的情況下,只有大幅度的改動才測得出來。這正是為什麼建議測試訊息架構而不是按鈕顏色。
四種都不是統計證據,但在低流量的現實下,它們的決策品質通常高於一個永遠跑不完的測試。
每一次測試留六項:假設、變數、預計樣本數、實際樣本數、結果、以及後續的決定。六項一頁,累積下來就是一份團隊的知識庫。
最有價值的是失敗的測試。沒有差異的結果同樣有資訊,它告訴你這個變數的影響低於你的偵測能力,未來不必再投入。多數團隊只記錄成功的測試,於是同樣的無效測試每兩年就會被重做一次。
比單次測試更重要的是團隊對不確定性的態度。健康的態度是:承認多數改動的效果無法被證明、接受「沒有差異」也是有效的結論、以及不用單次結果推翻既有的整體判斷。
不健康的態度通常表現為:每次測試都必須有贏家、輸的版本被視為失敗、以及提早收手成為常態。這種文化下累積的「知識」,多數是統計雜訊。
建立正確的態度,比學會計算樣本數更難,但影響也更大。實際做法是在每次測試的紀錄上明確寫出信心程度,讓不確定性變成可以討論的東西。
最後一個提醒:測試的目的不是證明自己對,是減少猜測的成分。抱著這個心態設計測試,你會更願意接受「沒有差異」的結果,而那正是最常見也最有價值的結論之一。
最後把樣本數這件事講回常識:算出來的數字是門檻不是目標,達到門檻只代表你有資格做判斷,不代表判斷一定正確。流量小的網站與其硬跑一個要三個月的測試,不如把改動幅度拉大,讓效果大到不必等那麼久;效果大到用眼睛都看得出來的改版,本來就不需要精密的統計。真正需要嚴謹樣本數的,是那些你打算長期沿用、而且效果只有幾個百分點的微調。