昨天把資訊架構的骨架搭好了——用卡片分類生出分類結構、再用樹狀測試驗證這套結構讓不讓人找得到。但那些方法驗的都還是「結構層」:使用者是否認同你的分類、按得到正確的路徑。真正把介面攤在真人面前、看他能不能完成一件完整任務,靠的是另一種方法:可用性測試(Usability Testing)。它不問「你覺得好不好用」,而是給使用者一個具體任務,安靜地看他怎麼做、卡在哪、什麼時候皺眉。設計師的直覺常常是錯的,可用性測試就是把「我以為很清楚」換成「我親眼看到他點錯」的過程。
📖 學
什麼是可用性測試,為何非做不可
可用性測試的定義很樸素:找真實使用者、給他真實任務、在旁邊觀察他如何操作你的產品或原型,藉此發現介面哪裡卡住人。重點在「觀察行為」而非「詢問意見」——人很會替設計找藉口(「應該是我不會用」),但他滑鼠停在哪、回頭找哪個按鈕、猶豫幾秒,這些行為騙不了人。
為什麼非做不可?因為設計團隊對自己的產品有「知識詛咒」:你知道那個漢堡選單裡藏了什麼、知道那個圖示代表什麼,於是永遠看不見新使用者的困惑。可用性測試是唯一能系統性打破這個詛咒的手段。而且它便宜得驚人——找五個人、花一兩個下午,就能攔下上線後才會爆發、要動用工程資源回頭補的災難。
形成性 vs 總結性:你是要修,還是要驗
可用性測試依「目的」分兩大類,這是最重要的分野:
- 形成性測試(Formative):在設計還能改的階段做,目的是「發現問題、指出要修什麼」。用低擬真原型、少量使用者、快速迭代。它回答的是「哪裡卡住、下一版要改什麼」。
- 總結性測試(Summative):在設計大致定案、或要比較新舊版本時做,目的是「驗收成效、給出可量化的分數」。樣本較多、講究統計,回答的是「我們做的東西到底行不行、達不達標」。
一句話記法:形成性告訴你「該修什麼」,總結性告訴你「蓋好的東西到底管不管用」。日常產品開發九成時間你需要的是形成性測試——小、快、常做。
中介式 vs 非中介式:有沒有主持人在場
依「有沒有真人主持」再分一軸:
- 中介式(Moderated):有一位主持人即時陪同,可以是面對面或視訊。好處是能追問「你剛剛為什麼停下來?」、能在使用者卡死時決定要不要提示,拿到的是有脈絡、有深度的質化資料。適合早期、低擬真、需要探索「為什麼」的階段。缺點是耗人力、排程慢、樣本有限。
- 非中介式(Unmoderated):使用者在自己的環境獨立完成任務,工具自動錄下操作。好處是快、便宜、可同時大量收集,而且沒有「主持人在旁邊」造成的觀察者效應,行為更自然。適合驗證明確假設、要大樣本、要快速結論的情境。缺點是無法即時追問,遇到意外狀況只能事後猜。
再疊上「遠端 vs 實驗室」一軸:遠端成本低、能觸及真實情境的使用者;實驗室環境可控、能上眼動儀等設備,但成本高、情境較不自然。實務上「遠端中介式視訊測試」是 CP 值很高的組合。
幾位使用者就夠:Nielsen 5 人法則與遞減曲線
最常被引用、也最常被誤解的一條:Jakob Nielsen 主張質化可用性測試只要 5 位使用者,就能發現約 85% 的可用性問題。背後是一條遞減曲線——第一位使用者就會暴露最多問題,之後每多一位,新發現的問題越來越少,第五位之後幾乎在重複看到同樣的毛病。與其一次找 15 人做一輪,不如用 5 人做一輪、修好、再用 5 人做下一輪,反覆迭代的總收穫遠大於一次大測。
但務必記住三個前提,否則會誤用:
- 只適用「質化、發現問題」的測試。若你要的是可量化的成功率、要做統計比較(總結性),樣本需求會跳到 40 人上下。
- 前提是使用者族群相對同質。若你的產品服務差異很大的多種族群(如新手 vs 專家、買家 vs 賣家),每一族群都要各自約 5 人。
- 它是發現問題的效率原則,不是「測 5 人就代表沒問題」的保證。
任務與情境設計:測試成敗的一半
可用性測試的品質,一半決定在任務怎麼寫。好任務的原則:
- 給情境、不給步驟。要說「你想訂一份週五晚上兩人的餐廳」,而不是「請點右上角的訂位按鈕、選人數、選日期」——後者等於把答案洩題給使用者,測了等於白測。
- 任務要真實、可完成、有明確終點。讓使用者知道「做到哪裡算完成」,例如「拿到訂位成功的確認畫面」。
- 用使用者的語言,不要用介面裡的字。任務描述若出現「篩選器」「我的最愛」這些介面上的標籤,等於直接指路。
- 一次一個任務、由易到難。先給簡單任務讓人進入狀況、建立信心,再進到核心與困難任務。
放聲思考法(Think-Aloud):看進使用者腦袋的窗
放聲思考是可用性測試最核心、CP 值最高的技巧:請使用者在操作的同時,把腦中的念頭一路唸出來——「我在找登入…應該在右上角吧…咦怎麼沒有…」。Nielsen 稱它是「通往靈魂的窗」,因為你不只看到他卡住,還聽到他卡住當下的想法與預期。
實作要點:開場先示範一次(例如請他放聲思考「怎麼調微波爐時間」)讓他抓到節奏;過程中若使用者安靜太久,只用中性的話提醒「請繼續把你在想的說出來」,絕不能問誘導性問題、也不能替他解釋介面。它的限制是「說話」本身會稍微改變自然操作節奏,但對挖掘「為什麼卡」的價值遠大於這點失真。
量化指標:成功率、時間、錯誤與 SUS
即使是小型測試,也值得順手記幾個量化數字,讓「感覺很難用」變成可追蹤的證據:
- 任務成功率:完成任務的人數比例,最直接的可用性指標。
- 完成時間:花多久做完,反映效率(尤其對重複性任務重要)。
- 錯誤數:走錯路、點錯、需要重來的次數。
- SUS(System Usability Scale):一份 10 題的標準問卷,換算成 0–100 的單一分數,業界常以約 68 分為「及格線」。它輕巧、通用,適合在總結性測試或版本比較時當統一標尺。
小提醒:小樣本的形成性測試,量化數字只當「參考風向」,別拿 5 個人的成功率去下統計結論。
常見陷阱:別把測試做成表演
- 引導受測者:測試中最致命的錯。給提示、幫忙點、用「你看這裡不是有個按鈕嗎」暗示答案,會讓你看到「被你救回來的成功」,而不是真實的失敗。
- 把任務寫成操作說明:任務裡藏了介面用詞或步驟,等於洩題。
- 問「你喜歡嗎」當結論:喜好是意見,可用性看的是行為;使用者常一邊卡到不行、一邊禮貌地說「還不錯」。
- 只找同溫層:找同事、找懂設計的朋友,他們的心智模型跟目標使用者差太遠。
- 測完不迭代:發現問題卻不修、不再測,測試就只是儀式。可用性測試的價值在「測 → 修 → 再測」的循環,而不是一次性的驗收活動。
🧠 記
- 可用性測試看的是「行為」不是「意見」:使用者說喜歡沒用,看他點錯、卡住、繞路才是真相。
- 形成性 vs 總結性:形成性告訴你「該修什麼」(小、快、常做),總結性告訴你「到底行不行」(大樣本、講統計)。
- 中介式陪同追問拿深度、非中介式獨立操作拿速度與大樣本,遠端視訊中介是最實用的組合。
- Nielsen 5 人法則:質化測試 5 人可抓出約 85% 問題,前提是同質族群、目的是發現問題;量化與統計比較需 40 人上下。
- 任務要給情境、不給步驟,用使用者的語言;洩題的任務等於沒測。
- 放聲思考是通往使用者腦袋的窗,而主持人最該守的紀律就是「不引導、不救援」。
✍️ 實踐
- 找一位朋友做 5 分鐘放聲思考測試:挑一個你常用的 App,寫一句情境式任務(例如「幫你自己約下週三下午的一次計程車」),請朋友邊操作邊把心裡的想法唸出來。你只負責閉嘴觀察與記錄他卡在哪、什麼時候猶豫,全程不給任何提示。做完你會很驚訝:那些你以為顯而易見的地方,別人根本看不到。
- 替你手上的產品寫三個測試任務並自我檢查洩題:各寫一個簡單、核心、困難任務,然後逐句刪掉所有出現在介面上的字(按鈕名、選單名、圖示描述),改成使用者會用的自然說法。這個「刪介面用詞」的動作,就是任務設計最實用的一半。
🔗 延伸學習
- Why You Only Need to Test with 5 Users — Nielsen Norman Group
- How Many Test Users in a Usability Study? — Nielsen Norman Group
- Thinking Aloud: The #1 Usability Tool — Nielsen Norman Group
- Usability Testing — Interaction Design Foundation
💬 問 AI
把 AI 當成你的可用性測試教練,請它幫你把一個模糊的測試念頭,變成一份可以立刻執行的腳本。試試這個提示:
你是資深 UX 研究員。我要對 [產品/App 名稱] 的 [某個核心流程,例如「首次註冊並完成第一筆訂單」] 做一場形成性、遠端中介式的放聲思考可用性測試,找 [5] 位 [目標使用者描述] 使用者。請幫我產出:
1. 3 個情境式任務(給情境、不給步驟,且不出現任何介面上的用詞),並標出哪個是核心任務;
2. 每個任務的「完成判準」(使用者做到哪裡算成功);
3. 一段主持人開場白與放聲思考的示範說法;
4. 一份觀察記錄表欄位(成功與否、完成時間、錯誤數、卡點與原話);
5. 5 個我在主持時「絕對不能說」的引導性語句範例,提醒我避開。
最後用一句話提醒我這場測試最容易犯的陷阱。