昨天談 RLHF/DPO 把人類偏好灌進權重裡,讓模型「願意」按我們想要的方式回答;今天談另一條提升能力的路——不改權重,而是讓模型在推理時多花算力去「想」。這條路叫測試期運算(test-time compute),它的產物就是這一兩年爆紅的推理模型:OpenAI 的 o1/o3、DeepSeek-R1、Qwen QwQ 這些會「先想再答」的模型。核心觀察很單純:同一顆模型,如果允許它在回答前先寫下一長串思考、嘗試、檢查、回頭修正,答對難題的機率會顯著上升。訓練灌能力,是把知識壓進參數;推理期花算力,是把已有的能力擠出更多。兩者相加,才是今天前沿模型變強的完整故事。
📖 學
CoT 思維鏈:為什麼「先想再答」有效
思維鏈(Chain-of-Thought, CoT)是這一切的起點。2022 年 Wei 等人發現,只要在提示裡加一句「讓我們一步一步想」,或給幾個帶推理步驟的範例,大模型在數學、邏輯題上的正確率就大幅跳升。原因不神秘:Transformer 每產生一個 token 的運算量是固定的,一道需要三步推理的題目,若逼模型「一步吐答案」,等於要它在單次前向傳播裡塞進三步計算,超出容量就會出錯。讓它把中間步驟寫出來,等於把思考攤在 token 序列上——每寫一步就多一次前向傳播、多一份算力,還能讓後面的步驟「讀到」前面的中間結果。所以 CoT 的本質,是用更長的輸出換取更多的有效計算量。這也解釋了為何推理模型的回答又臭又長:那串思考不是給你看的,是模型算給自己用的。
推理模型如何用 RL「學會」思考
CoT 靠提示誘導,不穩定;推理模型則是把「會思考」直接訓練進去。OpenAI o1 在 2024 年 9 月證明了這條路:用強化學習(RL)訓練模型產生高品質的思考鏈,並揭示一條清楚的規律——訓練期投入的 RL 算力越多、推理期允許思考的時間越長,表現就越好,而且這條曲線和傳統的預訓練 scaling 是兩個獨立的維度。差別在於,傳統微調是教模型「模仿人寫的答案」,而 RL 訓練推理是讓模型自己去嘗試各種思路,答對就給獎勵,答錯就懲罰,久了它會自發演化出回頭檢查、換方法、拆解子問題等策略。這些行為沒人明講教它,是在獎勵訊號的壓力下「長」出來的。
GRPO 與 DeepSeek-R1 的 rule-based reward
DeepSeek 在 2025 年 1 月開源的 R1 論文,把這條路講得最透明。它用的 RL 演算法叫 GRPO(Group Relative Policy Optimization):傳統 PPO 需要一個和主模型一樣大的 critic 網路來估計基準值,成本高;GRPO 乾脆對同一題採樣一組答案,用這組的平均分數當基準,誰高於平均就強化——省掉了整個 critic,大幅降低訓練開銷。
更關鍵的是它的獎勵設計:rule-based reward,純規則、不用神經網路打分。只有兩種獎勵——準確性獎勵(數學題答案對不對、程式碼能不能通過測試,用程式硬驗)與格式獎勵(有沒有把思考包在指定標籤裡)。刻意不用學出來的獎勵模型,是為了避免 reward hacking——模型鑽獎勵模型的漏洞、學會討好評分器而非真的變強。最戲劇性的是 R1-Zero:完全跳過監督微調(SFT),直接對基礎模型上 RL,長思考鏈與自我驗證等能力竟自己浮現。他們的假設是:人類預設的推理範式反而會限制模型探索,放手讓 RL 跑,更能逼出新的推理能力。
測試期擴展:把「推理預算」當成旋鈕
有了會思考的模型,推理期就多出一個可調旋鈕:推理預算(inference-time / test-time compute)。同一顆模型,你可以讓它想 5 秒或想 5 分鐘,產出品質不同。擴展方式分兩類:序列式(sequential)是讓單一思考鏈更長、允許回頭修正;並行式(parallel)是同時採樣多條獨立思考鏈再挑一條。o3 之所以能在難題上輾壓,很大程度是被允許燒更多推理算力。這帶來一個實務上的新心態:面對難題,你不一定要換更大的模型,可以先讓現有模型「多想一會」。不過要注意,近期研究也質疑 o1 式模型是否真的擁有無限的測試期擴展能力——想更久並非總是線性變好,超過某個點會邊際遞減甚至變差。
PRM vs ORM:獎勵過程還是獎勵結果
並行採樣出多條思考鏈後,怎麼挑?最簡單的是自我一致性(self-consistency)/多數投票:採樣多條、取出現最多次的最終答案,靠「殊途同歸」過濾雜訊。更講究的是用獎勵模型打分,而這裡有兩派:
- ORM(結果獎勵模型):只看最終答案對不對,給整條鏈一個分數。簡單、標註便宜,但無法分辨「蒙對」——過程全錯、結論僥倖正確也會被獎勵。
- PRM(過程獎勵模型):對思考鏈的每一步打分,能定位錯在哪一步。搭配類似蒙地卡羅樹搜尋(MCTS)的方法,可以在生成途中就砍掉爛分支、優先展開好步驟。
經驗上,採樣預算小的時候,PRM 和單純的自我一致性差不多;但預算一大,PRM 的優勢就拉開。代價是 PRM 的訓練資料(每一步的對錯標註)貴得多,這也是目前的研究熱點。
限制與成本:不是免費的午餐
推理模型有真實代價。第一,慢又貴:那串思考動輒數千 token,延遲和 API 費用都翻倍,簡單任務用它是殺雞用牛刀。第二,rule-based reward 只在有標準答案、可自動驗證的領域(數學、程式、邏輯)最有效;開放性寫作、主觀判斷缺乏乾淨的獎勵訊號,提升有限。第三,長思考鏈可能「想歪」——過度思考、鑽牛角尖,反而不如直接回答。第四,思考鏈的可讀性未必等於真實推理過程,它寫出來的理由不保證就是它內部真正的計算依據。所以推理模型是工具箱裡的一把重錘,不是萬用起子。
🧠 記
- CoT 有效的本質是算力:把中間步驟寫成 token,等於多換好幾次前向傳播的有效計算量,不是「模型變聰明」而是「被允許多算」。
- 兩個獨立的擴展維度:訓練期灌 RL 算力、推理期給更多思考時間,是兩條各自成立的 scaling 曲線,和預訓練規模無關。
- GRPO 省掉 critic:用一組採樣答案的平均當基準,不需要和主模型一樣大的價值網路,是降低 RL 訓練成本的關鍵。
- rule-based reward 防作弊:純規則驗證(答案對錯、程式通過測試)避免 reward hacking,代價是只適用可自動驗證的領域。
- PRM 獎勵過程、ORM 獎勵結果:高預算下 PRM 較強但標註昂貴;沒有獎勵模型時,自我一致性/多數投票是最便宜的替代方案。
✍️ 實踐
- 分流你的任務:一般問答、摘要、閒聊、格式轉換用普通模型(快又省);數學推導、多步邏輯、程式除錯、規劃類任務才切到推理模型(o3、DeepSeek-R1 之流),讓它慢慢想值回票價。
- 在普通模型上手動 CoT:沒有推理模型時,在 prompt 明確要求「先列出解題步驟與檢查點,再給最終答案」,並可要求它「用兩種方法各算一次,若不一致就重新檢查」——這是自我一致性的手動版。
- 難題先加預算再換模型:遇到答錯的難題,先試著要求模型「花更多步驟、逐步驗證每一步」或多跑幾次取共識,再考慮升級到更大模型,通常更省成本。
🔗 延伸學習
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL — R1 原始論文,GRPO 與 rule-based reward 的第一手來源,R1-Zero 純 RL 讓推理能力自發浮現。
- Learning to Reason with LLMs (OpenAI o1) — OpenAI 官方 o1 發表,首次公開「訓練與推理雙軸 scaling」的規律。
- Chain-of-Thought Prompting Elicits Reasoning (Wei et al., 2022) — CoT 的奠基論文,證明加上推理步驟能大幅提升複雜任務表現。
- Self-Consistency Improves Chain of Thought Reasoning (Wang et al.) — 多數投票/自我一致性的原始提出,最便宜的測試期擴展法。
💬 問 AI
想真正體感「一般模型 vs 推理模型」的差異,拿同一道難題各問一次,對照它們的過程:
我要對比「一般回答」與「推理模式」的差別。請針對下面這道題,先用「直接一步給答案」的方式回答一次,再用「思維鏈:逐步推理並在最後自我驗證每一步」的方式回答一次,最後告訴我兩種方式的答案是否一致、你認為哪個更可信、以及多花的思考步驟具體幫你避開了什麼錯誤。
題目:一個水池有兩個進水管和一個出水管。單開甲管 4 小時注滿,單開乙管 6 小時注滿,單開排水管 12 小時排空。三管同時開,幾小時注滿?