知識蒸餾(Knowledge Distillation)是 2026 年最被低估卻最實用的模型技術:它讓一個小模型去模仿大模型的「思考方式」,而不只是模仿最終答案。結果是成本下降 5 到 30 倍、推論速度提升約 4 倍,同時保留原始模型 95% 到 97% 的表現。DeepSeek-R1 用這套方法,把大模型的推理能力壓進只有幾 B 參數的 Qwen 學生模型,甚至讓蒸餾出來的小模型在 MATH-500 數學測驗拿到 94.5 分——比同尺寸、直接用強化學習硬訓的模型還高。這篇帶你搞懂它的機制、為什麼有效,以及怎麼實際用。

📖 學

什麼是蒸餾:從「硬標籤」到「暗知識」

傳統的監督式學習用的是「硬標籤(hard label)」:一張貓的照片,標籤就是 貓=1,其他=0。模型只知道「這是貓」,卻不知道「這隻貓有點像老虎、完全不像卡車」。

Geoffrey Hinton 在 2015 年提出蒸餾的核心洞見:大模型輸出的機率分布本身就藏著豐富資訊。當老師模型(teacher)看到那張貓照片,它輸出的可能是「貓 0.9、老虎 0.08、狗 0.015、卡車 0.00001」。這條分布告訴學生模型:類別之間存在相似結構——貓和老虎近、和卡車遠。Hinton 把這種藏在機率分布裡、硬標籤無法表達的資訊稱為「暗知識(dark knowledge)」,並類比宇宙學裡看不見卻真實存在的暗物質。

蒸餾的做法,就是讓學生模型不去對硬標籤,而是去對齊老師的軟目標(soft targets)——也就是那條完整的機率分布。學生因此一次學到的不是「答案」,而是老師對整個問題空間的「判斷結構」。

溫度參數:把分布「攤平」讓資訊浮現

問題來了:老師的分布往往極度尖銳,貓可能就是 0.999,其他類別小到接近 0,暗知識被壓扁了看不見。蒸餾用一個叫「溫度(temperature, T)」的參數解決這件事。

在 softmax 計算時,把每個 logit 先除以 T 再取指數。T=1 就是原本的分布;T 調高(例如 T=4 或 T=10),分布會被「攤平」,原本 0.08 的老虎、0.015 的狗會被放大到肉眼可辨的比例,暗知識就浮現出來。學生模型用同樣的高溫去學這條攤平的分布,訓練完成後推論時再把溫度調回 1。這個看似簡單的技巧,是蒸餾能傳遞細膩知識的關鍵機制。

2026 年的三段式蒸餾:off-policy、on-policy、self-distillation

2026 年的前沿模型後訓練(post-training)流程裡,蒸餾已經不是單一步驟,而是分成三個階段,對應實驗室真實的做法:

  • Off-policy(離線)蒸餾:先用老師模型大量生成資料,學生對著這批固定資料學。DeepSeek-R1 就是用老師模型生成約 80 萬筆樣本(其中 20 萬筆非推理、60 萬筆帶完整推理過程),再拿去微調 Qwen 與 Llama 等學生模型。這是最直接、最常見的做法。
  • On-policy(線上)蒸餾:學生自己先生成答案,老師針對學生「當下的輸出」給回饋。這能修正離線蒸餾裡「學生沒見過自己會犯的錯」的盲點。
  • Self-distillation(自蒸餾):模型當自己的老師,用自己較有把握的輸出來精煉自己。常用於最後的穩定化與收斂。

這三段不是互斥的,而是疊起來用,成為 2026 年前沿模型後訓練配方的標準環節之一。

為什麼蒸餾出來的小模型有時「比直接訓練還強」

這是蒸餾最反直覺、也最有價值的地方。DeepSeek 的實驗顯示:把大模型的推理能力蒸餾進小模型,效果明顯優於直接在小模型上跑強化學習(RL)。

原因在於:小模型自己的容量有限,靠 RL 從零探索出複雜的推理路徑非常困難,訊號稀疏、樣本效率低。但老師模型已經「探索過」整個推理空間,它示範的推理軌跡(reasoning traces)等於是把答案的「解題過程」直接攤開給學生看。學生不必自己撞牆,只要模仿老師走過的高品質路徑。這就像學生自己解一道難題可能卡住,但看老師完整演算一遍後就能學會同類題型。因此蒸餾同時省下運算成本、又拿到更好的成績。

蒸餾的爭議與界線:什麼時候不該用

蒸餾也有它的陰影面。2026 年最受矚目的爭議,就是有來源指控 DeepSeek 透過蒸餾「偷取」了 OpenAI o1 專有模型的知識——把別家 API 的輸出當成老師訊號來訓自己的模型。這牽涉到服務條款與智慧財產權的灰色地帶:多數商用模型的使用條款禁止用其輸出去訓練競品。

技術面也有限制:蒸餾出來的學生無法超越老師的知識邊界(老師不會的,學生也學不到),而且會繼承老師的偏見與錯誤——包含幻覺。當老師模型與目標任務差距太大、或老師本身品質不佳時,蒸餾反而會把缺陷放大。所以蒸餾適合「壓縮已知能力」,不適合「創造新能力」。

🧠 記

  • 蒸餾的核心是讓學生模型學老師的機率分布(軟目標),而非只學硬標籤,藉此傳遞類別間相似結構的「暗知識」。
  • 「暗知識」概念由 Hinton 於 2015 年提出,類比宇宙學的暗物質——看不見卻真實承載資訊。
  • 溫度參數 T 用來攤平過於尖銳的分布,讓暗知識浮現;訓練時調高、推論時調回 1。
  • 蒸餾帶來約 5–30 倍成本下降、4 倍推論加速,並保留 95–97% 的原始表現。
  • 2026 年蒸餾分 off-policy、on-policy、self-distillation 三段,是前沿模型後訓練的標準配方。
  • DeepSeek-R1 用約 80 萬筆老師生成樣本蒸餾出的小模型,MATH-500 達 94.5 分,勝過同尺寸直接跑 RL 的模型。
  • 蒸餾能高效「壓縮」既有能力,但無法超越老師,且會繼承老師的偏見與幻覺。
  • 用別家 API 輸出當老師訊號可能違反服務條款,是 2026 年的重大法律與倫理爭議。

✍️ 實踐

  1. 選定老師與學生:挑一個在你的目標任務上表現好的大模型當老師(可以是開源大模型或你已部署的高階模型),並選一個部署成本可接受的小模型當學生(例如 1B–8B 參數)。
  2. 用老師生成訓練資料:針對你的實際任務餵入大量真實或代表性 prompt,讓老師模型生成回應,並保留完整推理過程(不要只存最終答案),這是傳遞暗知識的關鍵。
  3. 設定溫度與損失函數:訓練時採用較高溫度(先從 T=2~4 試起)讓分布攤平,損失同時包含「對齊老師軟目標」與「對齊真實硬標籤」兩項,用一個權重係數平衡兩者。
  4. 微調學生模型:用蒸餾資料集對學生做監督式微調(SFT),先跑小規模驗證流程正確,再放大資料量。
  5. 評估與比較基準:用固定測試集同時評估「蒸餾學生」與「直接訓練的同尺寸模型」,比對準確率、推論延遲與單次推論成本,確認蒸餾確實帶來效益。
  6. 檢查繼承的缺陷:針對幻覺、偏見與老師的已知弱點做壓力測試,確認學生沒有把老師的錯誤放大到不可接受的程度,必要時加入 on-policy 或 self-distillation 階段修正。

🔗 延伸學習


💬 問 AI

我想把一個大模型的能力蒸餾(knowledge distillation)到一個小模型上,用來部署。

我的情境:
- 目標任務:{待填,例如:客服意圖分類 / 程式碼補全 / 數學推理}
- 老師模型:{待填,例如:某開源 70B 模型}
- 學生模型的部署限制:{待填,例如:單張 24GB 顯卡、延遲需 <200ms}
- 我手上的資料:{待填,例如:5 萬筆未標註 prompt}

請幫我:
1. 判斷這個任務適不適合用蒸餾,並說明理由(哪些能力可壓縮、哪些不能)。
2. 設計一個具體的蒸餾流程:資料生成、溫度與損失函數設定、學生微調步驟。
3. 列出我該用哪些指標評估蒸餾成效,以及該如何檢查學生是否繼承了老師的幻覺或偏見。