記憶系統讓單一代理跨越 session 還記得你是誰,但當任務大到一個代理扛不動,你需要的不是更強的記憶,而是把工作拆給好幾個代理分頭做、再收攏起來——這就是多代理協作(multi-agent orchestration)。昨天談的是「一個代理如何持久」,今天談「多個代理如何分工」。這是 2026 年真正從 demo 走進 production 的地基題,而它踩過的坑,幾乎每一個都跟成本與脈絡管理有關。

📖 學

主流架構是「協調者—工作者」(orchestrator-worker)模式,而不是一群代理平起平坐地七嘴八舌。 以 Anthropic 的 Research 系統為例,它由一個主導代理(lead agent)負責規劃、拆解任務,並行地開出 3 到 5 個各有專責的子代理去搜尋、過濾資訊,最後由主導代理綜合結果,再交給一個獨立的引用檢查流程確認出處。這種階層式分工的好處是責任清楚:誰負責計畫、誰負責執行、誰負責把關,各司其職。在 Anthropic 的內部評測裡,這套多代理設定比單一代理的 Claude Opus 4 高出約 90.2%,關鍵原因是複雜的研究型任務本質上可以平行化——多個子代理同時探索不同方向,等於用更多的算力換取更廣的搜索面。

但這套架構有個殘酷的代價:token 成本會爆炸。 Anthropic 自己在生產環境量到的數字很直白——一般的代理任務用的 token 大約是純聊天的 4 倍,而多代理研究系統用的 token 約是純聊天的 15 倍。原因不難理解:每個子代理都有自己的一輪輪對話、工具呼叫、脈絡載入,主導代理還要把它們的產出全部讀進來綜合。有分析指出,這意味著「3 個代理可能花掉 10 倍成本」不是誇飾。所以多代理不是免費的效能升級,它是一筆用金錢和延遲換品質的交易——只有當任務的價值夠高、且天生適合平行拆解時,這筆帳才划算。日常一句話能問完的事,硬套多代理只是把成本乘上十幾倍。

今年最重要的成本突破,是「異質模型混搭」——用便宜模型當工作者、貴模型當協調者。 Anthropic 公布的一個例子是:用 Fable 5 當協調者、指揮一群 Sonnet 5 當工作者,在 BrowseComp(一個困難網頁研究基準)上保留了全部用 Fable 團隊 96% 的分數,成本卻只有 46%。這組數字揭示了 2026 的關鍵設計原則:規劃與綜合這種需要強推理的環節,值得砸貴模型;而大量重複的搜尋、抓取、過濾這種「粗活」,交給便宜快速的模型就夠了。把模型的能力階梯對應到任務的難度階梯,是把多代理從「昂貴的玩具」變成「划算的生產工具」的分水嶺。

多代理最惡名昭彰的技術坑,是脈絡窗口溢位(context window overflow)。 問題出在協調者身上:它會不斷累積每一個工作者回傳的脈絡,當工作者達到 4 個以上,累積的脈絡經常就撐爆了視窗上限。有一份 2026 的生產分析算過一筆令人心驚的帳——一個在測試時只花 0.5 美元的工作流,若沒管好脈絡,放大到每月 10 萬次執行的規模,成本可能失控到每月 5 萬美元。這正是為什麼昨天談的記憶系統與今天的協調是一體兩面:工作者不能把原始資料一股腦倒回給協調者,必須先壓縮、摘要、只回傳結論;協調者也需要一套脈絡打包(context packing)機制,對檢索與記得的內容排序、壓縮、結構化,確保高價值資訊塞得進視窗、又不爆 token。

從 demo 到 production,真正活下來的是「少即是多」的紀律。 2026 年業界的共識是:多代理不是代理數量愈多愈好,而是要能明確界定每個代理的職責邊界、控制它們之間的通訊量、並在每一層都做脈絡瘦身。Gartner 觀察到多代理系統的詢問量從 2025 一路暴增到 2026,但真正在生產環境存活下來的系統,往往不是架構最花俏的,而是把「哪些任務值得拆、拆到幾個代理、每個代理回傳多少」這三件事管得最克制的。多代理的難點從來不是「讓代理們動起來」,而是「別讓它們互相淹沒在彼此的輸出裡」。

🧠 記

  • 主流是「協調者—工作者」階層架構:主導代理規劃拆解、並行開 3~5 個子代理執行、再綜合+獨立引用查核(Anthropic Research 內測比單一 Opus 4 高約 90.2%)。
  • 成本會爆炸:一般代理任務約純聊天的 4 倍 token,多代理研究系統約 15 倍——只有高價值、可平行的任務才划算。
  • 異質模型混搭是關鍵優化:貴模型當協調者、便宜模型當工作者(Fable 5+Sonnet 5 在 BrowseComp 保留 96% 分數、成本僅 46%)。
  • 最大技術坑是脈絡窗口溢位:協調者累積每個工作者的脈絡,4 個工作者以上常爆窗;失控的工作流成本可從 0.5 美元放大到每月 5 萬美元。
  • 生產紀律是「少即是多」:界定職責邊界、控制通訊量、工作者先壓縮摘要再回傳,別讓代理互相淹沒。

✍️ 實踐

今天挑一個你手邊「單一 prompt 一直做不好」的複雜任務——例如一份要跨多個來源比較的市場調查、或一份要分章節寫的報告——手動把它拆成「協調+工作者」兩層來跑一次。先自己扮演協調者列出子任務,把每個子任務分別丟給 AI(等於各開一個工作者),並在每個工作者的指令最後加一句「只回傳結論與關鍵佐證,不要貼原始長文」,最後再把這些精簡結論匯整成一輪讓 AI 綜合。跑完你會親身體會到:拆解與「限制每個工作者的回傳量」,才是多代理品質與成本的真正槓桿。

🔗 延伸學習

💬 問 AI

我有一個複雜任務:__(描述任務,例如「比較 5 個供應商的方案並產出決策建議」)。
請幫我用「協調者—工作者」多代理的思路來設計,不要直接給我答案:
1. 把這個任務拆成 3~5 個可以平行處理的子任務,說明每個子任務的職責邊界;
2. 針對每個子任務,寫一段給「工作者」的指令,並在結尾要求它只回傳結論與關鍵佐證、不貼原始長文;
3. 寫一段給「協調者」的綜合指令,說明如何把各工作者的結論整合成最終產出;
4. 指出這個任務裡哪些環節值得用強推理模型、哪些用便宜快速模型就夠,並提醒我可能的脈絡溢位風險點。