這個領域的內容有一個系統性的失真來源:多數比較文章由記憶框架的廠商自己撰寫。benchmark 分數由被評測方發布、比較表由競爭者製作、「最佳實踐」由賣工具的人定義。這一篇把本專欄的每一類陳述按證據強度分開,明確標出哪些是官方文件事實、哪些是廠商自我宣稱、哪些是我的設計主張。
A 級:官方文件與論文可查證的事實
架構與機制(來自各專案官方文件、部落格或論文):
- Letta:三層記憶(main context / recall storage / archival storage);memory block 有 label、value、size limit、可選 description,各自以
block_id持久化,可設為 editable 或 read-only;main context 由 DB 狀態經 Jinja 模板「編譯」而成;多個 agent 可共享同一 block;sleep-time compute(官方也稱 dreaming)由背景 agent 審視近期內容並寫回 block,產物稱 learned context。 - Mem0:兩階段(extraction / update);update 階段以向量相似度取回鄰域後由 LLM 決定 ADD/UPDATE/DELETE/NOOP;圖變體 Mem0g 在抽取階段產生實體與關係三元組。論文為 arXiv:2504.19413(ECAI 2025)。
- Zep / Graphiti:四個時間戳
created_at/expired_at(系統軸)與valid_at/invalid_at(事實軸);created_at必然存在,後兩者由 LLM 在處理 episode 時抽取;衝突時把舊邊的失效時間設為新邊的生效時間而非刪除;混合檢索(語意 + 關鍵字 + 圖遍歷);episode-level provenance。架構論文為 arXiv:2501.13956。 - Cognee:ECL(Extract, Cognify, Load)管線;cognify 為六階段(文件分類 → 權限檢查 → 切塊 → LLM 抽取實體與關係 → 生成摘要 → embedding 並 commit 邊);支援 ontology 約束抽取;session memory 與長期層分離。
- LangGraph / LangMem:checkpointer 以
thread_id為範圍持久化 in-thread 狀態;LangMem 提供 semantic / episodic / procedural 三型,以user_id為 namespace 的 Store(生產常用 PostgresStore);支援 hot path 與 background 兩種寫入機制;procedural memory 定義為「agent 自己的系統指令」。 - Anthropic context engineering:目標定義為「能最大化目標結果機率的、最小的高訊號 token 集合」;四技術為 compaction、structured note-taking、sub-agent architectures、just-in-time retrieval(官方稱 progressive disclosure);三個 context 管理 API 原語為 compaction、tool-result clearing、memory tool;官方明確指出 context rot 存在於所有模型,且執行時探索是用速度換自主性、混合策略往往最有效;sub-agent 回傳的濃縮摘要典型為 1,000–2,000 token;compaction 的調校順序為先最大化召回再改善精確率。
- OpenClaw:自架 agent runtime 與訊息路由器;26 個內建工具;記憶兩層——
MEMORY.md(每個 session 開始時載入)與每日日誌memory/YYYY-MM-DD.md(append-only);預設工作目錄~/.openclaw/workspace;SQLite 索引含files、chunks、embedding_cache(SHA-256 去重)、chunks_fts(FTS5);記憶插件由openclaw.json的plugins.slots.memory指定;八個記憶工具含memory_search、memory_add(可選 session 或長期範圍)、memory_list、memory_get。 - Hermes Agent(Nous Research):
MEMORY.md存跨 session 學到的事實、USER.md存對使用者的演化理解,皆為純 Markdown 可讀可編輯;periodic nudge 為系統層級的內部 prompt,要求 agent 評估近期活動並判斷是否值得寫入;完成複雜任務後自主建立參數化的可重用 Skill。
版本與時間點(撰稿時 2026-09-04):
- OpenClaw:2025 年 11 月以 Clawdbot 之名由 Peter Steinberger 發布,2026 年 1 月更名,約 60 天內超過 25 萬 GitHub star;穩定版 v2026.7.1(2026-07-13),beta v2026.7.2(2026 年 7 月下旬)加入遠端編碼 session 與行動端/無頭 Linux 節點原生自動化。
- ChatGPT memory:兩層為 saved memories(條目化、可逐條檢視新增刪除)與 reference chat history(推斷式、會隨時間漂移);底層背景程序稱 Dreaming,Dreaming V3 於 2026-06-04 開始推出,非同步跨大量歷史對話閱讀並維護綜合記憶狀態,於每個新對話開始時注入 context。
- Hermes gateway 平台支援(2026 年初):CLI、Telegram、Discord、Slack、WhatsApp、Signal、Matrix、Mattermost、Email、SMS、DingTalk、飛書、企業微信、BlueBubbles、Home Assistant。
- OWASP:2026 年將「Memory and Context Poisoning」列為 Agentic AI Top 10 的 ASI06;OWASP Agent Memory Guard 於 2026 年中發布,作為 agent 與記憶儲存間的中介層,以 YAML 驅動的偵測器管線篩查讀寫,處置為 allow/redact/quarantine/block。
- MINJA:於 NeurIPS 2025 發表,論文報告對生產級 agent 架構有超過 95% 的注入成功率。
Benchmark 定義:
- LoCoMo:10 段對話、每段 19–32 個 session(約 9K token/段)、1,986 組問答,五類為 single-hop / multi-hop / temporal / open-ended / adversarial。
- LongMemEval:needle-in-a-haystack 範式,每題搭配約 115K token 的互動歷史。
- BEAM:與前兩者並列為 2026 年主要的記憶 benchmark。
B 級:可查證但需要脈絡的結果
- 「LoCoMo 92.5 / LongMemEval 94.4,約每次查詢 6,900 token」——這是 2026 年公開的領先結果之一,但它由記憶框架廠商自己發布。這類數字的通例是:發布方對自己的方案做了充分調校,對比較對象沒有。分數的相對排序不可靠,絕對量級(九成以上是可達到的)可靠。
- 「在 LoCoMo 接近滿分的模型,在 MemoryArena 掉到 40–60%」——這個落差也來自廠商的分析文章,但它的方向對廠商自己不利,因此可信度較高。這是本專欄引用它的理由。落差被描述為「被動回想」與「主動、與決策相關的記憶使用」之間的差距。
- 本專欄沒有引用任何「業界平均召回率」「典型記憶條目數」之類的基準值,因為找不到中立來源。凡是這類數字出現在比較文章裡,來源幾乎都是某個廠商的自有資料。
- 「純向量檢索在專有名詞上表現差」——這是廣泛被驗證的已知弱點,多個獨立來源與各框架的混合檢索設計都指向它,但我沒有找到一份中立的量化對照研究。它屬於強共識但非嚴格實證。
C 級:機制性推論與我的設計主張
以下是我的設計判斷,不是任何框架的官方主張。 它們有機制上的理由,但沒有對照實驗支持。凡本專欄中屬於這一級的內容,都應該當成起點而非結論。
- 藍圖 的整體結構(Context Assembler + 常駐/召回/session 三層 + 五階段寫入管線 + 五階段召回管線)是我從六個框架抽取後組合的,沒有任何框架長這樣。它的每個元件有出處,組合方式沒有。
- 「記憶整理應該脫離主推理路徑」是強共識——依據是 Letta 的 sleep-time compute、LangMem 的 background、Hermes 的 periodic nudge、OpenAI 的 Dreaming 四個獨立實作收斂到同一模式。四個獨立收斂是很強的證據,但它仍然是推論而非實證。
- 「NOOP 比例低於三成幾乎確定表示膨脹」——這個門檻是我估的,沒有資料支持。方向(NOOP 比例是膨脹的指標)有機制依據,具體數字沒有。
- 歸檔策略的預設值(失效超過 90 天、建立後 180 天未召回)——純屬起點建議,沒有依據。
MemoryPolicy抽成獨立介面——這是我的主張,理由是六個框架的差異幾乎全部落在這個介面的實作裡。它是一個觀察導出的設計,不是被驗證過的架構。- 「先做常駐層,它在多數專案裡就交付了記憶價值的大半」——經驗判斷,無量化依據。
- 「多數專案在決策樹的 Q4 或 Q5 就結束」——我的估計。
recall_count與last_recalled_at作為重要性訊號——機制上合理(被用到的東西比較重要),但沒有研究驗證它比 LLM 判斷的重要性評分更好或更差。- 「不要把可以查的東西記下來」——這條原則我認為是對的且重要,但它是從快取失效的一般推理類推來的,沒有針對 agent memory 的研究。
- 檔案原生路線在記憶投毒上的淨效果——「更容易寫入但更容易追查」這個取捨的淨方向沒有定論,我沒有把它算成優點或缺點。舊專欄的 客觀檢視 對此有更完整的討論。
D 級:明確有爭議或無法確認的
- 各框架的相對召回品質。 所有公開比較都由利益相關方製作,沒有中立的第三方對照評測。本專欄因此完全不對「哪個框架召回品質最好」做任何陳述。
- 記憶層的成本結構。 比較表 裡的「每次寫入的 LLM 呼叫次數」是從公開的機制描述推算的,不是實測。實際成本取決於 prompt 長度、模型選擇與批次策略,可能差異很大。
- ontology 維護成本 vs 抽取品質提升的淨效益。 Cognee 主張前者值得,這在有穩定領域模型時合理,但沒有量化資料。
- 「該記什麼」的重要性判斷沒有替代方案的比較。 所有框架都用一次 LLM 呼叫來判斷(Mem0 的 extraction、Hermes 的 periodic nudge、Letta 的 sleep-time agent),而這個做法從未被與任何 baseline 對照過——例如「全部都記」「按長度或新近度啟發式篩選」的表現如何,公開資料裡沒有答案。這等於把問題丟給模型,不是解決它。
- 多 agent 記憶的併發寫入語意。 分散式系統有成熟的一致性層級定義,agent memory 領域沒有對應的討論。Letta 的 block 共享是最接近的實作,但它沒有定義併發行為。這是空白而非爭議。
- OpenClaw 的安全性。 已有多篇公開的安全分析論文。自架、具 shell 執行與瀏覽器自動化能力、且記憶可被對話內容寫入的 agent,攻擊面明顯大於受限的雲端服務——這個判斷有機制依據,但「實際風險有多大」取決於部署方式,無法一般化。
不在本專欄範圍內的
- 概念分層與治理原則的完整討論——見 前導專欄,特別是 長上下文、RAG 與記憶的分工 與 證據鏈與治理記憶。
- EverOS 的設計與利益揭露——舊專欄的 落地工程篇 已完整處理,這裡不重複。
- 參數記憶(fine-tuning、模型權重內的知識)——本專欄只處理非參數記憶。兩者的分界在舊專欄有討論。
- 向量資料庫本身的選型與調校——這是一個獨立主題。
- 法規遵循的具體要求(GDPR 的刪除權、各地資料在地化)——陷阱篇 只處理技術上的可刪除性,不提供法律意見。
延伸資源
論文
- Mem0:arXiv:2504.19413,〈Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory〉(ECAI 2025)。extract-update 管線與四操作的原始出處。
- Zep:arXiv:2501.13956,〈Zep: A Temporal Knowledge Graph Architecture for Agent Memory〉。雙時間軸模型的原始出處,本專欄最推薦精讀的一篇。
- MemGPT:Letta 的前身論文,「context 如虛擬記憶」類比的來源。
- MINJA(NeurIPS 2025):記憶注入攻擊。搭配 AgentPoison 一起讀,能看清這個攻擊面的形狀。
官方文件與部落格
- Letta:
docs.letta.com;部落格的 Memory Blocks 與 Sleep-time Compute 兩篇是理解它的最短路徑。 - Mem0:
docs.mem0.ai。 - Zep / Graphiti:
help.getzep.com/graphiti、blog.getzep.com;Graphiti 為開源,可單獨使用。 - Cognee:
cognee.ai的 blog 有 ECL 與 ontology 的說明。 - LangChain:LangMem SDK 發布文與 LangGraph 的 memory 文件;
docs.langchain.com。 - Anthropic:
anthropic.com/engineering/effective-context-engineering-for-ai-agents——這一篇是本專欄引用最多的單一來源,值得完整讀過;memory tool 與 context management 原語見 Claude 平台文件與 cookbook。 - OpenClaw:GitHub repo 與官方文件;Mem0 官方也發布過 OpenClaw 的記憶整合說明,是了解其插槽機制的好入口。
- Hermes Agent:
hermes-agent.nousresearch.com。
標準與安全
- OWASP Agentic AI Top 10(2026),特別是 ASI06 Memory and Context Poisoning。
- OWASP Agent Memory Guard(2026 年中)——記憶讀寫中介層的標準對齊基線。
使用建議:先讀 Zep 論文(時間模型)與 Anthropic 的 context engineering(目標函式),這兩份給你最多的結構性理解。 框架文件按選型結果再讀對應的那一份——全部讀完的邊際效益很低,因為它們的差異在本專欄的比較表裡已經被抽出來了。