深信号· DEEPSIGNAL
深信号· DEEPSIGNALRSS
SIGNAL DEEP-DIVE

Agent 老是失忆?这四个记忆项目能治,附选型清单

2026-09-11·GitHub·Agent 工程Agent 记忆对比评测cogneeMemorihindsightai-memory
▮ SIGNAL SUMMARY · 摘要快读

同在"给 Agent 加记忆"这条赛道上,cognee(3.0 万 Star)做知识图谱,ai-memory(6.5k)做项目 wiki,Memori(1.7 万)做结构化记忆层,hindsight(2.3 万)做记忆银行。四个项目解的不是同一个问题——这正是这块赛道还没收敛的证据。

Agent 老是失忆?这四个记忆项目能治,附选型清单

先说说你大概也遇到过的那个问题

你用 Agent 帮你干活的时候,有没有过这种挠头时刻?

前一天配合得好好的,活儿干得漂亮,收工的时候心满意足。第二天再打开,问它「昨天那个事怎么样了」——它一顿读文件,读完整理,整理完还是没记全。你只好重新交代背景、重新说清上次的结论,一趟下来,光「复习」就花掉十几分钟。

这不是模型不够聪明,是它没有记住你的地方

Agent 越普及,这事就越扎眼。一个人一天可能同时用三四个 Agent——写代码的、查资料的、写文案的——每个都记不住,每个都要重讲一遍。于是「给 Agent 加记忆」成了一条热闹的赛道,GitHub 上叫得出名字的项目就有十几个。

今天我们挑了四个近期关注度高、涨得快的:

项目Star它的核心动作一句话定位
cognee30.6kingest → 建图谱 → recall自托管的知识图谱记忆平台
hindsight23.4kretain / recall / reflect准确率优先的记忆银行
Memori16.6k自动持久 + 后台召回省 token 的结构化记忆层
ai-memory6.5kcapture → consolidate → recall → handoffcoding CLI 的项目 wiki + 交接

四个都自称解决"Agent 记不住事"。但把它们放在一起,"Agent 记忆"这个词其实装不下四种不同的东西。

四块不同形状的容器并排立在深色台面上:一块由网格构成、一块是翻开的书页、一块是层叠的方块、一块是分隔成格的抽屉
四个容器,四种"记住"。

专业分析

一、分歧的第一层:到底"记住什么"

这是四家分道扬镳的地方,而且选择各不相同:

注意这个差异的分量:记"对话"的系统,最后会变成聊天记录检索器;记"动作"的系统,才有可能回答"上次这个任务是怎么做完的"。这一层选错,后面所有优化都白费。

二、分歧的第二层:怎么把它取回来

这里最值得单独说的是 Memori 那组数字。它证明了一件违反直觉的事:记忆的瓶颈不是"能不能记住",而是"取回来的时候占多少上下文"。721 token 意味着记忆系统本身几乎不消耗预算——对每天跑几百次调用的生产环境,这是决定性的差别。

而对"多 Agent 协作"最直接的是 ai-memory 的 handoff:跨 Agent 交接时显式传递接力棒。读过它架构文档的话会发现,它专门写了一节"保持多用户、多会话安全的不变式"——说明它踩过这方面的坑。

三、分歧的第三层:给谁用

这一层决定产品形态,也最容易被忽略:

面向谁形态
ai-memory同时用多个 coding CLI 的个人挂在 harness 外的记忆层
cognee要自托管、要数据主权的团队平台 + 多语言 SDK + MCP
Memori追求低成本的集成方库 + 云服务(LLM/存储/框架无关)
hindsight做"AI 员工"的产品团队服务 + 记忆银行(banks)隔离

hindsight 的"记忆银行"值得单独提:它用 banks 做隔离,配上 per-user 元数据——这是多租户场景的正确答案。相比之下,把所有人的记忆堆在一个池子里、靠检索去区分,迟早会串味。

一条传送带上依次经过四个不同的处理站:一个把材料装订成册、一个把它连成网络、一个压缩成方块、一个分格归档
同样的原料,四种加工方式。

关联信息与影响

第一个影响:给选型的人省了时间。 这四个项目经常被放在同一篇文章里"推荐",但它们其实不可互换。问自己三个问题就知道该选谁:你要记住的是动作还是对话?取回来时能不能承受大上下文?是单人多机还是多人多租户?

第二个影响:它暴露了这块赛道真正没解决的事。 四个项目里,没有一个把"多人协作同一个项目时的记忆共享"当成核心问题——banks 解决的是隔离,handoff 解决的是单人接力。当两个不同的人、用两个不同的 Agent 在同一个项目上干活时,记忆该怎么合并、冲突该怎么裁决? 这个问题目前是空着的。

第三个影响:评测标准还不统一。 hindsight 拿 LongMemEval 的 SOTA 说事,Memori 拿 token 成本和准确率说事,cognee 谈的是平台能力。没有公认的评测口径,就意味着"哪个最好"这个问题现在没有答案——而这恰恰是早期赛道的特征。

未来展望

短期,记忆系统会先出现功能收敛:结构化存储 + 检索预算控制(Memori 那套思路)+ 多租户隔离(banks 那套思路)会成为标配,而不是差异点。

中期,真正的分水岭在跨 Agent / 跨人类协作。单机记忆已经很卷了,但当多个 Agent 分属不同的人,记忆的"合并、授权、冲突裁决"才是新的深水区。谁先解决这个,谁就从"记忆库"升格成"协作基础设施"。

长期看,记忆系统可能会像数据库一样分层:底下的存储引擎、中间的检索与压缩策略、上面的领域模型(编程 / 研究 / 客服各有各的记忆结构)。到那时,"这个 Agent 记得住吗"会变成"它的记忆架构对不对"。

需要泼的冷水:这些项目的公开数据几乎都是自测口径。Memori 的 721 token 是它自己的 benchmark,hindsight 的 SOTA 也是它自己引用的评测。在没有第三方横向复现之前,任何"某某最强"的说法都只是营销。 更现实的判断方式是:拿你自己的数据跑一遍。

信号强度

SIGNAL FILE · 情报档案

对比四家会发现,分歧根本不在技术选型,而在"回答哪个问题":ai-memory 解决"换个 CLI 就丢上下文"(capture→consolidate→recall→handoff),cognee 解决"把任意格式数据变成可查图谱",Memori 解决"别把上下文塞爆"(721 token/查询、2.8% 占用),hindsight 解决"记忆要有多准"(LongMemEval SOTA + 银行隔离)。选型的第一问不是"哪个 Star 多",而是"你要解决的是哪一个"。

本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。

原始报道:https://github.com/topoteretes/cognee(GitHub)

RELATED SIGNALS · 关联信号