评测了 8 个开源记忆系统之后:高分到底是谁的功劳?
给 AI 装「记忆」是今年最热的方向之一,开源方案已有一大把。我把其中 8 个放到同一张考卷前,跑出了两个反直觉的结论:一些系统的高分是「借了强模型的光」;而目前没有一个,能稳定打赢「把全部聊天记录塞给模型」这个笨办法。
做儿童陪伴方向的 AI 产品时,我遇到一个绕不开的问题:AI 能不能真的记住一个孩子? 记住他养过的猫、上周的约定、说过「我不喜欢黑暗」——这些不是锦上添花,是长期关系的地基。
市面上的开源「记忆系统」已经有一大把:mem0、letta、cognee、hindsight……每一个都宣称自己让 AI 拥有了长期记忆。但宣称是一回事,考出来是另一回事。于是我做了一件事:把 8 个主流开源记忆系统放到同一张考卷前,用统一的接入方式、统一的题库、统一的判分标准,跑一次公平的横评。
考卷怎么出
题库专门按「陪伴」场景设计:不只考「他叫什么名字」这种查户口题,更考情感寄托、兴趣变化、承诺与信任——比如孩子上个月说想养狗、这个月说怕狗了,AI 该记住哪个?题目覆盖六种能力:单次对话内的记忆、跨对话的推理、时间顺序的把握、知识更新(旧信息被新信息推翻)、该说「不知道」时会不会乱编、以及对用户偏好的持续遵循。
判分也刻意「不信自觉」:不让被测系统自己报告「我记住了」,而是用黑盒提问验证——答案对不对、引用的事实全不全,都由独立的判分层裁决。
发现一:有些高分,是「借了强模型的光」
第一个反直觉的发现来自一次换模型实验。同一批记忆系统、同一套题,我把负责「答题」的大模型从一个很强的换成一个很弱的(本地小模型),再看各家分数怎么变。
结果出现了明显的两极分化:那些依赖大模型深度加工记忆的系统,成绩塌陷——最狠的一家,249 道题的答对数从 56 掉到 36,跌了超过三分之一;而做法朴素、主要靠检索的系统,答对数反而略有上升。(公平起见说明一句:个别系统的跌幅可能混入了它在弱模型下运行不稳的因素,但「重加工跌、轻检索升」的分化方向是一致的。)
这说明什么?说明前者的高分里,有相当一部分不是「记忆系统」的功劳,而是强模型在答题时的即兴发挥——把评测模型换弱,光环就消失了。我把这个现象叫「弱档放大效应」:用弱模型当答题者,反而能放大不同记忆系统之间的真实差距。如果你在为产品选型记忆方案,这是个值得复制的实验:先用弱模型把各家的底裤测出来,再决定信谁的分数。
发现二:还没有谁能稳定打赢「笨办法」
第二个发现更扎心。我在考卷里放了几个「对照组」:完全没有记忆的裸模型(下限)、直接把全部历史聊天记录塞进提示词的笨办法(我叫它「全量历史」)、以及提前把答案喂好的理论上限。
在最能代表真实体验的「回答正确率」这一轴上,成绩是这样的:理论上限 0.911,全量历史 0.898,而表现最好的开源记忆系统 0.833,其余依次更低,朴素检索只有 0.682。
也就是说:目前最好的开源记忆系统,还没有打赢「把聊天记录全塞进去」这个最笨的办法。 记忆系统的核心卖点本是「用更少的上下文达到接近全量的效果」,但现在的现实是——省是省了,代价是丢分。当然,全量历史有自己的死穴:聊天记录一长就塞不下、成本爆炸,所以记忆系统依然是必须攻克的方向。但这个对照告诉我们:今天谁要是宣称自己的记忆方案「效果无损」,你应该先问一句:跟全量历史比过吗?
给同行的三句话
一、评记忆,先立对照组。 没有裸模型下限和全量历史基线,任何记忆系统的分数都没有坐标系。
二、分清「记忆的功劳」和「模型的功劳」。 换个弱模型再跑一遍,很多结论会反转。
三、警惕自报成绩。 系统说「我记住了」不算数,黑盒提问、独立判分才算数。
这套评测目前仍在扩展题库和接入更多系统,后续有新发现会继续写在这里。