2026-07
AI 记忆CfC因果发现

AI 记忆的三条路线,和一次诚实的复盘

让 AI 记住一个人,业界主流是给 AI 配「外部笔记本」。我押注了一条更难的路——让 AI 真的把你学进去,并拿到了明确的可行性验证;然后用一个不会说谎的数学裁判复核自己,得到一个没那么好听但更值钱的阶段性结论,以及第三条路线的入口。


去年我写过对 AI 记忆的判断:伴侣型 AI 最大的断点,是聊得再深、下次打开还是陌生人。这篇讲讲我在这个问题上走过的三条路线——包括其中一次不太好听、但我认为最值钱的复盘。

路线一:外部笔记本

业界主流方案(mem0、Zep 这些)本质是给 AI 配一个笔记本:把聊过的话存档、建索引,需要时翻出来贴给模型。工程成熟、立竿见影,但有个天花板:AI 本身没有变。 它不是「认识了你」,是「查得到你」——就像一个服务员每次都靠翻会员档案才知道你爱喝什么。

(顺带一说:我们后来专门评测过这类方案,最好的开源记忆系统也还没稳定打赢「把聊天记录全塞给模型」的笨办法——那是另一篇文章的故事。)

路线二:把你学进去

我押注的第二条路线:不做更快的检索,做真正的学习——用一种擅长处理时间信号的轻量神经网络(CfC,连续时间网络),从与你相处的多模态数据流里持续训练,普通电脑几分钟就能完成一轮。不是背下你说过的每句话,而是像人与人相处那样,慢慢形成「对你的感觉」。

这条路线验证出了让我兴奋的结果:随着训练推进,识别主人状态的准确率大幅拉升,稳定越过了预设的可行性门槛。「模型层记忆」这条路,技术上走得通。

一次诚实的复盘

路线验证通过之后,按惯性剧本,下一步应该是加数据、加算力、往产品里怼。但我做了另一件事:请一个不会说谎的数学裁判,复核自己最得意的路线。

方法是信息论——不问「模型表现好不好」,直接度量「输入信号里到底含有多少关于目标的信息」。这一招的好处是绕开永恒的循环争论:「效果不好,是模型不行还是数据不行?」信息论直接告诉你:这条信号里就只有这么多信息,模型再神也变不出更多。

在几百条反复清洗过的干净数据上重跑,裁决很清晰:纯表情信号的天花板到了。 单帧表情里关于「意图」的信息量很小(远低于做好产品需要的水平);更扎心的是,把 10 秒的表情变化序列喂进去,信息量几乎没有增加——我们原本以为「时间维度」藏着宝藏,实测它在纯表情输入下接近空手而归。而同一批实验里,粗糙的场景信息(他在开会还是在休息)一加进来,效果立刻抬升一截。

结论没那么好听,但方向清楚了:表情是下游,场景才是上游。 这成为项目的阶段性结论——结论、证据、重启条件全部归档,优化方向转向把场景与情境信号接进来,而不是在表情上继续死磕。做了近二十年产品,我越来越确信:知道一条路的天花板在哪,和找到一条新路一样值钱。

路线三:往因果的上游去

阶段性结论直接指出了第三条路线:既然场景是上游,那就把「什么导致什么」搞清楚——这属于「因果发现」的领域(研究怎么从时间数据里找出真正的因果关系,而不是碰巧一起发生的相关性)。

动手前先做足功课:AI 辅助精读了 15 篇「连续时间因果发现」方向的论文(完整清单附文末),逐篇产出结构化笔记再交叉比对。功课里最值钱的一个发现是:两份权威评测基准各自的「赢家」方法从未正面交锋过,关键结论存在两处交叉矛盾。顺着这个矛盾深挖后,我们把方案里的「因果验证器」主动降级成了「因果证伪器」——它不再负责证明「A 导致 B」,只负责否决「B 导致 A」这类错误方向。宁可少说,不可说错。

新分支正在数据积累期:会议场景的实时意图理解,摄像头只提取表情特征数字、从不保存画面(隐私从架构层锁死)。这条路刚开始走,有新结论会继续写在这里。

三条路线的关系

回头看,三条路线不是互相替代,是分工:外部笔记本负责记住事实(他说过什么),模型层学习负责形成感觉(他是什么样的人),因果上游负责理解处境(他此刻为什么这样)。真正的「认识一个人」,大概三者都要——而搞清楚每一条的天花板在哪,是把它们组合对的前提。

相关项目可见作品页的 LnMem(伴侣型 AI 记忆系统)。

附:15 篇文献清单

这次精读的 15 篇论文按四条谱系组织——理解这个结构比记住单篇更重要。

谱系 A · 语义地基(「导数依赖 = 因果」是什么意思)

1. From Ordinary Differential Equations to Structural Causal Models: the deterministic case — arxiv.org/abs/1304.7920

2. Causal interpretation of stochastic differential equations — arxiv.org/abs/1304.0217

3. Causal models for dynamical systems — arxiv.org/abs/2001.06208

谱系 B · 学习算法(怎么把因果结构学出来)

4. Neural graphical modelling in continuous-time: consistency guarantees and algorithms — arxiv.org/abs/2105.02522

5. Neural Structure Learning with Stochastic Differential Equations — arxiv.org/abs/2311.03309

6. Deep Koopman operator framework for causal discovery in nonlinear dynamical systems — arxiv.org/abs/2505.14828

7. Causal Structure Learning for Dynamical Systems with Theoretical Score Analysis — arxiv.org/abs/2512.14361

谱系 C · 打分与检验工具(用什么判据)

8. Tangent Space Causal Inference: Leveraging Vector Fields for Causal Discovery in Dynamical Systems — arxiv.org/abs/2410.23499

9. Signature Kernel Conditional Independence Tests in Causal Discovery for Stochastic Processes — arxiv.org/abs/2402.18477

10. Distinguishing Cause from Effect with Causal Velocity Models — arxiv.org/abs/2502.05122

谱系 D · 边界与现实(什么时候会失败)

11. Causality and independence in perfectly adapted dynamical systems — arxiv.org/abs/2101.11885

12. Disentangling Continuous-Time Latent Dynamics: Identifiability of Latent SDEs via Diffusion Shifts — arxiv.org/abs/2606.28228

13. Causal Discovery from Heteroscedastic Stochastic Dynamical Systems under Imperfect Physical Models — arxiv.org/abs/2602.04907

14. Hybrid² Neural ODE Causal Modeling and an Application to Glycemic Response — arxiv.org/abs/2402.17233

15. CausalDynamics: A large-scale benchmark for structural discovery of dynamical causal models — arxiv.org/abs/2505.16620