尧图网站建设 尧图网络
  • 首页
  • 关于我们
  • 服务项目
  • 案例展示
  • 建站流程
  • 资讯中心
  • 联系我们
首页/资讯中心/详情

RAG 当记忆的时代结束了:mem0 靠「抽事实」融了 2400 万美元

RAG 当记忆的时代结束了:mem0 靠「抽事实」融了 2400 万美元
📅 发布时间:2026/7/30 6:56:45

这个月我连写了 10 篇 RAG,后台被问得最多的一句话是:「我把对话历史全存进向量库,Agent 是不是就有记忆了?」

半年前我会说是。现在这个答案有一个值 2400 万美元的反例——2025 年 10 月,一家叫 mem0 的公司靠「不把原文存进向量库,改成抽事实」宣布了合计 2400 万美元融资:种子轮加 A 轮,A 轮由 Basis Set 领投,YC、Peak XV 参投。它在基准测试里给出的数字是:对比把全部历史塞进上下文,token 省 90% 以上,p95 延迟降 91%。

向量库还在,但它从「记忆本体」降级成了「记忆系统里的一个零件」——这就是 2026 年 Agent 记忆架构正在发生的事。

如果你的 Agent 记忆方案还停留在「对话切块、embedding、top-k 检索」,这篇文章会告诉你它有哪三个补不上的洞、行业是怎么一步步把它拆下来的、以及你该在什么时机升级到哪一代。


一、把 RAG 当记忆,会在三个地方漏水

先讲一个所有做过 Agent 助手的人都撞过的场景。

3 月份,用户跟你的编程助手说:「我们项目用 LangChain。」这句话被切块、embedding、存进向量库。5 月份,用户说:「我们把编排层迁到 LlamaIndex 了。」这句也进了向量库。

7 月份,用户问:「帮我写个检索管道的样板代码。」

检索发生了什么?两条记忆都躺在库里,「LangChain」那条因为和「检索管道」在语料里共现更多,相似度分数反而更高。你的 Agent 热情地用 LangChain 写了 200 行代码。

用户的评价通常只有一句:这助手记性不行。

冤吗?不冤。这不是检索质量问题,调 reranker、换 embedding 模型都救不了——是纯向量方案在「记忆」这个任务上的结构性缺陷。拆开看是三个洞:

洞一:没有 update 语义。向量库的世界里只有 insert 和 search,没有「这条新信息应该覆盖那条旧信息」的概念。用户改口,等于库里多了一条竞争记录,而不是修正了一条旧记录。

洞二:没有冲突消解。两条互相矛盾的记忆同时进 top-k 时,怎么办?答案是没人管。哪条 chunk 分数高,模型就更可能信哪条——本该由记忆层处理的矛盾,被原样甩给了生成层。

洞三:没有时间语义。余弦相似度不理解「最新的才算数」,更不理解「这条事实从 5 月起生效」。时间对向量检索来说只是 metadata 过滤器,不是一等公民。

一句话总结这三个洞:RAG 是为「找资料」设计的,不是为「维护状态」设计的。资料库不需要处理「作者改主意了」,记忆必须处理。


二、「上下文够长就不需要记忆」?Chroma 用 194,480 次调用把这话测死了

有人会说:何必这么麻烦,上下文窗口都百万级了,把完整对话史直接塞进去,让模型自己看。

这是「RAG is dead」争论的记忆版变体。巧的是,这次不用打嘴仗,有人做了实验。

Chroma 在 2025 年 7 月发布了技术报告《Context Rot》,测了18 个主流模型(GPT-4.1、Claude 4 系、Gemini 2.5 系、Qwen3 系),一共跑了194,480 次 LLM 调用。和记忆最相关的一组实验是 LongMemEval:同一批对话问答,一组喂「完整对话史」(约 113k token,模型需要自己从中检索再推理),一组喂「聚焦输入」(约 300 token,只含相关内容)。

结果没有悬念,但程度超出预期:所有 18 个模型,无一例外,聚焦输入显著好于完整输入。不是模型不够强——是「让模型在 113k 的干草堆里边找边答」这件事本身,就在系统性地损害可靠性。

报告里还有两个细节值得玩味:

  • • 性能下降是非均匀、不可预测的——即使任务简单到「复述一个词」,输入变长照样掉分。
  • • 失败方式有厂商性格:Claude 系倾向于「找不到就弃答」,GPT 系更容易自信地给出错误答案。你的用户看到的「幻觉」,很多时候只是模型在超长上下文里迷路后的体面说法。

再叠加那篇被引用到包浆的 Stanford《Lost in the Middle》(arXiv:2307.03172):关键信息落在长上下文中间位置时,性能下降可超过30%。

这组证据拼出来的结论是:「塞得下」和「记得住」是两件事。上下文窗口是 RAM,不是硬盘;再大的 RAM 也不能替代文件系统。长上下文和记忆层之间必须有一个筛选层——把 113k 压成 300 的那个东西,才配叫记忆。


三、三代记忆架构:每一代都在填上一代的坑

行业不是一步跳到今天的。过去两年,Agent 记忆架构走了三代,每一代都是被上一代「上了生产才暴露的问题」逼出来的。

代际架构核心机制解决了什么又暴露了什么
Gen1RAG 记忆纯向量库对话切块 → embedding → top-k跨会话「想得起来」改口、冲突、时序三个洞
Gen2结构化记忆事实三元组 + 双时态LLM 抽取(主体, 关系, 客体, 生效时间),同 key 旧事实标记失效update、冲突消解、时间语义事实是孤岛,跨实体多跳查询乏力
Gen3记忆图谱实体 + 关系边 + 事件向量召回 + 图遍历 + 事件相似度三路并发,融合后重排多跳推理、关系追溯、可解释需要图存储和抽取算力,工程复杂度上台阶

(这套三代划分是行业分析里逐渐收敛出的框架,不是某家的官方路线图——但它和 mem0、Zep、Letta 这些产品的实际演进路径对得上。)

看懂这张表的关键,不是记住三代分别叫什么,而是看清每次换代都在把「生成层的负担」前移到「记忆层」:

Gen1 把矛盾甩给模型现场判断;Gen2 在写入时就把矛盾消解掉(新事实进来,旧事实标记失效,检索时只出有效版本);Gen3 更进一步,把「实体之间怎么关联」也在写入时建好,查询时直接沿边走。

还有一个容易被忽略的设计细节:新代际没有扔掉旧代际。Gen3 的三路召回里,向量检索仍然是其中一路——负责兜底那些没被抽成事实、没进图谱的原始信息。

这就是「降级」的准确含义:RAG 没有被踢出记忆系统,它从系统本身,变成了系统里的一个召回通道。


四、Agent 记忆成绩单:抽事实的 mem0 和建图谱的 Zep,都拿到了数字

架构故事讲完了,看证据。两家代表性玩家,各自交出了可核验的基准数据。

mem0(Gen2 路线代表),论文挂在 arXiv:2504.19413。在 LOCOMO 长对话记忆基准上:

  • • 对比 OpenAI 自家的记忆系统,LLM-as-a-Judge 得分高 26%;
  • • 对比 full-context(全量历史塞上下文),p95 延迟降 91%,token 成本省 90% 以上;
  • • 单跳、多跳、时序、开放域四类问题全部领先,不是靠某一项偏科拉均分;
  • • 图增强版 Mem0ᵍ 在基础版上再 +2%——这个 +2% 很诚实:图谱的边际收益存在,但没有神话。

延迟降 91% 这个数字值得多看一眼。它不是推理优化省出来的,是架构红利:全量上下文方案每次都要让模型消化 20 多万字再回答,抽事实方案只递给模型几百 token 的有效事实。省掉的不是计算,是无效阅读。

Zep(Gen3 路线代表),论文 arXiv:2501.13956,底层是开源的时序知识图谱引擎 Graphiti。在 MemGPT 团队自己设立的 DMR 基准上,Zep 拿到94.8%,超过 MemGPT 的93.4%——用对手定的规则赢了对手;换 gpt-4o-mini 做底座甚至到了98.2%。

两份成绩单放在一起,指向同一个判断:记忆质量的瓶颈不在检索算法,在信息的组织形态。同样的模型、同样的原始对话,「存原文」和「抽事实再存」之间隔着 26 个点的判分差距和 91% 的延迟差距。

资本看懂了这件事,所以 2400 万美元投给了一家做「记忆中间件」的公司;平台也看懂了——从各家 API 的动向看,模型厂商在把「状态管理」的责任明确留给开发者层,记忆正在变成一个独立的技术层,就像十年前的数据库中间件。这个趋势判断是我的观察,你可以保留意见。


五、交锋:RAG 记忆降级论 vs 够用论

写到这肯定有人不服。把反方观点摆上来,这是我在后台真实收到过的三条:

反方一:「我的场景就是 FAQ 问答,向量库跑得好好的。」

对,而且你不该升级。如果你的「记忆」只是只读知识——产品文档、政策条款、历史工单——那它本质是知识库不是记忆,Gen1 就是最优解。三个洞全都踩不到:知识库没有「用户改口」,不需要 update。

反方二:「抽事实会丢信息,原文才是完整的。」

这条批评是对的,而且 Gen2/Gen3 的设计者也承认——所以 Gen3 保留了原始事件层(episode),抽取失败或模糊的信息走向量兜底。但反过来想:Chroma 的实验已经证明,「完整」的代价是把 113k 的噪音一起递给模型,而模型在噪音里的表现是全员下滑。丢弃低价值信息不是缺陷,是记忆的功能。人脑也不存原文。

反方三:「Gen3 图谱太重,我团队搞不动。」

这是三条里最实在的一条。图存储、实体抽取、三路召回融合,工程量确实上了一个台阶。我的判断是:大多数团队应该停在 Gen2——一张事实表加双时态字段,PostgreSQL 就能落地,把 update 和冲突消解先解决掉,你就已经甩开了一大批还在裸用向量库的同行。Gen3 留给真正有「跨实体多跳查询」需求的场景:客服要追「这个用户和哪些订单、哪些投诉、哪些补偿方案有关联」,那是图的主场。


六、给 RAG 工程师的升级路线

💡 这部分建议收藏——下次记忆系统选型会,直接拿这张表对。

第一步:先判断你做的是「知识库」还是「记忆」。

判断题是否
信息会被用户/环境更新吗?是记忆,继续往下是知识库,Gen1 收工
存在「新信息应覆盖旧信息」吗?至少 Gen2Gen1 够用
有跨实体关联查询吗?(谁和谁、经由什么)考虑 Gen3Gen2 停住
日活对话量撑得起图谱抽取成本吗?Gen3 可行Gen2 + 向量兜底

第二步:如果决定升 Gen2,改动比你想的小。

不用推倒重来,在现有 RAG 管道上加三样东西:

    1. 写入侧加一个抽取步骤:对话结束后异步跑一次 LLM 抽取,产出(主体, 属性, 值, 生效时间)四元组,存关系表;
    1. 同 key 冲突时标记失效:新事实写入前查同主体同属性的旧记录,把valid_to打上时间戳——这一列就是你的冲突消解器;
    1. 检索侧改成两路:结构化事实查表(快、准、带时效),向量库只兜原始细节。

第三步:不管停在哪代,建一个记忆评估集。

从真实对话里挑 50 个「用户改口」「跨会话引用」「时间敏感」的 case,每次改记忆层就回归一遍。RAG 有 RAGAS,记忆层的评估现在还是拓荒区——这恰恰是你在团队里建立话语权的机会。


结尾

回到开头那个问题:「对话历史全存向量库,是不是就有记忆了?」

现在可以给出完整回答:那是 Gen1,2024 年的及格线,2026 年的起跑线都算不上。RAG 从来没死,它只是回到了自己该在的位置——检索是记忆的一个动作,不是记忆本身。

分人群一句话建议:

  • •做知识库问答的:别焦虑,你的场景 Gen1 仍是最优解,把分块和 rerank 打磨好更值钱;
  • •做 Agent 助手/客服的:三个洞你迟早全踩,这个季度就把 Gen2 的事实表加上,成本一周、收益立竿见影;
  • •做记忆基础设施的:mem0 的 2400 万美元证明这是独立赛道,评估工具、失效策略、隐私删除(用户要求「忘了我」怎么办)全是空白位;
  • •准备面试的:「你的 Agent 怎么处理用户改口」大概率会成为高频题,本文第一、三节就是答题框架。

最后留个投票,评论区扣字母——你的 Agent 记忆现在停在哪一代?

  • •A:还没有记忆,每次会话都是新的
  • •B:Gen1,向量库存对话史
  • •C:Gen2,已经在抽结构化事实
  • •D:Gen3,图谱都建上了

我先来:我的助手项目目前是 B 卡 C,事实表建了,冲突消解还在补。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

  • 国产长芯微LDC3421完全pin-pin替代MCP3421;一款单通道低噪声、高精度ΔΣ模数转换器
  • 兰州市防水补漏_2026甘肃中部黄河沿岸省会城市漏水维修避坑指南与五大正规团队推荐 - 雨婺虹房屋维修
  • 安卓设备运行完整Linux系统:无需Root的Termux+PRoot实战指南

最新新闻

  • AI 应用工程:Tool、MCP、Skill 与 Workflow 如何接入 Agent?——搭建一个可运行的需求影响面分析 Agent
  • TI嵌入式开发实战指南:从MSPM0入门到I2C/SPI通信调试
  • AI搜索优化GEO系统:从模块拆解到数据流的架构设计解析(架构设计篇) - 汇聚至此
  • 复杂学术 PDF 翻译故障排查,公式、图表和引用该怎么检查
  • C语言扫雷递归展开优化:从栈溢出到队列BFS的算法演进
  • C++与Python实现Modbus TCP客户端:Qt框架下的性能与效率抉择

日新闻

  • 终极TeamSpeak3音乐机器人搭建指南:5分钟实现语音聊天室音频播放
  • 广州海珠区内搬家攻略,平价靠谱搬家服务商推荐,专业打包搬运省心避坑全流程指南 - 厚道搬家
  • 大语言模型入门指南:从零到精通掌握AI核心技术的5大步骤

周新闻

  • 大连理工大学与东京大学联手打造的“主动型AI助手“
  • 170.2026年国家级科研瓶颈:超精密单点金刚石切削(SPDT)光学表面生成
  • SongBloom:革命性歌曲生成框架深度解析——如何通过交织自回归与扩散模型创作完整音乐

月新闻

  • 2026年6月公司网站搭建最新热门渠道测评:四大低成本/零代码平台对比+避坑
  • 【Linux】Linux arm 编译QT程序,出现expected “}“报错
  • 【MATLAB例程】四基站二维AOA定位与距离辅助增强对比仿真。基于角度观测和测距修正的固定目标平面定位精度分析

关于尧图

  • 公司简介
  • 团队介绍
  • 企业文化
  • 荣誉资质

服务项目

  • 定制开发
  • 电商建站
  • UI 设计
  • 运维服务

快速链接

  • 案例展示
  • 建站流程
  • 常见问题
  • 资讯中心

联系方式

  • 📍北京市朝阳区互联网产业园 A 座 10 层
  • 📞400-888-8888
  • ✉️contact@rkmt.cn
  • 🕐周一至周日 9:00-21:00

© 2024 北京尧图网络科技有限公司 版权所有 | 京 ICP 备 XXXXXXXX 号