2026 年,Agent 生态最热闹的词之一是“记忆”。
听起来很玄:长期记忆、人格连续性、任务上下文、跨会话召回。可真落到工程里,问题往往朴素得多:上周讨论过的接口为什么改了?某个用户偏好在哪里出现过?一个 Agent 在第 37 轮对话里答应过什么?
MemPalace 最近在 GitHub 上把这个问题重新拉回地面。它的答案不是先让大模型总结一遍,而是把原始对话尽量完整存下来,再用语义检索把相关片段找出来。
先看几个数字
MemPalace 的公开定位很直接:本地优先、原文存储、可插拔检索后端。
几个数字能帮助快速判断它现在处在什么位置:
| 项目 | 信息 |
|---|---|
| GitHub Star | 约 5.7 万 |
| License | MIT |
| 主要语言 | Python |
| 最新 PyPI 版本 | 3.5.0 |
| LongMemEval raw R@5 | 96.6% |
| 默认后端 | ChromaDB |
| 可选后端 | sqlite_exact / Qdrant / pgvector |
这里最容易被误读的是96.6%。它不是“问答准确率”,而是 LongMemEval 上的检索召回率 R@5:目标会话是否出现在前 5 个检索结果里。
这依然有价值,但它评价的是“能不能把证据找回来”,不是“最终回答一定正确”。这两个指标必须分开看。
它没有先问 AI:这段话值不值得记
很多 Agent 记忆系统会先做一层抽取:让 LLM 从对话里提炼事实、偏好、事件,再把这些结构化结果写入记忆库。
这条路线的好处是干净,坏处也明显:一旦抽取时漏了上下文,后面就没法凭空补回来。
MemPalace 的取舍更像“先归档,再检索”。它把原始会话作为 drawer 保存,用 wing、room 这类层级做分区,再通过语义搜索把相关原文召回。
这个设计的工程含义很清楚:它不急着判断哪句话重要,而是尽量降低“记忆写入阶段”的信息损失。
对 Agent 来说,这一点并不小。很多长期任务里的关键信息,不是单独一句“用户喜欢 PostgreSQL”,而是当时为什么选 PostgreSQL、排除了什么方案、谁做了这个决定、后面有没有反悔。
抽成一句偏好,读起来省事;原文保留下来,事后追溯更稳。
“记忆宫殿”其实是元数据分区
MemPalace 用了一套比较有画面感的命名:wing、room、closet、drawer。
翻译成工程语言,大致可以这样理解:
| 概念 | 工程含义 |
|---|---|
| Wing | 人、项目或 Agent 的大分区 |
| Room | 某个主题或任务空间 |
| Drawer | 原始文本片段 |
| Closet | 压缩摘要或辅助上下文 |
| Hall / Tunnel | 房间之间、分区之间的关联 |
这套比喻不神秘,核心是让检索不只在一个大池子里乱捞。
当记忆规模变大,分区本身就会变成质量控制手段:个人助理的生活记录、代码 Agent 的项目日志、研究 Agent 的论文笔记,最好不要混在同一个扁平向量库里互相污染。
不过也要说清楚:MemPalace 自己的历史记录里承认过,早期把“宫殿结构”描述成大幅提升检索效果的说法过头了。wing 和 room 更像标准的元数据过滤与组织方式,不是凭空多出来的魔法。
这种修正反而让项目更可信。开源项目最怕的不是一开始吹大了,而是被指出问题后继续装没事。
Benchmark 要看,但别只看标题数字
MemPalace 最出圈的是 LongMemEval 的96.6% R@5。项目仓库里保留了 benchmark 脚本和结果文件,也在历史说明里记录了几次公开修正。
最重要的一次修正发生在 2026 年 4 月:社区指出它曾经把“检索召回率”和其他系统的“端到端问答准确率”放在同一张对比表里,这属于指标口径混用。
后来公开页面把这类横向比较撤掉了,README 现在强调的是自己的检索结果,而不是直接宣称打败所有记忆系统。
这件事给我们的启发比数字本身还实用:Agent memory 的 benchmark 至少要拆成三层看。
| 层级 | 问题 | 常见指标 |
|---|---|---|
| 检索层 | 相关证据能否找回来 | Recall@K / NDCG |
| 阅读层 | 模型能否读懂证据 | Rerank / QA accuracy |
| 行为层 | Agent 是否真的做对事 | Task success / human eval |
MemPalace 当前最强的证据在第一层:原文存储加语义检索,是一个很强的低成本 baseline。
但如果要把它接进生产级 Agent,还要继续看权限隔离、多人协作、冲突处理、审计、数据生命周期这些问题。
它更像个人 Agent 的本地硬盘
从当前形态看,MemPalace 最适合的不是一上来做企业级记忆平台,而是给本地 Agent、个人助理、Claude Code / Codex 类长期工作流补一块“可搜索硬盘”。
它已经支持 CLI、MCP server、Docker、本地后端,以及 Qdrant、pgvector 这类外部后端。项目近期也在补远程 MCP server、团队部署、Windows 兼容、锁机制等工程细节。
这让它看起来不像只有 README 好看,代码和 issue 也在往真实使用场景里走。
但它的风险同样明显。
第一,Star 数增长非常夸张,不能直接等同于社区质量。更稳的判断方式,是看贡献者结构、PR 活跃度、issue 质量、测试覆盖和 release 节奏。
第二,原文存储天然带来隐私压力。它的默认立场是本地优先,但一旦用户切到 Qdrant、pgvector 等外部服务,原始文本和元数据就可能离开本机。项目文档对此有提醒,使用时不能只看“local-first”四个字。
第三,原文保存解决的是“不丢”,不自动解决“怎么忘”。一个长期 Agent 迟早要面对删除、过期、冲突、错误记忆更正、不同身份之间的边界。记忆越完整,治理越重要。
Agent 记忆可能会先回到常识
过去一年,很多 Agent 记忆方案都在试图证明:记忆需要更聪明的抽取、更复杂的图谱、更主动的反思。
MemPalace 给了一个有点反直觉的提醒:在让 AI 决定什么值得记之前,先把原话安全、可检索、可分区地存好,可能就是一个很强的起点。
这不意味着抽取式记忆没价值。事实、偏好、时间线、关系图谱,依然会在高阶 Agent 里发挥作用。
只是底座最好别太早丢信息。
真正成熟的 Agent 记忆层,可能不是“原文派”和“抽取派”二选一,而是两层共存:原文负责追溯,结构化记忆负责快速行动,权限和生命周期管理负责不出事。
MemPalace 现在最值得关注的地方,也正在这里。
它不是把 Agent 变成有灵魂的数字分身,而是提醒开发者:长期记忆首先是一套工程系统。能保存、能找到、能解释来源,已经比很多听起来很聪明的方案更接近可用。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~