
如何复现MemPalace基准测试LongMemEval、LoCoMo、ConvoMem完整命令指南【免费下载链接】mempalaceThe best-benchmarked open-source AI memory system. And its free.项目地址: https://gitcode.com/GitHub_Trending/me/mempalaceMemPalace 是一款免费开源的 AI 记忆系统它把对话原文逐字存入本地向量库再用语义搜索找回来不做任何 LLM 提取或摘要。官方在 LongMemEval 上取得 96.6% R5、ConvoMem 上 92.9% 平均召回率。本文提供完整命令指南——无需 API Key、无需 GPU、只需 Python ChromaDB约 10 分钟即可在你自己的机器上复现这三大 AI 记忆基准测试的全部结果。三个基准测试各测什么能力在敲命令之前先搞清楚每个基准到底在考什么这样看到分数才懂它意味着什么基准测试测试数据考察能力官方免费基线LongMemEval500 道题每题约 53 个会话从几十个会话中捞出被埋藏的事实大海捞针96.6% R5LoCoMo10 段长对话1,986 组问答跨周的多跳推理与时间推理60.3% R10session 粒度ConvoMem75K 问答对6 大类别规模化记忆事实、偏好、变更、拒答、隐式关联92.9% 平均召回率一句话总结LongMemEval 测找得到LoCoMo 测连得上ConvoMem 测扛得住规模。环境准备一条命令装好全部依赖复现 MemPalace 基准测试的前置条件极低✅ Python 3.9✅chromadb唯一的运行时依赖✅ 约 300MB 磁盘LongMemEval 数据✅ 无需 API Key、无需 GPU数据下载完成后全程离线可跑git clone https://gitcode.com/GitHub_Trending/me/mempalace cd mempalace uv sync --extra dev # 或者pip install -e .[dev] 如果你还没装uv也可以直接用pip install -e .[dev]效果相同。复现 LongMemEvalAI 记忆的标准基准测试LongMemEval 是 AI 记忆领域公认的标准考卷。完整流程分两步第一步下载数据集约 300MBmkdir -p /tmp/longmemeval-data curl -fsSL -o /tmp/longmemeval-data/longmemeval_s_cleaned.json \ https://huggingface.co/datasets/xiaowu0162/longmemeval-cleaned/resolve/main/longmemeval_s_cleaned.json第二步先跑 20 题快速验证环境python benchmarks/longmemeval_bench.py /tmp/longmemeval-data/longmemeval_s_cleaned.json --limit 20第三步跑完整 500 题即官方 96.6% 头条成绩python benchmarks/longmemeval_bench.py /tmp/longmemeval-data/longmemeval_s_cleaned.json预期输出完整 500 题Apple Silicon 上约 5 分钟Recall5: 0.966 Recall10: 0.982 NDCG10: 0.889跑出来对得上这三个数字说明你的环境没问题。试试其他检索模式都不需要 API Key模式追加参数得分说明原文直存默认无96.6%官方头条基线AAAK 压缩存储--mode aaak84.2%压缩后再检索主题房间过滤--mode rooms89.4%按会话主题分房间检索混合评分--mode hybrid≈98.4%关键词加分 时间加权对话轮次粒度--granularity turn—更细粒度的对照实验复现 LoCoMo跨长对话的多跳推理LoCoMo 的数据是 10 段各含 19–32 个会话、400–600 轮对话的超长对话考察的是把几周前的事实连起来的能力。第一步获取数据集git clone https://github.com/snap-research/locomo.git /tmp/locomo第二步先用 1 段对话快速试跑python benchmarks/locomo_bench.py /tmp/locomo/data/locomo10.json --limit 1第三步完整 10 段对话复现官方基线python benchmarks/locomo_bench.py /tmp/locomo/data/locomo10.json \ --granularity session --top-k 10预期输出约 2 分钟Avg Recall: 0.603 Temporal: 0.692⚠️新手最容易踩的坑locomo_bench.py的--top-k默认值是 50直接跑会得到 77.8%——看起来更高但因为 top-k 超过了每段对话的会话数19–32 个正确答案必然在候选池里分数是结构性虚高的。要复现官方诚实基线 60.3%必须显式加--top-k 10。如果想体验更难的轮次级检索把粒度换成--granularity dialog官方成绩 48.0%。复现 ConvoMem规模化记忆测试数据自动下载ConvoMem 来自 Salesforce覆盖 75K 问答对和 6 大类记忆场景。它是三个基准里最省心的——数据自动从 HuggingFace 下载不用手动准备任何文件# 官方基线全部 6 个类别每类 50 条 python benchmarks/convomem_bench.py --category all --limit 50 # 单独测某一类共 100 条 python benchmarks/convomem_bench.py --category user_evidence --limit 100 # 10 条快速冒烟测试 python benchmarks/convomem_bench.py --category user_evidence --limit 10预期输出全类别各 50 条约 2 分钟Avg Recall: 0.929 Assistant Facts: 1.000 User Facts: 0.980六个可选类别user_evidence、assistant_facts_evidence、changing_evidence、abstention_evidence、preference_evidence、implicit_connection_evidence。其中助理事实满分、用户事实98%最弱的偏好类约 86%——偏好往往是以我一般更喜欢 X这种间接方式表达的这正是纯嵌入检索的难点。可选进阶混合模式 LLM 重排序需要 API Key免费基线已经很强但如果想体验完整的混合检索流水线在 450 题留出集上 R5 达 98.4% 的 hybrid_v4只需配置一个 Anthropic API Keyexport ANTHROPIC_API_KEY你的密钥 python benchmarks/longmemeval_bench.py /tmp/longmemeval-data/longmemeval_s_cleaned.json \ --mode hybrid_v4 --llm-rerankLoCoMo 也支持同样的重排序默认用 Sonnetpython benchmarks/locomo_bench.py /tmp/locomo/data/locomo10.json \ --mode hybrid --granularity session --top-k 10 --llm-rerank成本约 $0.001/题Haiku到 $0.003/题Sonnet纯可选项。看懂结果每个答案都可审计MemPalace 基准的可复现性来自三件事脚本是确定性的——同样的数据 同样的脚本每次跑出同样的结果结果文件完整落盘——benchmarks/results_*.jsonl里包含每道问题、每条检索到的文档、每个分数可以逐题审查而不只看聚合分。仓库里就提交了官方结果文件供对照例如 results_convomem_raw_top10_20260414_1649.json 和 results_locomo_hybrid_session_top10_20260414_1649.json官方内置了 50/450 训练-测试切分——lme_split_50_450.json 把 500 题切为 50 题可调优开发集 450 题只许看一次的留出集避免对着答案调参数另外可以用--embed-model bge-large等参数换更强的嵌入模型对照需先pip install fastembed。常见问题 FAQQ为什么 96.6% 全程不需要 API Key因为这些分数衡量的是检索召回率——正确答案是否出现在前 K 条检索结果里这是纯向量检索就能测的。只有端到端生成答案并打分才需要 LLM。Q跑一次要多久LongMemEval 完整 500 题约 5 分钟LoCoMo 和 ConvoMem 各约 2 分钟。建议每套都先用--limit小样本试跑确认环境无误再跑全量。Q分数和官方对不上怎么办先检查--top-k和--granularity是否与官方一致尤其 LoCoMo 的 top-k 10再确认数据集是longmemeval_s_cleaned.json清理版。脚本是确定性的参数一致则结果必然一致。Q能换 Linux/Windows 跑吗可以。只要 Python 3.9无 GPU 依赖脚本不依赖特定操作系统。关键文件索引文件用途benchmarks/README.md官方复现指南本文命令的出处benchmarks/BENCHMARKS.md完整成绩演进史与逐项分析benchmarks/longmemeval_bench.pyLongMemEval 基准脚本benchmarks/locomo_bench.pyLoCoMo 基准脚本benchmarks/convomem_bench.pyConvoMem 基准脚本总结10 分钟验证原文直存的记忆哲学复现 MemPalace 基准测试的完整路径其实非常短克隆仓库 → 装依赖 → 下载数据 → 跑三条命令。这套结果背后的核心发现也值得记住——逐字存储原文 好的嵌入模型比用 LLM 提取摘要后再检索更强因为摘要会丢掉为什么、备选方案和权衡细节而原文一条不落检索模型自己就能找到。你现在就可以在本地验证这个反直觉的结论三条命令零 API 成本。【免费下载链接】mempalaceThe best-benchmarked open-source AI memory system. And its free.项目地址: https://gitcode.com/GitHub_Trending/me/mempalace创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考