ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

DeerFlow 把 Agent 的壳扒了

DeerFlow 把 Agent 的壳扒了 DeerFlow 把 Agent 的壳扒了70K Star 的 Super Agent Harness从会聊到真干活钩子上周我让某个 Agent 框架帮我写个爬虫它跑了三分钟特自信地回我「搞定了」。我兴冲冲打开看——依赖没装、代码没提交、连测试都没跑。说白了这不是模型拉胯是这层「壳」只让你看见聊天框背地里到底有没有真正的手你根本看不见。2026 年 8 月字节的 DeerFlow 2.0 冲到了 70K Star。它干的事很简单也很狠把 Agent 的聊天框外壳扒了露出底下那套能读写文件、能跑沙箱、能记长期记忆的运行内核。这篇文章拆的就是这套内核。一、从「会聊」到「真干活」讲道理现在市面上九成的 Agent 还停在「你问一句我答一句顺手调个 API」的阶段。DeerFlow 2.0 偏不这么玩。它从零重写的README 里直接写了一句大实话跟 1.x 一行代码都不共享。人家把定位从 Deep Research 框架直接抬成了Super Agent Harness——说白了一个能让 Agent 真正把活干完的运行时。1.x 和 2.0 的差距不是参数微调是物种级别的维度DeerFlow 1.xDeerFlow 2.0定位Deep Research 框架Super Agent Harness能力搜索 → 阅读 → 总结沙箱执行 记忆 技能 子 Agent任务类型单次研究报告分钟到小时级长任务输出Markdown 报告文件、网站、PPT、代码、图片、视频架构脚本串联三层架构 14 层中间件一句话1.x 是「告诉你怎么做」2.0 是「直接做给你看」。中间差的不是模型是一整套运行环境。二、三层架构 14 层中间件DeerFlow 2.0 建在 LangGraph LangChain 上代码严格分成两层deerflow.*能发布的框架包和app.*不发布的应用代码。硬规则很干脆App 能 import deerflowdeerflow 绝不能反向依赖 App——这条边界由 CI 强制谁都别想破。这架构里最让我感兴趣的是那 14 层中间件。不是平铺的拦截器是严格排好序的洋葱模型顺序直接写死在代码注释里——你敢颠倒一下真会出 bug。举个例子SandboxMiddleware要用thread_id而thread_id是ThreadDataMiddleware注入的。洋葱模型「进去时由外到内、出来时由内到外」的特性让外层在退出阶段能读到内层刚塞进去的数据。这顺序不是靠文档口头约定是靠执行模型本身保证的。LoopDetection滑动窗口 hash 检测重复工具调用和SubagentLimit默认并发 3这俩是生产环境的关键防线。没有它们Agent 轻则陷入死循环重则并发炸成一片。三、子 Agent 并发不让 LLM 做它不擅长的事复杂任务不适合一次性处理。DeerFlow 的解法很直接拆。Lead Agent 调个task_tool动态拉起一堆子 Agent各自有独立上下文、工具、终止条件能并行就并行。关键工程点在于轮询对 LLM 是无感的。传统 multi-agent 让 LLM 自己轮询「任务完了没」既烧 token 又容易走神。DeerFlow 把轮询整个封装进task_tool内部对 LLM 来说task()就是个同步调用发出去结果回来。它根本不需要知道子任务跑了多久更不会因为轮询产生额外推理成本。还有个狠细节子 Agent 被硬编码了subagent_enabledFalse——拿不到task工具没法派生孙 Agent。这是防递归的硬闸断得干干净净。四、补充开源圈的「水电煤」你以为就 DeerFlow 在搞这套还真不是。2026-08-03 那天我刷 GitHub Trending前 15 名里 8 个是 AI Agent 项目占 53%。而且它们不全做同一件事是均匀铺开了 Agent 基础设施的三层Skills技能标准化、Radio协作通信、Memory团队记忆——这三层就是 Agent 时代的「水电煤」可复用、可组合谁都绕不开。当基础设施开始分层说明一个领域真的成熟了。五、harness 在演化从静态到自演化再把镜头拉远点看。2026 年这波 Agent 工程化脉络其实特别清楚Anthropic 那篇《Building a C compiler…》把多 Agent harness 推到了真实长任务的极限16 个并行 Claude 实例近 2000 次 Claude Code session$20000 API 成本写出能编译 Linux 6.9 的 10 万行 Rust C 编译器。核心经验不是模型多强是 harness 设计——用current_tasks/写文件抢锁防止两个 Agent 撞同一个任务让 Agent 在容器里自己定向。更前沿的是 Living-HarnessarXiv 2607.26598。它盯着一个真问题静态 harness 部署后就不改了导致同类失败跨任务反复出现。它的解法是把每次执行轨迹 评测信号转成后验证据写两种程序性知识——episodic memory触发条件 / 失败模式 / 恢复动作和 state graph状态节点 / 修复边 / 转移规则。工具与基础上下文冻结程序性修复跨周期累积。8 个交互环境上Living-Harness 把平均 Pass1 比最强基线提升了 10.07 和 9.91 个百分点。这说明 harness 本身正在从「静态配置」变成「能累积经验的状态机」。作者观点我的判断2026 年 Agent 的竞争焦点已经不在「模型谁更强」而在「谁给 Agent 穿上了能干活的执行环境」。DeerFlow 2.0 真正的创新不是 LangGraph 编排本身是把沙箱、记忆、技能、子 Agent 当成一等公民塞进运行时大多数只会「聊天框 工具调用」的框架本质是裸奔。这话可证伪——如果未来半年涌现的 killer Agent 应用大多基于裸聊天框而不是完整 harness那我就错了。但目前的信号70K Star、Anthropic 的极限工程、Skills/Radio/Memory 分层全都指着 harness 工程化这条线。小结今晚就能做的把你正在用的 Agent 框架扒开来数——它有真沙箱隔离吗有跨会话记忆吗有技能系统吗三条缺两条它就在裸奔。这周能做的读一遍 DeerFlow 2.0 的 14 层 Middleware 顺序重点看 LoopDetection 和 SubagentLimit 怎么挡死循环和并发爆炸。看趋势必看的arXiv 2607.26598Living-Harness——harness 从静态配置走向自演化状态机这是下一个半年最值得盯的方向。互动段你手头的 Agent 项目是穿了衣服还是裸奔评论区说一声下一篇我可以挑一个你们常用的框架照着 DeerFlow 这套标准拆一遍看看它到底几斤几两。来源字节 DeerFlow 2.0 源码拆解14 层 Middleware、Sub-Agent 并发、结构化记忆 —— 掘金核心工程素材中文一手DeerFlow 2.0 深度拆解字节 70K Star 的 Super Agent Harness —— cnblogs总览与三层架构中文一手Building a C compiler with a team of parallel Claudes —— Anthropic 工程博客16 并行 Claude 真实长任务GitHub Trending 前 15 有 8 席是 AI AgentSkillsRadioMemory 成水电煤 —— CSDN基础设施分层视角中文一手Living-Harness Is an Interactive-Agent Evolver —— arXiv 2607.26598自演化 harness 学术支撑
返回列表