ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

从一句请一步步思考到自主拆解任务:LLM规划能力的四年进化史

从一句请一步步思考到自主拆解任务:LLM规划能力的四年进化史 从一句请一步步思考到自主拆解任务LLM 规划能力的四年进化史2026 年被业界称为Agentic AI 元年。几乎所有分析师都在重复同一个判断大模型终于从会聊天走向了会干活。但很少有人说透这场跃迁背后最核心的技术变量是什么。答案藏在一个朴素的问题里如何让大模型在面对复杂任务时不再一口气蹦出答案而是学会像人一样先想清楚再动手。这就是所谓的规划能力——过去四年从一句简单的提示词prompt开始这项能力经历了四次范式级的进化每一次都是对上一次局限性的精准突破。CoT一句话开启的推理显式化故事要从 2022 年说起。在 Chain of Thought思维链出现之前LLM 回答问题的方式是端到端的接收输入直接输出答案中间没有任何可见的推理过程。这种模式对付简单问答尚可但一旦遇到需要三步以上推导的逻辑题、数学题错误率就会急剧攀升。背后的机制并不复杂Transformer 本质上是 next-token 预测机器每个 token 的生成都依赖前面所有 token。当推理过程完全隐式地发生在模型内部时跳步、误差累积几乎是必然的——你会看到模型自信地给出一个完全错误的答案因为它从来没有停下来检查过。CoT 的解决方案简单到近乎粗暴在 prompt 末尾加一句让我们一步步思考Zero-shot CoT或者给几个带有完整推理过程的示例Few-shot CoT。就是这一句话的改动让模型在 GSM8K 等推理基准上的准确率直接跃升了几十个百分点。它为什么有效因为当模型先输出推理步骤这些写下来的内容会进入上下文成为后续生成的依据——就像你在纸上演算数学题把过程写出来本身就能显著降低出错概率。但 CoT 的致命缺陷也从第一天就埋下了它只有一条推理路径。如果第一步方向就错了整条链会一路错到底没有任何纠偏机制。ToT 与 GoT从单链到树再到图Tree of Thoughts思维树在 2023 年的出现正是为了解决 CoT一条道走到黑的问题。ToT 的核心改变是把生成一条链变成探索一棵树每一步都让 LLM 同时生成 3-5 个不同的推理方向然后由模型自己或另一个评估器给每个方向打分剪掉分数低的分支只保留最有希望的路径继续深入循环往复直到得出最终答案。这本质上是把搜索算法中的生成-评估-剪枝循环引入了 LLM 推理。用一个生活类比CoT 像你做题时只想了一个解法就一路做到底ToT 则像你先列出三种可能的解题思路快速评估哪个最靠谱选最优的往下走差的直接放弃。效果是显著的在 24 点游戏、创意写作、技术方案选型这类需要探索多种可能性的任务上ToT 的准确率可以达到 CoT 的 1.5 到 2.5 倍。但代价同样直接典型配置下每层 3 条路径搜索 2-3 层ToT 的 LLM 调用次数是 CoT 的 3-5 倍如果路径更多、搜索更深成本可以飙升到 10 倍以上。ToT 解决了方向错误的问题但它的树形结构有另一个局限不同分支之间完全独立中间结论无法互相借用。这不符合人类思考的真实方式——人在处理复杂问题时一个路径上的中间发现常常可以用来辅助另一个路径的判断。几个月后提出的 Graph of Thoughts思维图把树结构换成了有向无环图允许一个推理节点接收来自任意多个前置节点的输出不同路径的中间结果可以合并、复用。最典型的例子是分别研究竞品 A 和 B再做综合对比在 ToT 的树结构里研究 A 和研究 B 是两条独立分支综合对比这个需要同时接收两个分支结论的节点无法自然表达而在 GoT 的图结构里这种汇聚是一等公民。GoT 的表达能力最接近人类复杂推理但落地复杂度极高算力消耗可达 CoT 的 10 到 50 倍。直到今天它基本还停留在学术研究阶段生产环境里很少见到真正落地的案例。Plan-and-Execute工程界真正的主力CoT、ToT、GoT 解决的都是如何让单次推理质量更高的问题。但在真实的 Agent 项目里工程师们很快发现对于需要调用多个工具、经历多个环节的长周期任务单靠优化推理链是不够的——你需要先建立全局视角。这就是 Plan-and-Execute先规划再执行模式在 2024-2025 年迅速成为工程界主流的原因。它的思路直白得像在写项目管理手册面对复杂任务不要上来就做先用一次强模型调用制定一份完整的执行计划把任务拆成若干步骤然后再一步一步执行每完成一步就检查进度必要时动态调整后续计划。具体来说这个模式有三个核心角色Planner规划器接收用户任务生成步骤清单比如第一步搜索相关资料第二步整理关键信息第三步撰写总结报告。Executor执行器按照清单逐步执行每步可能涉及工具调用或 LLM 推理。Re-planner重规划器这是最容易被忽略也最关键的一环——每完成一步都要回顾当前进展判断原计划是否仍然适用如果发现新信息或执行结果不符合预期就动态调整后续步骤。很多人会问它和 ReAct 的关系。简单来说ReAct 是思考-行动-观察的单步循环每一步都是即时决策走一步看一步适合快速应对动态变化Plan-and-Execute 则在 ReAct 之上加了一层全局编排负责做什么的整体安排。两者不是替代关系而是经常搭配使用——Plan-and-Execute 决定任务拆分和步骤顺序ReAct 负责每个具体步骤怎么执行。这种架构分离带来了一个工程上的巨大好处规划阶段可以用 GPT-4、Claude Opus 这类强模型保证方向正确执行阶段则可以用速度更快、成本更低的模型甚至小模型来提高效率两端可以独立优化成本和质量。包括 LangGraph 在内的主流 Agent 框架现在都内置了对这种模式的原生支持。2026 年的新现实混合规划成为主流时间走到 2026 年行业正在从单一规划范式走向混合规划。根据最新的技术实践主流 Agent 框架已经不再局限于某一种模式而是根据任务特性动态选择合适的规划策略。简单的、步骤在 5 步以内且没有分支的任务直接用 CoT 就够了成本最低、响应最快需要探索多种可能性但不需要多源结论合并的任务比如技术选型、创意发散ToT 仍然是性价比最高的选择而面对竞品分析、科研写作、复杂软件开发这类需要多源信息融合、多分支结论汇聚的长程任务带有动态重规划能力的 Plan-and-Execute 是目前最稳妥的方案。更前沿的探索已经在向图谱规划GraphPlan方向演进用结构化的图来表示任务依赖关系支持并行执行子任务再将结果汇聚。配合 MCP 协议的标准化落地、推理成本的持续下降以及多智能体协作模式的成熟Agent 的规划能力正在从单模型推理技巧进化为一套完整的系统工程。一个值得注意的趋势是随着 Claude Code、Codex 等 AI Coding Agent以及 Manus、Hermes 等新一代通用 Agent 框架的出现2026 年的顶尖 Agent 已经开始具备自进化能力——它们不仅能完成任务还能在执行过程中沉淀可复用的 Skill 库通过自我反思和反馈循环持续优化规划质量。写在最后选型比追新更重要回到最实际的问题在今天做 Agent 开发到底应该选哪种规划模式答案可能会让追逐前沿的人失望90% 的生产场景CoT 加 Plan-and-Execute 的组合就足够用了。CoT 几乎零成本应该作为所有任务的默认配置Plan-and-Execute 在长链路任务上提供全局视角规划与执行分离的架构也便于成本优化。ToT 适合在准确率要求极高、且确实需要多路径探索的关键环节局部使用不建议全链路铺开否则 3-5 倍的调用成本会很快吃掉你的预算。至于 GoT理解它的思想即可除非你在做前沿研究否则不必强行引入。从一句请一步步思考的 prompt hack到今天能够自主拆解任务、动态调整计划、持续自我进化的复杂规划系统LLM 规划能力的四年进化史其实也是大模型从玩具走向工具、从演示走向生产的缩影。真正重要的从来不是用上了最前沿的算法而是在精度、成本、延迟这三者的三角博弈中找到最适合你业务场景的那个平衡点。毕竟规划能力的终极目标从来不是看起来聪明而是把事做成。沿的算法而是在精度、成本、延迟这三者的三角博弈中找到最适合你业务场景的那个平衡点。
返回列表