ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

LLM 与世界模型:从“会说话“到“会理解世界“-Day27

LLM 与世界模型:从“会说话“到“会理解世界“-Day27 2024 年大语言模型LLM让 AI 学会了写作、编程和对话。2026 年Yann LeCun 离开 Meta融资 10.3 亿美元创立 AMI Labs宣称LLM 将在 3-5 年内过时。一、两个世界的分野LLM 与世界模型1.1 LLM精通语言的文科生大语言模型如 GPT-5、DeepSeek-V4、Claude 4的核心机制极其简单预测下一个 token。通过在数万亿文本 token 上训练模型学会了语言的语法、风格、知识关联和逻辑结构。LLM 的能力边界✅ 写作、翻译、代码生成、知识问答✅ 抽象推理、概念组合、数学证明配合 CoT❌ 无法理解杯子掉落会碎背后的物理因果❌ 无法区分客观现实与主观信念❌ 缺乏对连续时空动态的直观把握正如李飞飞教授所言“大语言模型的核心是 ‘Saying things’而具身世界模型的核心是 ‘Seeing and doing things’。”1.2 世界模型精通物理的理科生世界模型的核心定义来自强化学习之父 Richard Sutton1990“一个黑箱输入当前状态和即将执行的动作输出对下一个状态的预测。”用公式表达f(观察, 动作) → 下一状态。世界模型不预测下一个词而是预测物理世界的下一个状态。它通过观察视频、传感器数据、仿真环境学习重力、摩擦、碰撞等物理规律物体的时空连续性和身份保持因果链“如果我推这个杯子它会掉下去并碎掉”关键能力想象推演Imagined Rollouts在内部做梦模拟未来无需真实试错模型预测控制MPC在想象中评估不同动作序列的后果选择最优策略惊喜量化当预测与现实不符时识别出分布外OOD场景触发安全机制二、核心差异符号 vs 物理维度LLM大语言模型世界模型World Model核心问题下一个词是什么下一个状态是什么训练数据文本、代码、知识离散符号视频、传感器、仿真环境连续信号学习对象语言的统计分布和语义关联物理规律、时空动态、因果关系世界表征基于人类创造的抽象符号系统基于客观连续的物理现实典型输出文字、代码、结构化答案未来状态预测、仿真场景、机器人控制信号优势知识面广、交互自然、易于操控物理直觉强、可安全内部模拟、适合实体应用核心风险幻觉、事实错误、缺乏物理常识物理不一致、仿真到现实失配、动作失败一个通俗的类比是LLM 像文科生擅长语言、知识、沟通和组织概念世界模型像理科生关心空间、时间、运动、光线、声音、材料和因果变化。三、关系本质互补而非替代3.1 LLM 是世界模型的语言接口世界模型擅长物理模拟但不擅长与人类沟通。LLM 可以将世界模型的内部状态翻译成人类可理解的语言或将人类的自然语言指令转化为世界模型可执行的动作计划。在具身智能Embodied AI系统中典型的架构是LLM 负责高层规划理解人类意图分解任务步骤世界模型负责底层执行预测每个动作的后果选择最优控制信号3.2 世界模型是 LLM 的物理底座当前 LLM 的一个根本缺陷是缺乏 grounding接地。它知道苹果会掉下来这句话但从未看到过苹果掉落的物理过程。世界模型可以为 LLM 提供物理常识基础重力、惯性、材料属性等因果验证机制LLM 的推理是否违背物理规律状态跟踪能力在多智能体交互中维护客观世界状态研究表明LLM 可视为在文本世界中训练出的一个不完整且不精确的世界模型——它捕捉了语言描述中的世界模式但缺乏对物理现实、感官体验和真实因果的直接建模。3.3 融合趋势从 VLA 到 WAM2026 年具身智能领域正在经历从VLAVision-Language-Action到WAMWorld-Action Model的范式转移。VLA看Vision→ 理解语言Language→ 执行动作Action但缺乏对动作后果的预测WAM理解物理因果 → 在内部模拟动作后果 → 选择最优动作实现了真正的知行合一四、DeepSeek 的启示当推理模型遇到世界模型的边界4.1 DeepSeek-R1 的社会推理困境DeepSeek-R1 在数学和代码推理上表现卓越但在社会推理任务中暴露出深层局限。浙江大学的研究团队通过分析 R1 的推理轨迹发现“LLM 在处理涉及多个参与者和时间线的场景时频繁遇到推理僵局倾向于输出’tricky’、confused’等矛盾术语导致错误推理或无限循环。核心问题是它们无法区分客观现实与智能体的主观信念。”这正是 LLM 缺乏世界模型的典型症状R1 可以完美执行数学证明但在小明以为小红知道…这类需要维护多个心智状态Theory of Mind的任务中因为没有内部的世界状态跟踪器而迷失。4.2 世界模型增强 LLM 的解决方案同一研究团队提出了自适应世界模型增强推理机制构建动态文本世界模型跟踪实体状态和时间序列监控推理轨迹中的困惑指标及时干预提供清晰的世界状态描述实验结果显示该方法在 Hi-ToM 等社会推理基准上准确率提升10%同时 token 消耗降低33.8%。这一发现意义重大即使对于以文本为载体的推理任务引入显式的世界状态跟踪也能显著提升 LLM 的表现。世界模型不仅是机器人需要的东西也是 LLM 突破自身瓶颈的钥匙。这正是世界模型与推理模型融合的想象空间一个既能进行长链符号推理又能进行物理直觉验证的混合系统。五、行业格局十亿美元赌注与两条路线5.1 LeCun 的叛逃从 LLM 到世界模型2026 年初图灵奖得主 Yann LeCun 离开工作 12 年的 Meta创立AMI Labs融资10.3 亿美元估值 35 亿美元目标只有一个建造通用世界模型。LeCun 的核心论点 blunt 而尖锐“我们永远不会仅仅通过文本训练达到人类水平的智能。LLM 本质上只是模式匹配系统没有真正的理解能力。它们可以在 3-5 年内变得过时。”他的技术路线是JEPAJoint Embedding Predictive Architecture——不预测像素而是预测潜在表示空间 latent space中的变化。V-JEPA 2 在 100 万小时互联网视频上预训练仅用 62 小时机器人交互数据微调就在零样本机器人操作任务上达到~80% 成功率。5.2 世界模型的两大阵营2026 年的世界模型领域分裂为两个哲学阵营阵营代表核心思想优势场景压缩理解派JEPA、Dreamer、V-JEPA 2预测潜在表示不浪费算力在无关纹理上机器人规划、推理、控制渲染预测派Genie 2、Sora、Cosmos逐帧生成像素级未来场景交互式世界生成、仿真、创意LeCun 属于前者他的联合创始人 Saining XieDiT 架构作者直言“目标不是生成漂亮的视频而是理解世界。”六、未来展望从文科生理科生到工科生6.1 三层智能架构未来的通用人工智能AGI很可能不是单一的 LLM 或世界模型而是一个三层架构层级角色类比代表技术感知层理解物理世界理科生世界模型JEPA、Genie认知层组织知识、推理规划文科生LLMDeepSeek、GPT执行层在真实环境中行动工科生物理 AI / 具身智能正如科学网文章所指出的“把大语言模型与世界模型结合到机器人、自动驾驶和工业智能体中则更像’工科生’既能理解人的意图又能预测物理后果还能在真实或仿真环境中执行任务。”6.2 关键挑战尽管前景光明世界模型与 LLM 的融合仍面临三大挑战数据稀缺高质量物理交互数据机器人动作、触觉、多视角视频远比文本数据难获取长时程一致性短片段中保持物体身份已不容易多步任务中的因果链更难维持仿真到现实的鸿沟Sim-to-Real Gap在虚拟世界中学到的物理规律能否迁移到真实世界七、实践选型指南场景推荐方案理由文本生成、知识问答、代码编写纯 LLMDeepSeek-V4语言能力强成本低生态成熟数学/逻辑推理纯符号推理模型DeepSeek-R1CoT 自我验证准确率最高机器人操作、自动驾驶世界模型 LLM 混合需要物理预测 语言理解多智能体社会推理如博弈、谈判LLM 显式世界状态跟踪维护信念状态避免推理混乱创意内容生成视频、3D 场景渲染派世界模型Genie 2生成可交互的虚拟世界工业仿真、数字孪生压缩派世界模型JEPA高效预测适合控制决策结语不是取代而是补全LLM 与世界模型的关系不是谁杀死谁的零和博弈而是智能的两个支柱。LLM 让 AI 掌握了人类文明的符号遗产——语言、知识、逻辑世界模型让 AI 获得了物理世界的因果直觉——空间、时间、力、运动
返回列表