ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

215⭐ 当日最高论文:让机器人「先点屏幕再走路」,TAMP-Nav 9 步到终点,零样本真机跑通

215⭐ 当日最高论文:让机器人「先点屏幕再走路」,TAMP-Nav 9 步到终点,零样本真机跑通 215⭐ 当日最高论文让机器人「先点屏幕再走路」TAMP-Nav 9 步到终点零样本真机跑通Hugging Face 每日论文2026-08-19 精选一台从没在真实世界里走过的机器人把房间拍下来、看一眼你要它去哪、然后在屏幕上「点一个像素」、再让底下那层 SLAM 控制器替它走过去——它就真的走对了。浙江大学软件技术学院联合浙江人形机器人创新中心的团队 8 月 18 日挂出的 TAMP-Nav论文 arXiv:2608.17512标题 Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation在 Hugging Face 每日论文当天拿下 215 颗星的全场最高分。这个数字不是刷出来的它在 R2R-CE 这个具身导航最权威 benchmark 上用 90k 条训练轨迹把成功率堆到了 66.2%平均每条任务只走 9 步对比前一代 SOTA 的 30 步、每次 Chain-of-Thought 调用减少 73.7%、推理时间压到 16.58 秒一条任务对比 DualVLN 的 41.46 秒。而更离谱的是最后这条这个策略从来没有在真实机器人上微调过直接在真实室内外场景里就跑通了。一件反直觉的事让 VLM「少做决定」比「多推理」更重要过去两年具身导航的默认范式是让大视觉语言模型VLM「想得越细越好」给它 3D 占据栅格、给它候选动作空间、让它在每个时间步都做一次 chain-of-thought再让它输出 6 自由度运动指令。但浙大团队观察到一个被忽视的事实VLM 在 ImageNet 和 LAION 上预训练时看到的全是 2D 像素和文字要它输出「向前 1.2 米、左转 30 度」这种 3D 数值动作实际上是在逼一个 2D 模型做它不擅长的事。与此同时每一步都强制推理又把计算资源浪费在「没什么可想的简单路段」上。TAMP-Nav 整个框架就是从这个观察出发的把「VLM 应该做什么」这件事重新设计让它做自己最擅长的事——看图、选点。剩下的 3D 几何、低层控制全部外包给一个成熟的 SLAM 控制器。这样做不是「弱化 VLM」而是「把对的活交给对的人」。Point让 VLM 在图像上「点一个像素」传统的具身导航让 VLM 输出动作序列比如「forward 0.5, turn-left 30」这种。但 2D 预训练的 VLM 在数值精度上很弱在像素空间里却几乎是无损的——给它一张图让它在图上「点一个像素」要它去的位置它能做到像素级的精准。TAMP-Nav 把这件事叫做 Pixel-to-3D Action Formulation。VLM 只做一件事在当前视角下点一个像素带可选的视觉提示文本比如「往前走到那个拐角」。这个像素点的 2D 坐标通过相机内参和深度图反投影到 3D 空间得到一个 3D 目标点坐标。再后面那一步是 SLAM 控制器的活——用经典的路径规划 控制器把机器人平滑地送到这个 3D 点。这种「VLM 选点 SLAM 控位」的拆分让训练和推理两端都更轻量。训练时不需要再学 3D 占据栅格或轨迹控制VLM 学的是一个视觉 prompt-grounding 任务。推理时每一步的 VLM 前向计算量也大幅下降因为输出从「一串动作 token」缩成了「一个像素坐标」。Think Memorize只在「关键时刻」才推理、只记「高保真锚点」Point 解决了「VLM 输出什么」但还有一个问题要不要每一步都让 VLM 做 chain-of-thought答案是不要。TAMP-Nav 提出了 Selective Reasoning——只在「关键决策点」比如走廊尽头出现分岔、要转弯、要穿过窄门才触发 CoT常规直行路段直接跳过推理。这种「按需思考」的策略让 CoT 调用次数直接砍掉了 73.7%换来的是推理速度翻倍。记忆这一侧的传统做法是把整条历史轨迹都存下来机器人每走一步就堆一帧长任务跑下来显存 / KV cache 直接爆掉。TAMP-Nav 的 Anchor-Trajectory Memory 设计了一个巧妙的二元结构在「关键时刻」保存高保真的原始视觉观察作为「锚点」在「常规路段」只保留一个叫 Space-Time Indicators 的轻量级摘要只记录时间戳和当前位置用作空间感知。当 VLM 需要回溯历史时锚点负责精确回放指示器负责粗粒度的时空感。这两件事加起来让 TAMP-Nav 在 R2R-CE 上平均每条任务只要走 9 步就能到终点而 DualVLN 和 StreamVLN 这些前一代 SOTA 模型需要 30 步左右。在 A800 单卡上每条任务的端到端时间是 16.58 秒比 StreamVLN 的 37.47 秒和 DualVLN 的 41.46 秒快了不止一倍。Align用 GRPO 把全局奖励和过程奖励叠起来强化学习微调阶段是 TAMP-Nav 拿到 SOTA 的最后一击。论文用 GRPOGroup Relative Policy Optimization做 Two-Level Alignment——把全局的成功 / 失败奖励任务是否完成和细粒度的过程奖励每一步选点是否合理、是否触发不必要的 CoT叠在一起做密集监督。对比实验里有一个很有说服力的数字只用 SFT 微调的版本在 R2R-CE 上是 55.7%加上 GRPO 之后就涨到 66.2%。这一截提升对应的不是「更好的标注数据」而是「更合理的优化信号」——纯 SFT 只奖励「最终到对地方」GRPO 还奖励「中间过程按需思考、按需记忆」。这种「对过程也打分」的做法让 VLM 学到了「什么时候该想、什么时候该闭嘴走」的策略而这正是过去纯 SFT 模型一直学不会的事。数据效率从 3.37M 条轨迹降到 90k 条另一个让人意外的数字是训练数据量。NavFoM 用了 3.37M 交互数据DualVLN 用了 763k 条轨迹TAMP-Nav 只用 90k 条训练轨迹折合约 700k 次交互就拿到了 SOTA。三组数字放在一起看意义很明确四倍以上的训练数据量并不等于更好的导航策略决定性因素是训练信号的设计而不是数据规模。90k 这个量级对研究者是个好消息——意味着任何一个实验室只要攒一份百万级以下的导航交互数据就能复现并继续优化这条路线。论文也把训练曲线放在附录里可以直接看 GRPO 是怎么从 SFT 的 55.7% 起步爬到 66.2% 的。这台机器人真的「在真实世界里」跑过最关键也最容易被忽略的一点是TAMP-Nav 没有任何在真实机器人上的微调。论文在附录里做了 zero-shot 真实环境部署室内家庭、办公室和室外校园场景都做了测试论文页和附录里能看到机器人实际跑通的几段轨迹和成功率统计。这件事之所以重要是因为 VLM-based 导航模型长期以来都卡在「sim-to-real gap」上——仿真里跑得很好的策略一到真实机器人就废要么因为传感器噪声、要么因为光照变化、要么因为真实世界的物体摆放比仿真复杂得多。TAMP-Nav 能 zero-shot 跑通意味着它的策略学到的不是「仿真环境里的捷径」而是真的可迁移的视觉 grounding 空间推理能力。这对想真正落地具身导航的团队是一个关键信号。局限和待验证9 步规划不是万能解药论文自己承认了几条边界。第一目前 TAMP-Nav 只在 VLN-CE 这一类静态室内外导航任务上训练动态环境人来人往、宠物、家具临时移动下的表现还没有数据。第二真实机器人 zero-shot 部署的样本数还不算大论文里给出的是定性轨迹和总体成功率没有大规模量化指标。第三Point 阶段依赖 SLAM 控制器的稳定表现对深度相机失效或低纹理场景白墙走廊、长直隧道的鲁棒性还没充分验证。另外9 步规划这件事在「路网结构清楚、可见即可达」的导航任务上是巨大优势但在「需要绕远路、需要在多个目标点之间折返」的复杂任务上是不是仍然最优论文没有展开对比。为什么这篇值得读者现在就去看215 颗星的当日最高分只是一层表象。论文真正值得关注的是它给具身导航指出了一条「分工明确」的工程路线VLM 干它最擅长的视觉 groundingSLAM 干它最擅长的几何控制强化学习干它最擅长的策略优化。这种分工不是简单的「多模块拼装」——Point、Think、Memorize、Align 四步每一步都围绕「VLM 该做最少的事」这个核心判断展开。对 AI 爱好者来说这是 2026 年 8 月最值得读的一份「机器人导航到底进步到哪里」的实证材料。对研究者来说GRPO 在具身任务上的过程奖励设计值得细读 §5.2那段关于「全局 outcome 细粒度 process」的奖励叠加是少有的、把 RL 在 LLM 上的成功经验迁移到机器人导航的干净案例。对工业团队来说zero-shot 真机部署这件事意味着如果你的机器人已经有了一套靠谱的 SLAM 视觉感知栈可以直接接入 TAMP-Nav 的策略不需要再做任何真实数据采集。
返回列表