irstResearch:大模型科研应用先把“研究问题本身”做成可审计对象
7月6日发布的FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents,关注科研智能体最前端但常被忽略的问题:大模型提出的研究问题可能语言新颖、结构完整,但缺少明确机理、可证伪假设和决定性实验。
[2607.05682] FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents
方法
该框架要求智能体在提出研究问题时同步生成一份Research Question Certificate,其中包括:
- 基本概念定义;
- 前提假设;
- 可能的作用机理;
- 现有理论或结果中的矛盾;
- 可证伪假设;
- 最小决定性试验;
- 假设失败后的更新规则。
即把:
“这个选题看起来有创新”
转变为:
“这个选题的机理、证据和证伪路径是什么
实验结果
研究在10类LLM科研智能体主题上进行评价。在以DeepSeek作为盲评模型的主实验中,FirstResearch优于多种提示式基线;使用Gemini 2.5 Flash重新评分时,系统排名保持一致,FirstResearch平均得分为4.86/5,最强基线为4.38/5。移除证书后,评分在两个评审模型下均降至1/5以下。
局限性
评价主要依赖大模型评审,而非不同学科的真人专家;研究主题数量也较少,因此尚不能证明其生成的问题具有更高的真实科研产出率。
自动驾驶长尾仿真:让大模型控制周围交通参与者生成可交互危险场景
7月5日发布的Agent-driven Long-tail Simulation for Autonomous Driving,针对自动驾驶闭环测试中过度依赖日志回放和规则车辆、长尾行为覆盖不足的问题,提出用指令驱动的大语言模型控制周围交通参与者。
[2607.04331] Agent-driven Long-tail Simulation for Autonomous Driving
方法
在该框架中,周围车辆和道路参与者不再只执行固定规则,而是接收语言指令,例如:
- 在保证物理可行性的情况下突然并线;
- 犹豫后进入主路;
- 与自车进行交互博弈;
- 执行具有明确语义的长尾行为。
大模型通过结构化动作接口输出行为,并受到车辆动力学和交通规则约束。
研究还提出SemanticPlan基准,在真实nuPlan场景基础上加入多个具有语言指令的交互式智能体,用于评价闭环规划器在语义丰富长尾场景中的表现。实验表明,当前先进规划器在这些场景中仍难以持续安全完成任务。
创新性
传统仿真主要改变道路、天气或车辆初始位置;该方法进一步生成:
具有意图、交互性和反应能力的动态长尾行为
因此更适合测试VLA和端到端驾驶系统的推理与决策能力。
对智能检测装备的启发
检测机器人和巡检车同样存在长尾场景:
- 行人突然进入检测区域;
- 前方存在未建模障碍;
- 天线或探头短暂失联;
- 光照突然变化;
- 路面积水或粉尘影响传感器;
- 机械臂接近结构时目标移动或遮挡;
- 病害置信度与传感器质量发生冲突。
可使用大模型智能体生成这些语义场景,在仿真中测试巡检系统是否能:
- 降速或停车;
- 切换传感器;
- 重新规划测线;
- 请求人工接管;
- 保留未完成区域;
- 生成异常处置记录。
需要注意,语言生成行为必须经过动力学、安全规则和碰撞约束,不能让大模型直接自由控制设备。