0723 LLM在科研和无人驾驶进展

📅 2026/7/24 11:21:56 👁️ 阅读次数 📝 编程学习
0723 LLM在科研和无人驾驶进展

irstResearch:大模型科研应用先把“研究问题本身”做成可审计对象

7月6日发布的FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents,关注科研智能体最前端但常被忽略的问题:大模型提出的研究问题可能语言新颖、结构完整,但缺少明确机理、可证伪假设和决定性实验。

[2607.05682] FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents

方法

该框架要求智能体在提出研究问题时同步生成一份Research Question Certificate,其中包括:

  • 基本概念定义;
  • 前提假设;
  • 可能的作用机理;
  • 现有理论或结果中的矛盾;
  • 可证伪假设;
  • 最小决定性试验;
  • 假设失败后的更新规则。

即把:

“这个选题看起来有创新”

转变为:

“这个选题的机理、证据和证伪路径是什么

实验结果

研究在10类LLM科研智能体主题上进行评价。在以DeepSeek作为盲评模型的主实验中,FirstResearch优于多种提示式基线;使用Gemini 2.5 Flash重新评分时,系统排名保持一致,FirstResearch平均得分为4.86/5,最强基线为4.38/5。移除证书后,评分在两个评审模型下均降至1/5以下。

局限性

评价主要依赖大模型评审,而非不同学科的真人专家;研究主题数量也较少,因此尚不能证明其生成的问题具有更高的真实科研产出率。

自动驾驶长尾仿真:让大模型控制周围交通参与者生成可交互危险场景

7月5日发布的Agent-driven Long-tail Simulation for Autonomous Driving,针对自动驾驶闭环测试中过度依赖日志回放和规则车辆、长尾行为覆盖不足的问题,提出用指令驱动的大语言模型控制周围交通参与者。

[2607.04331] Agent-driven Long-tail Simulation for Autonomous Driving

方法

在该框架中,周围车辆和道路参与者不再只执行固定规则,而是接收语言指令,例如:

  • 在保证物理可行性的情况下突然并线;
  • 犹豫后进入主路;
  • 与自车进行交互博弈;
  • 执行具有明确语义的长尾行为。

大模型通过结构化动作接口输出行为,并受到车辆动力学和交通规则约束。

研究还提出SemanticPlan基准,在真实nuPlan场景基础上加入多个具有语言指令的交互式智能体,用于评价闭环规划器在语义丰富长尾场景中的表现。实验表明,当前先进规划器在这些场景中仍难以持续安全完成任务。

创新性

传统仿真主要改变道路、天气或车辆初始位置;该方法进一步生成:

具有意图、交互性和反应能力的动态长尾行为

因此更适合测试VLA和端到端驾驶系统的推理与决策能力。

对智能检测装备的启发

检测机器人和巡检车同样存在长尾场景:

  • 行人突然进入检测区域;
  • 前方存在未建模障碍;
  • 天线或探头短暂失联;
  • 光照突然变化;
  • 路面积水或粉尘影响传感器;
  • 机械臂接近结构时目标移动或遮挡;
  • 病害置信度与传感器质量发生冲突。

可使用大模型智能体生成这些语义场景,在仿真中测试巡检系统是否能:

  • 降速或停车;
  • 切换传感器;
  • 重新规划测线;
  • 请求人工接管;
  • 保留未完成区域;
  • 生成异常处置记录。

需要注意,语言生成行为必须经过动力学、安全规则和碰撞约束,不能让大模型直接自由控制设备。