Paper Morning 2026-09-12

2026-09-12

各位早上好,Paper Morning开播了。 今天想先聊一篇特别应景的论文,叫做《Scaling Automatic Research Agents via World Models》。它讨论的是一个非常根本的问题:当我们要用强化学习去训练AI科研代理人的时候,成本到底花在哪里?作者发现了一个结构性的矛盾:科研代理人的轨迹由两部分组成——生成动作和执行环境——这两部分的计算特性完全不同。生成可以批量并行,但执行必须占用独立的沙箱和真实时间。结果就是,随着轨迹变长,环境执行成为了真正的瓶颈。这让我想到咱们AI4S领域训练神经算子的时候,何尝不是这样?训练数据生成往往才是成本大头,而不是模型本身的前向传播。这篇工作提出用世界模型来模拟执行环境,从而把成本从环境执行转移到生成侧来做批量计算,思路有点像咱们用神经网络代理PDE求解器的思路——用可学习的近似替代昂贵的真实过程。 接下来一篇很有意思,《NCP-ArchPreview》提出了一种全新的语言模型预训练目标,叫做Next Concept Prediction。传统的next-token预测是在离散token级别做自回归,这篇工作说我们可以预测“概念”,也就是跨越多个token的离散语义单元。模型先从隐藏状态中构建一个量化后的概念词表,然后用专门的Concept Module来预测未来的概念,再把这个概念反馈到token级别的生成中。这让我想起神经算子里的算子学习方法——它们也是在学习跨越整个函数空间的映射,而不是逐点预测。或许这种层次化的预训练思路,能给咱们思考PDE foundation model的训练目标一些启发:要不要预测方程的解流形,而不是单个解函数? 然后是两篇视觉智能方向的工作。《SpatialBlock》提出了一个非常聪明的想法:让LVLM通过玩堆叠积木来学习空间智能。传统方法需要大量带精细几何标注的真实场景数据,成本高且噪声大。这篇工作直接造了一个合成数据集,包含一万五千个积木堆叠问题,让模型从2D图像推理3D结构。这让我想到咱们AI4S里经常用的思想——用合成数据绕过标注瓶颈,用结构化的任务设计来诱导特定的能力。《SenseNova-U1.5》则是商汤最新的原生统一多模态模型,8B参数的MoT架构,没有编码器也没有VAE,直接在像素空间做生成和理解。他们通过patch级别的重建、4K原生分辨率、多专家蒸馏等技术,在图像保真度和复杂构成能力上取得了显著提升。这两篇放在一起看,其实都在说同一件事:如何让模型获得更本质的视觉推理能力,而不是停留在表面特征匹配。 最后一篇《AgentGrad》关注的是多智能体系统的提示词优化。现在基于LLM的多智能体系统效果很好,但每个智能体的prompt设计非常依赖人工。已有的文本梯度方法在两个环节有缺陷:一是选取目标prompt时没有验证修改是否真的能解决失败,二是提取梯度时缺少对智能体中间输出的监督。另外,梯度聚合时随机分组也忽略了智能体之间的依赖关系。AgentGrad提出了干预引导的优化框架,把反馈信号直接注入到prompt更新过程中。这篇工作让我想到咱们科学计算里的参数标定问题——有时候不是模型不对,而是初始化和约束设置不对,需要一种更智能的搜索方式来找到合适的配置。 今天聊的这五篇文章,有一个共同的暗线:它们都在处理“规模”和“表示”的关系。不管是用世界模型降低执行成本,用概念预测提升表示的层次性,用合成任务诱导空间智能,还是用干预优化提升多智能体的协作效率,背后都是一个核心问题——如何在有限计算下获得更强的泛化和推理能力。这可能也是AI4S下一步需要直面的挑战:当我们把基础模型的思路引入科学计算时,不只是简单地把模型改大,而是要重新思考什么才是科学问题里的“概念”、什么才是物理世界里的“世界模型”。好了,今天的播报就到这里,我们明天见。

本期涉及论文