Paper Morning 2026-09-16
2026-09-16
各位早上好,Paper Morning又和大家见面了。今天是周三,我们来聊几篇有意思的论文。
先看第二篇,PhysBrain 1.5。这篇工作试图把视觉语言模型变成一个物理基础模型,可以理解物理环境、生成动作、预测未来状态。作者的思路很直接:把语言响应、末端执行器运动和密集的视觉目标都编码成离散序列,然后用自回归的next-token预测来联合优化。这其实是一种把物理智能“压缩”进统一框架的尝试。它的预训练完全来自人类交互视频,用任务为中心的episode把语义和空间上下文与恢复的运动和后续观察配对起来,然后再通过监督微调来适应。这个工作让我想到我们领域的问题:怎么让模型理解物理规律而不是仅仅拟合数据?他们的思路是用交互数据作为监督,这和我们在PDE求解中用物理方程作为约束有异曲同工之妙,只是这里用的是“身体化”的交互经验。PhysBrain 1.5代表了一种把foundation model思想延伸到物理世界的方向,虽然它目前还比较初步,但这个方向值得关注。
再看第四篇,Grouped Value Attention。这是一篇关于推理效率的工作。大家知道KV cache是Transformer解码的主要瓶颈,内存占用随序列长度线性增长。Grouped-query attention通过共享key-value头来缓解这个问题,但每个位置仍然要存key和value。作者提出的Grouped Value Attention更进一步,只存储分组的value,然后用学习的线性映射来重建content key。在推理时,这个映射可以被吸收到query中,从而避免 materialize content key。实验显示这种表示可以把持久化cache的标量数量减少约45%到47%。这个工作对我们在意的事情有什么关系呢?大家想,如果我们用大模型来做科学计算推理,比如让模型生成PDE的求解步骤或者提供多步推理的context,序列长度可能会非常长。这种高效的cache机制就能派上用场。它不是直接针对科学计算的算法改进,但属于基础设施层面的优化,而且思路很巧妙,值得我们记住。
第一篇ZGCM-1也值得关注。这是一个完全开源的7B dense基础模型,训练策略强调极端的数据、系统、算法效率。作者的核心主张是:紧凑的模型无法被动地记忆开放网页,但可以通过将内部思考与外部工具使用耦合来克服参数容量的限制。为了支持256K上下文,他们开发了端到端的高效训练方案,包括交错门控滑动窗口和全注意力机制,以及稳定的FP8 Muon优化器,还有一个有意思的点是,他们把交互轨迹重新表述为马尔可夫决策过程来进行中间训练。这篇论文虽然在数学和Agent搜索的背景下展开,但它背后的“紧凑模型+工具调用”范式,对于我们做科学计算的人其实有启发:我们能不能让小的科学基础模型通过调用外部求解器或者知识库来弥补容量的不足?这是一个值得思考的方向。
第五篇RSIAgent提出了一个无需训练的多Agent框架,用于在新环境中的递归自我改进。它协调课程Agent、Actor Agent和验证Agent来持续探索环境、验证结果并保留环境特定的知识,还采用了“先广后深”的探索策略。这个工作的意义在于展示了一种让AI Agent自主适应新环境的能力。如果把这个思路迁移到科学发现中,或许可以帮助我们构建能够自主探索化学空间或者物理参数空间的Agent系统。当然目前它还处于比较早期的阶段,但跨领域的联系是值得注意的。
今天这几篇论文有一个共同的潜在主题:无论是物理基础模型、推理效率优化、还是自主探索的Agent,都在试图回答同一个问题——怎么让有限的模型能力做更多的事情?PhysBrain 1.5用的是多模态融合和身体化交互,Grouped Value Attention用的是更紧致的表示,ZGCM-1用的是内部思考加外部工具的耦合,RSIAgent用的是多Agent协作。这其实反映了当前AI发展的一个大趋势:从单纯scale模型参数,转向scale能力、scale效率、scale交互方式。对于我们做AI for Science的人来说,这个趋势意味着什么?或许我们需要思考的不只是更大的PDE求解器,而是如何让模型更好地调用物理知识、更好地与科学计算工具协作、更好地适应新的科学问题。这就是今天的观察,供大家参考。