Paper Morning 2026-10-09
2026-10-09
各位早上好,Paper Morning又和大家见面了。
今天想先从一个更大的话题聊起。我们都知道,这两年AI for Science里有个很热门的方向叫foundation model,从Neural Operator到PDE求解器,大家都在讨论预训练范式能不能迁移到科学计算。但今天我看到的几篇论文,反而让我觉得有一个被忽视的维度正在浮出水面,那就是:如何让AI模型真正理解物理世界的时间和空间结构。这事儿不只关乎机器人,也关乎我们怎么构建更可靠的科学模型。
先看第一篇,UniWAM,标题叫统一世界-动作模型。这篇文章试图解决的问题,我觉得正好戳中了很多做物理模拟的人的痛点:现在的视觉-语言-动作模型,往往只能从纯文字或者纯视觉的监督信号里学习,但它缺了一种对物理世界动态的直觉。而反过来,那些做世界模型的研究,虽然能从视频生成里学到时空先验,却在语义理解和推理上很弱。作者的做法是把物理推理器、世界生成器和动作预测器三者合一,让它们互相制约、互相增强。我看到这儿的时候在想,这不就是我们一直想要的PDE求解器和神经网络结合的那个影子吗?以前我们老说物理信息神经网络是在“约束”网络,但真正能像这样把物理推理能力嵌到模型架构里,让它自己学会什么是因果、什么是交互,其实还不多见。这篇文章的思路值得做neural operator的朋友仔细看看,他们怎么定义“物理推理器”这一层,可能对我们思考operator learning里的结构化先验有启发。
第二篇 Self-Retrospection Distillation,讲的是强化学习里一个很微妙的问题。大家知道RLVR,就是基于可验证奖励的强化学习,它的特点是只有在任务完成后才能给一个标量反馈。但如果一群rollout都成功了,或者都失败了,这个信号就变得很弱,区分不出谁好谁坏。这篇文章就问了一个反向的问题:能不能用 hindsight,也就是事后的经验,去教agent在事前应该有什么样的前瞻?作者把它叫做前瞻学习,用一种叫做自省蒸馏的方法来实现。说实话,我读到这儿的时候,首先想到的不是机器人,而是我们训练科学计算模型时候的一个常见困境:我们有大量的数值模拟数据,但它们都是“事后”的结果,我们能不能让模型在“事前”,也就是看到初始条件的时候,就能够预判这个系统会怎么演化?这篇论文给了一个思路,用已完成轨迹里隐藏的知识来监督预测,这其实和我们在做的事后误差分析、或者用神经网络学习演化规律的方向是一致的。方法本身不算复杂,但这个视角我觉得很聪明。
然后第三篇 Tetris3D,这个名字起的很有意思,做的是3D场景生成,但特别强调生成的对象之间要物理兼容、几何契合。大家知道传统的方法往往是独立生成各个物体,再想办法把它们拼到一起,但这就很难保证它们之间的物理关系是合理的。这篇文章的思路是,每个物体的生成都要以周围物体的几何和物理关系为条件,用一个物理模拟器来保证生成的场景是自洽的。作者还做了一个很大的数据集,叫ComOb,有120万个场景,每个都带物理交互信息。我看到这儿的时候,第一反应是:这不就是一个“物理世界”的benchmark吗?它和我们在AI4S里做的那些物理仿真benchmark,本质上要做的事情是一样的,都是为了给模型提供一个可信的、符合物理规律的训练和测试环境。只是他们关注的是宏观的物体交互,我们关注的是微分方程的数值解。这个数据集的规模和方法,可能对那些做物理信息生成模型的人有参考价值。
今天的几篇文章看下来,我有一个比较深的感受:虽然它们各自所在的领域不同,有的做机器人,有的做RL,有的做3D生成,但它们都在做同一件事,就是把物理世界的结构和约束,嵌到模型的内部去。这可能比单纯扩大模型规模、堆数据更加本质。因为科学计算最终要回答的问题,不是“这个模型能不能生成看起来像真的东西”,而是“这个模型能不能抓住支配系统演化的那些根本规律”。当我们看到物理推理、世界模型、几何相干性这些概念在不同的研究里反复出现,我觉得这预示着一个趋势:未来的AI for Science模型,可能需要更多地显式建模物理结构,而不是仅仅依靠大数据和大模型来“隐式”学到这些规律。这对我们在operator learning、physics-informed learning方向的工作,其实是一个很有力的方向指引。
好了,今天的播报就到这里,我们明天早上见。