Paper Morning 2026-09-26

2026-09-26

各位早上好,周末的Paper Morning如约而至。 今天想和大家聊一个特别有意思的话题,就是“世界模型”这件事。我们都知道,这两年视频生成模型火得不行,很多人把它们当作世界模型的候选,但它们真的理解物理世界的基本规律吗? 第一篇论文就在探讨这个问题。研究者们问了一个很根本的问题:视频模型里是否涌现出了“物体恒存性”这个人类认知的先验?所谓物体恒存性,就是即使物体从视野里消失,你也应该知道它仍然存在。他们设计了一个叫WROP的数据集,包含150个认知科学启发的任务,然后用Blender生成了一万多个样本。结果发现,现有的视频模型在物体恒存性上表现得很差,但通过这种认知启发的数据集进行微调,它们可以学到这种能力。 这意味着什么?对我们做AI for Science的人来说,这其实揭示了一个重要的教训:我们训练物理仿真模型时,往往假设数据本身已经包含了物理规律,但实际上,模型可能并没有学到那些我们认为理所当然的物理先验。如果你想让一个模型真正成为可靠的科学预测工具,可能需要在数据层面就注入这些物理 priors,而不仅仅是指望大数据自动涌现。 顺着这个思路,第三篇论文HappyWorld-Bench就更值得关注了。它提出了一个非常全面的世界模型评估框架,不仅看生成质量,还特别强调模型在交互、探索和干预下的一致性。他们设计了六个层级的世界能力,从生成构建到统一建模,涵盖了视频、空间和具身三种评估Track,一共1188个视频提示、300个空间场景和254个具身测试案例。这个工作的野心很大——它想回答一个根本问题:我们怎么知道一个世界模型真的“理解”了物理,而不仅仅是记忆了训练数据的统计规律? 这让我想到我们AI4S社区经常争论的一个问题:到底什么才算一个好的物理foundation model?是loss降得更低,还是能够真正泛化到未见过的物理情境?HappyWorld-Bench给出了一个很好的基准思路。 聊完世界模型,我们来看看第二篇论文,它研究的是Transformer架构本身的一个很有意思的现象。研究者们发现,当把两个不同的输入线性组合时,模型的输出竟然是两个独立输出的叠加——他们把这叫做“超线性叠加假说”。更有趣的是,这种特性在预训练过程中反而会逐渐消失,但通过轻量级的微调可以显著恢复。 这个发现对我们理解neural operator有什么启发?我个人感觉,这说明Transformer架构天然具备一种线性表示能力,而这种能力恰恰可能是它在某些任务上表现优秀的底层原因。我们做operator learning的时候,经常讨论怎么让模型捕捉非线性映射,但也许我们也应该关注一下模型在什么条件下会表现出这种“线性叠加”的特性——它可能恰恰是泛化能力的一个来源。 第四篇论文SpeakerMem-R1是关于多轮对话中的记忆问题,提出了一种双轨记忆机制来追踪说话者、关系和状态变化。这个工作看起来是NLP领域的,但我觉得它揭示了一个更普遍的问题:当我们构建任何需要长期推理的系统时,如何有效地维护和更新状态信息?这其实也是科学模拟中面临的核心挑战——当你做一个长时间尺度的物理仿真时,你不可能把所有中间状态都保存在上下文窗口里,必须有选择地进行记忆和遗忘。 第五篇论文正好呼应了这个话题,它系统性地回顾了自回归视频生成中的记忆机制问题。随着生成的序列变长,模型必须在有限的上下文窗口、存储和计算资源下工作,这导致很多关键的历史信息——比如实体身份、动态状态、干预带来的因果变化——在它们仍然相关之前就被遗忘了。 好,让我们把这些串起来。今天聊的几篇论文,其实都在回答一个共同的问题:怎么构建真正理解物理世界的智能系统?无论是通过认知启发的数据来训练物体恒存性,还是建立更严格的评估基准来检验世界模型的物理一致性,或是从架构层面理解模型如何表示和组合信息,以及如何处理长程记忆——这些努力都在推动我们向更可靠的物理AI迈进。 而对我们做AI for Science的人来说,这些进展预示着一个趋势:未来的科学计算模型,可能不仅仅是一个求解PDE的神经网络,而是一个真正理解物理先验、能够在交互中保持一致性、并且能够进行长期推理的统一智能体。这条路还很长,但今天的这几项工作,让我们看到了前进的方向。 祝大家周末愉快,科研成果滚滚来。

本期涉及论文