Paper Morning 2026-09-28

2026-09-28

各位早上好,新的一周开始了,Paper Morning又和大家见面了。 今天想和大家聊一个我觉得特别有意思的主题,就是AI系统怎么“记住”事情。当然我说的记住不是简单的存储,而是一种更本质的能力——在生成视频的时候记住哪个物体在哪里,在对话中记住谁对谁说了什么,甚至在Transformer里同时容纳多个“想法”。这几篇论文虽然领域不同,但都在触及这个核心问题。 先看第一篇,Training Object Permanence in World Models,作者来自多所机构,提出了一个叫WROP的数据集,专门用来测试和训练视频生成模型的“物体恒常性”。大家知道,物体恒常性是人类从婴儿时期就有的认知先验——一个物体被遮挡后仍然存在,这是我们理解物理世界的基础。但现在的视频生成模型其实并没有内建这种能力,它们生成的视频里,物体经常凭空消失或者错误出现。作者设计了150个认知科学启发的任务,用Blender生成了一万多个样本,来教模型学会物体恒常性。这个工作让我想到一个问题:我们以前总觉得 scaling law 能让模型自己涌现出各种能力,但像物体恒常性这种基础的物理直觉,可能真的需要专门的训练数据和方法来注入。 说到世界模型的评估,第二篇HappyWorld-Bench就是一个配套的benchmark了。它不仅评估视频生成的质量,还特别关注当智能体真正去探索、交互、修改这个世界时,这个生成的世界是否仍然可靠。作者设计了一个三层能力框架,从W1到W6,对应从生成构建到统一世界建模的不同层次,然后在视频世界模型、空间世界模型和具身世界模型三个轨道上分别评估,一共有一千多个测试用例。这其实反映了领域的一个转变——以前我们可能只关心生成视频有多逼真,但现在更关心这个“模型世界”是否经得起交互的考验。这和第一篇的工作是很好的互补,一个负责训练,一个负责评估。 第三篇Your Transformer Can Hold Two Thoughts at Once非常有意思,作者发现Transformer居然有一种线性叠加的特性。当把两个不同的输入线性组合在一起时,模型的输出居然是分别处理这两个输入时输出分布的叠加。这被称为“叠加线性假设”。更有趣的是,作者发现这个特性会随着预训练逐渐消失,但可以通过轻量级的微调重新恢复。这个发现我觉得非常深刻,因为它揭示了Transformer架构本身可能就具备一种并行表示的能力,只是常规的训练过程把它压制了。这让我想起我们做科学计算的时候,经常需要在同一个模型里同时处理多个不同的输入条件,比如不同参数下的PDE求解,如果这种线性叠加能力可以被利用起来,说不定会是一种新的多任务学习范式。 说完视频生成和Transformer的基本能力,我们来看第四篇SpeakerMem-R1,这是关于多轮对话中的记忆问题。在多人对话场景里,模型不仅要记住谁说了什么,还要理解人际关系、谁在乎谁、谁对谁的看法如何变化。作者提出了一个双轨记忆机制,用speaker-labeled向量来分别存储说话者的信息和关系信息。这个工作让我想到一个更宏观的趋势:现在的LLM已经能处理很长的上下文,但“记住”和“理解”仍然是两回事。在科学计算里我们也有类似的问题——模型可能记住了训练数据里的PDE解,但它真的理解了背后的物理规律吗? 第五篇The Past Frames the Future是一篇关于自回归视频生成中记忆机制的综述。文中指出一个根本性的矛盾:随着生成的视频越来越长,模型必须在有限的上下文窗口、存储和计算资源下工作,这就意味着重要的历史信息——比如实体的身份、动态状态、干预导致的因果变化——往往在它还有用之前就被遗忘了。作者系统性地回顾了各种记忆机制来解决这个问题。这和第一篇的工作形成了另一个层面的呼应——第一篇说的是让模型记住“物体存在”,第五篇说的是让模型记住“物体发生了什么”。两边一起看,你会发现视频生成领域正在从“如何生成一帧”转向“如何记住整个故事”。 好,让我们回头看一下今天这几篇论文的整体脉络。我觉得有一个统一的线索在浮现:AI系统正在从“生成单个样本”走向“维护持续的一致性”。无论是视频里的物体在不同时间点保持一致,还是对话中多个人物的关系保持一致,或者Transformer内部同时保持多个状态的叠加能力,核心问题都是一致的——如何在时间推进中保持信息的连续性和完整性。这个趋势对于我们做科学计算的人来说尤其值得关注,因为物理模拟本身就是一种时间上的连续推理,怎么让神经网络像物理方程一样保持因果性和守恒性,可能是下一步很值得探索的方向。 好了,今天的播报就到这里,祝大家新的一周科研顺利,我们明天再见。

本期涉及论文