Paper Morning 2026-09-27

2026-09-27

各位早上好,Paper Morning又和各位见面了。 今天想和大家聊一个我觉得特别有意思的主题——记忆。不是我们通常说的训练数据的记忆,而是AI系统内部怎么处理信息连续性的问题。这个线索其实贯穿了今天好几篇论文,我们来看看它们各自是怎么切入这个问题的。 先看第一篇,Training Object Permanence in World Models。作者问了一个很本质的问题:现在的视频生成模型有没有“物体恒常性”?就是我们人类天然的认知——一个物体被挡住了,它依然存在。这篇工作很有意思的地方在于,他们不是直接让模型自己学,而是设计了一套认知科学启发的数据集WROP,包含150个精心设计的任务,然后用Blender生成了一万多个样本。训练之后确实能看到物体恒常性emergent出来。这篇工作让我觉得有价值的地方在于,它不是盲目堆数据,而是借鉴了发展心理学的思路——婴儿是怎么学会物体恒常性的,用类似的框架去教AI。这其实呼应了我们一直在聊的:世界模型不能只学统计规律,要学因果结构。 那么世界模型学出来之后效果怎么样呢?这就引出第二篇,HappyWorld-Bench。这个工作很有意思,它不只看生成质量,还要看交互一致性。你生成一个世界,agent能不能在里面可靠地探索、修改、干预?他们的设计把世界模型的能力分成六级,从单纯的生成一直到最后统一的世界建模。Track有三个:视频世界模型、空间世界模型、具身世界模型,加起来两千多个测试用例。我觉得这个benchmark的意义在于,它把世界模型从“能生成”推到了“能用”的层面。生成的视频再逼真,如果agent一干预就穿模,那也算不上真正理解了物理。 说完世界模型,我们来看看更底层的东西。第三篇Your Transformer Can Hold Two Thoughts at Once。这是一个非常有趣的发现:Transformer在做推理的时候,当你把两个不同的输入线性组合在一起,输出居然是两个输出分布的叠加。注意这可是Transformer啊,attention、FFN都是高度非线性的组件,但输出层面居然表现出线性!作者把这个叫做Superposition Linearity Hypothesis。而且他们发现,这个特性会随着预训练逐渐消失,但可以通过轻量微调恢复。这意味着什么?意味着Transformer的底层其实天然支持多任务、多想法的叠加表示,只是训练过程把它压掉了。这让我想到,这会不会给未来的模型架构设计一点启示——不要总想着加非线性,也许线性结构本身就是一种优势。 然后第四篇,SpeakerMem-R1,是关于多方对话的记忆问题。这个问题可能我们做NLP的同学更熟悉,但我觉得和世界模型也有联系。多方对话里你要记住谁说了什么、谁对谁什么态度、关系怎么演变,这本质上也是一种世界状态的维护。作者提出了双轨记忆机制,一个存说话人的向量表示,一个维护关系图谱。这个工作的实用价值很明显:现在的LLM对话系统,处理单对单聊天还行,一到多人群就容易“脸盲”,谁是谁都分不清。这篇给出了一个新的思路。 最后一篇,The Past Frames the Future,是关于自回归视频生成中的记忆问题。这个和第一篇其实呼应上了。视频生成现在可以生成长序列,但问题是:实体身份怎么保持?状态变化怎么追踪?干预之后因果关系怎么维护?作者系统地回顾了各种记忆机制,包括external memory、compression、retrieval等等。这篇是review性质的,但整理得很清晰,对于做视频生成的朋友应该很有参考价值。 好,我们把今天的五篇论文串起来看看。我发现它们其实都在回答一个共同的问题:AI系统怎么在时间维度上保持信息的一致性和连续性?从世界模型需要理解物体恒常性,到生成的世界要在交互中保持一致;从底层Transformer的线性叠加特性,到对话系统要跟踪多方关系,再到视频生成要维护长期记忆——核心都是“记忆”这件事。这让我想到,也许“记忆”会是下一代AI系统的关键变量。我们现在太关注“推理”、“规划”这些词了,但记忆可能是把这些能力串联起来的那条线。好了,各位今天有哪些收获?我们明天接着聊。

本期涉及论文