Paper Morning 2026-08-31
2026-08-31
各位早上好,新的一周开始了,Paper Morning又和大家见面了。
今天想先从一个更大的趋势聊起。最近一段时间,我注意到一种很有意思的范式正在兴起:不仅仅是做视频生成,而是在构建“世界模型”。这个词在计算机视觉和具身智能领域被讨论得很多,但今天我想看看这些工作和我们关心的科学计算、AI4S有什么潜在的关联。
第一篇论文讲的是用游戏开发作为世界模型的可验证数据引擎。作者指出,当前Scaling世界模型主要靠堆更多视频数据和算力,但他们认为这个策略效率不高——关键在于需要一种能够提供“扎实奖励信号”的递归数据引擎。这让我想到一个很妙的类比:在代码生成领域,因为代码是可执行的,编译器和运行时可以提供高质量的奖励信号来做强化学习;但在空间生成领域,我们长期依赖CLIP分数这种模糊的代理信号,很难支持真正的RL后训练。作者提出,游戏开发恰恰提供了这个缺失的奖励环境——游戏引擎编码的场景是一个可执行的世界规范,可以高效地提供奖励。这篇工作给我的启发是,其实在科学模拟中,我们也有类似的可执行性:物理引擎、仿真器本身就是可验证的环境,那是否也可以构建类似的“科学数据引擎”,用可执行的物理规律来生成有奖励信号的训练数据?这可能是未来科学Foundation Model的一个重要方向。
顺着这个思路,第二篇论文提出了一个更根本的问题:现在的视频生成模型离“概率对齐”的世界模型还有多远?作者认为,很多物理过程可以有多种合法的展开方式,所以一个真正的世界模型不仅要能生成一个 plausible 的轨迹,还要能在相同初始观察和行动下恢复出正确的行为分布。他们据此提出了PAWBench benchmark,来评估视频生成器是否具备这种分布级别的建模能力。这个工作让我想到,其实在科学计算中,我们关心的从来不只是单一解,而是解的分布——不确定性量化、蒙特卡洛采样、贝叶斯推断,这些都是在处理“分布”这件事。那么一个好的科学世界模型,是否也应该具备类似的概率对齐能力?这篇论文给了一个很好的评测框架。
第三篇论文JIT-Agent关注的是一个很少被讨论但其实非常关键的问题:Agent的能力到底由什么决定?很多人觉得模型参数越大agent就越强,但作者指出,agent的harness——也就是记忆管理、规划策略、动作协议、工具编排这一套东西——它的贡献有时候可以超过底层基础模型。但现在的harness设计还是手工的、任务特定的,无法规模化。他们提出了一个harness intelligence模型,能够为任意的agent动态合成适配的harness。这让我联想到我们在科学计算中经常做的超参数调优、实验设计——本质上也是一种“harness优化”。如果把这套思路迁移到科学实验自动化、自动化定理证明这些场景,会不会也很有意思?
第四篇论文GameWAM提出了一个“World-Action Model”的概念,这是第一次在原生游戏环境中构建同时预测未来视觉观察和可执行键盘鼠标轨迹的模型。他们用了并行的视觉和动作生成过程,配合block-causal conditioning和flow matching技术。这个工作的意义在于,它把世界模型和策略统一到了一个框架里,而不是像以前那样分开做。我认为这其实呼应了我们做PDE求解器的一个核心诉求:能不能同时建模物理系统的演化规律和决策/控制策略?把动力学预测和动作生成结合起来,可能是未来科学AI的一个重要方向。
最后一篇TTPO提出了测试时策略优化。这是一个很有趣的思路:之前的RL后训练方法依赖真实标签,无法做test-time training;而用多数投票的伪标签又很脆弱——一旦投票错误,整个teacher就被污染了。他们观察到, rollout和伪标签不一致的情况通常是错的,不管投票本身对不对。基于这个不对称性,他们设计了TTPO,用OPSD蒸馏一致的rollout,用分组RL惩罚不一致的rollout。这个工作让我想到,其实在科学模拟中我们也经常面临类似的问题:仿真结果和理论预测不一致时,哪些是真正的物理新发现,哪些只是数值误差或模型缺陷?如何设计鲁棒的更新机制?这篇论文提供了一个非对称优化的视角。
好,总结一下今天的整体观察。我发现这五篇论文其实在回答一个共同的问题:如何让生成式模型不仅仅是“看起来真实”,而是真正“可验证、可控、可交互”的世界模型?无论是通过游戏引擎提供奖励信号、通过概率对齐确保分布正确、还是通过harness自动化和test-time优化增强鲁棒性,都在推动这个目标。对我们做AI4S的人来说,这些进展意味着科学世界模型的构建正在从“拟合数据”走向“可验证推理”,这个范式转变值得我们持续关注。