Paper Morning 2026-09-01
2026-09-01
各位早上好,今天Paper Morning开播了。
最近AI领域有股热潮,大家都在谈world model,但很多讨论其实停留在“生成一段视频”这个层面。我们今天聊的几篇论文,恰好从不同角度戳破了一些幻觉。
第一篇说了一个很根本的问题:现在训练world model都想着堆更多视频数据、堆更多算力,但作者认为这条路走不通,因为缺了一个关键东西——可验证的reward signal。他们拿code agents做类比,说代码为什么能训出来?因为代码是可执行的,编译器能告诉模型写对了还是写错了,这是高质量的反馈。但空间生成呢?大家还在用CLIP score这种模糊的、带有偏见的信号,完全撑不起RL post-training。游戏开发刚好能补上这个缺口,因为游戏引擎本身就是可执行的世界规格,引擎可以直接告诉模型这一步走对了没有。这篇文章的思路我觉得很值得AI4S的人想想——我们做PDE求解、做物理模拟,其实也是在构建可执行的世界规格,有没有可能也从中提炼出reward signal来反哺模型训练?
那么下一个问题来了,即使有了数据,怎么才算训出了一个好的world model?第二篇论文就问了这个本质问题。他们提出一个概念叫probabilistic alignment,意思是说,一个世界模型不仅要能生成一条 plausible 的轨迹,还要能在相同初始条件下重复生成时,恢复出正确的行为分布。听起来很基本对不对?但作者指出,现有的评估全在问“这段视频看起来真不真”,没人测“反复生成能不能覆盖正确的概率分布”。于是他们做了PAWBench这个benchmark。我觉得这个工作最狠的地方在于,它把“预测”和“建模”区分开了——你预测一条确定的路径,和你真的在建模一个物理过程,这是两回事。
第三篇正好是从另一个方向推进这个问题的。GameWAM提出了World-Action Model这个概念,要在视频游戏里同时做到两件事:预测给定动作后的未来视觉观察,以及直接生成可执行的键盘鼠标轨迹。他们是第一个在原生游戏闭环玩法和GUI控制上做这个的。之前的工作要么是看着画面直接飙操作,要么是预测未来但不当policy用。WAM把两者统一了,而且用了block-causal conditioning和flow matching这些技术手段。这篇和前两篇其实在呼应同一个趋势:world model不能只是个生成器,它必须和action、reward、execution形成闭环。
说到闭环,第四篇研究的是coding agent里的loop控制。现在很多人用loop来组织agent工作——比如一个loop负责monitor进度、分配任务、做检查、决定下一步干什么。但即使agent能力很强,loop本身也会犯各种错误:信任过时的进度记录、跳过了需要的验证、花预算在错误方向上、任务还没安全就提交了。之前没有好办法评估loop本身做得好不好,因为一次run的成功或失败没法区分是loop的指导有问题还是agent执行能力有问题。LoopArena就是来解决这个问题的,它把模型当作controller来评估,看它能不能在长时间运行的任务中正确引导一个独立的coding agent。这实际上是在问:模型能不能成为那个负责任的“调度者”,而不只是的执行者?
第五篇是一篇survey,讲agentic artifact creation,就是AI系统怎么把自然语言prompt变成真正可用的交付物。他们定义了stateful construction这个概念,说白了就是AI不仅生成内容,还要能够构建和修订这个内容的中间状态,并且根据反馈调整后续行动。他们看了259篇相关工作,230个系统和29个benchmark。这篇的价值在于,它给“AI能不能做工程”这件事画了个框框,什么叫真的在做东西,什么叫只是在生成碎片。
好了,今天的播报差不多该收尾了。我整体的一个感受是,这几篇论文其实在说同一件事: AI正在从“生成内容”走向“构建可执行系统”。不管是world model需要可验证的reward signal,还是WAM要把生成和action绑在一起,或者是loop和artifact creation在讨论的“负责任的调度”,核心都是一样的——光生成是不够的,你得能闭环、验证、负责任地执行。这可能也是整个领域正在悄悄转弯的方向,从“为生成而生成”,走向“为执行而生成”。我们明天见。