Paper Morning 2026-09-17
2026-09-17
各位早上好,Paper Morning又和大家见面了。
今天想先从一个更大的话题聊起。我们做AI for Science的人,常常会把目光盯在PDE求解、分子模拟这些“硬核”任务上,但有时候需要抬头看看foundation model这口大锅现在都在煮什么。 今天这几篇论文,虽然看起来离科学计算有点距离,但它们其实在悄悄定义一种新的能力基线,这种基线早晚会影响我们做科学模拟的方式。
先看第一篇,AI for Games in the Foundation Model Era。这篇综述把游戏AI分成了六个角色:玩游戏的角色、建模玩家和游戏的角色、设计游戏的角色、构建和维护游戏的角色、运行时生成和适配的角色,以及测试和评估的角色。表面上看是游戏领域的survey,但我读完最大的感受是:这其实就是在描述一个完整的“物理世界模拟系统”需要具备的能力。 游戏中建模玩家行为和游戏 dynamics,不就是我们做物理模拟时对系统演化规律的建模吗?设计游戏和构建游戏,对应到科学计算就是设计物理模型和构建求解器。运行时生成和适配,对应到我们想要的实时预测能力。所以这篇综述实际上是在用游戏作为载体,展示foundation model时代智能化系统应该长什么样。这个思路值得借鉴:游戏环境其实是很好的科学计算benchmark,因为它的物理规则是明确的,但又足够复杂。
第二篇非常有意思,ZGCM-1,一个7B参数的dense模型,专门针对数学和agent搜索任务。它的核心论点很有意思:compact model无法被动地记忆整个互联网,所以需要“主动思考”加上“外部工具使用”来突破参数容量的限制。 这不就是一个活生生的“科学智能体”原型吗?做科学计算不就是这样吗?单个模型的参数再大,也不可能记住所有物理定律和实验数据,所以我们需要模型能够调用工具、调用外部知识库来做推理。ZGCM-1在256K context下做context scaling,并且把交互轨迹建模成马尔可夫决策过程,这让我想到我们能不能把科学实验过程也建模成MDP,让模型学会“做实验”?
第三篇和第五篇都是StepAudio的工作,一个做实时语音交互,一个做音乐生成。 realtime版本提出了一个“边说边想”的机制,在说话的同时进行私人推理,解决了深度思考和低延迟之间的矛盾。 音乐版本则展示了一套完整的从规划到生成的pipeline。这两个工作看起来是音频方向的进展,但我更关注它们背后的方法论:如何把推理能力和生成能力解耦又耦合,如何处理时序信号的高维建模。科学计算中我们也在面对类似的问题,比如怎么在做 PDE 求解的同时进行误差估计和自适应 refinement。
第四篇 LynnReal-Omni 是视频生成的工作,32B参数的多模态 diffusion transformer,支持多种生成模式。它特别提到要解决长视频中appearance drift和temporal coherence的问题,这让我想到我们做物理模拟时的长期一致性也是一个核心挑战。 他们用 agentic visual creation 来提供 explicit control,这个思路或许可以迁移到科学模拟中:用更强的结构化控制来换取生成质量。
好了,今天这几篇论文看起来比较“偏应用”,但我观察到的一个统一趋势是:foundation model的能力正在从“被动知识容器”向“主动智能体”转变。 不管是游戏里的多角色系统,还是数学agent的工具调用能力,还是实时对话中的边说边想,都在指向同一个方向:模型不仅要存储知识,还要能够行动、能够规划、能够与外部世界交互。 这个趋势对AI4S意味着什么?我们需要的可能不只是更大的PDE求解器,而是一个能够“做科学实验”的智能体。这可能是比刷点位更有想象力的未来。
今天的播报就到这里,我们明天继续。