Paper Morning 2026-09-23

2026-09-23

各位早上好,Paper Morning又和大家见面了。 今天想先从一篇教育AI的论文聊起,叫OmniEdu,做的是K12教育的基础模型。你可能会问,教育模型跟咱们AI for Science有什么关系?我觉得它展示了一个很有启发的思路:怎么把多个能力维度统一到一个预训练框架里。它定义了四个能力——学科知识、课程理解、诊断推理和教学支架——然后用统一的指令微调数据把这些能力整合到一起。这其实和我们现在讨论的PDE foundation model很像:我们不只要一个能求解方程的模型,我们还希望它能诊断物理问题、理解不同尺度的关系、甚至给出可解释的推理过程。OmniEdu用超过100种教育资源构建指令数据集的做法,也提醒我们:科学计算领域同样需要高质量、多样化的指令数据,而不仅仅是方程和解的配对。 聊完教育模型,接着看一篇做视频世界模型的工作WorldCrafter。它提出了一个很有意思的问题:当我们有一个环境的历史观察,怎么让模型能够从任意新视角生成后续的视频?传统的世界模型往往受限于固定的视角,WorldCrafter的解决办法是引入一个相机可查询的隐式3D感知记忆。它用记忆编码器把多视角的观测压缩成一组目标视角相关的token,再送给视频生成器。这样做的好处是不需要显式的深度对应关系,而是让模型自己学会怎么把历史信息“分配”到不同视角的生成中。这个思路其实和科学计算中我们面临的挑战很相似:当有多源异构的观测数据时,我们怎么让模型学会在不同表示之间做信息路由?无论是流体模拟中的传感器数据融合,还是多尺度物理的跨尺度信息传递,这种“记忆+查询”的机制都值得借鉴。 然后是GameHorizon Suite,这个工作很有意思,它构建了一个游戏领域的多 horizon评测和数据套件。你会发现它特别强调“不同时间尺度”的能力——从短期的即时操作到长期的目标规划。这让我想到,科学计算中其实也有类似的多尺度问题:比如短期湍流演化和长期气候预测,它们需要的模型能力完全不同。GameHorizon的自动化标注pipeline也很值得注意,它用LLM来生成多 horizon指令,这或许能启发我们思考:能不能用类似的方式为科学问题自动生成不同精度要求的求解指令?当我们在构建PDE benchmark的时候,是否也可以借鉴这种思路,让评估更贴近实际科研中不同场景的需求? 接着看RRSI,做的是LLM agent harness的递归自改进。这个工作的核心发现很有意思:直接让agent的prompt和工具配置自我演化,会在训练任务上出现过拟合,导致分布外性能大幅下降。这在我们AI4S领域其实是个非常实际的问题:我们训练一个求解方程的神经网络,它在训练分布上表现很好,但到了新的几何形状、新的物理参数范围,性能就急剧下降。RRSI引入的正则化思想——约束候选提议和选择过程——其实正是我们做物理先验嵌入、或者operator learning时一直在讨论的事情:怎么让模型学到的能力具有更好的迁移性,而不是仅仅记忆训练数据的模式。这篇论文的154个upvote也说明大家对agent系统的泛化问题非常关注。 最后聊聊RoboDawn,它研究的是怎么把VLM在数字世界学到的能力迁移到机器人控制。这是一个很根本的问题:VLM能理解图像和语言,但它能直接操控物理世界的机器人吗?RoboDawn的做法很直接——给VLM一个紧凑的离散的命令空间,包括平移、旋转和夹爪,然后让它闭环控制:观察当前视觉状态、推理下一步动作、执行、然后根据结果调整。我对这篇论文特别感兴趣的地方在于,它试图弥合“数字智能”和“物理智能”之间的鸿沟,而这正是AI for Science的一个核心挑战:我们用数值模拟训练的模型,怎么才能真正应用到真实的物理系统中?RoboDawn展示的闭环反馈机制,或许也能启发我们思考在线学习、持续适应在科学计算中的应用。 好,今天的五篇论文就聊到这里。我有一个整体的观察:今天这些论文虽然来自不同方向,但它们都在回答一个共同的问题——怎么让有限的模型容量去处理复杂、多尺度、分布变化的任务。无论是教育模型整合多种能力、视频世界模型的多视角记忆、游戏AI的多horizon评测、agent的正则化自改进,还是VLM到机器人的迁移,其实都指向同一个核心挑战:当我们不能无限scale模型的时候,怎么通过精巧的设计让它更好地适应真实世界的复杂性?这或许也是我们AI4S研究者需要一直思考的问题:在追求更大更强的同时,那些让模型真正work的“中间层”设计,可能同样重要。早上就到这里,我们明天见。

本期涉及论文