Paper Morning 2026-08-17

2026-08-17

各位早上好,周一的Paper Morning如约而至。 今天想先从一篇架构创新聊起。Intern-S2-Mobius这个工作提出了一个很有意思的思路:把知识存储和推理能力分开。它用一个全局共享的内存模块存储知识向量,多个推理器通过迭代查询这个内存来完成推理任务。这本质上是在回答一个很根本的问题:大语言模型里到底哪些参数负责记忆事实,哪些负责进行逻辑推演?Mobius用架构层面的解耦给出了自己的回答。从实验结果看,它的7B模型用62.6%的训练数据就能达到baseline的性能,这说明知识-推理分离确实改善了知识压缩效率。不过我更感兴趣的是这个思路对科学计算 foundation model的启发:我们能不能把物理先验知识也做类似的解耦,把物理定律存成一个独立的知识库,让不同的推理模块去调用?这样foundation model在面对新任务时,可能就不需要从头学习物理规律,而是直接检索已有的物理知识。 聊完架构,我们把视线转向一个更基础的问题:视觉学习中的非对称性。Self-Supervised Visual On-Policy Distillation这篇文章提出了一个很巧妙的想法。通常师生蒸馏需要教师比学生强,或者需要ground truth这样的特权信息,但这里它反过来了:不是给教师加信息,而是从学生那里“减去”信息。这种信息缺口反而创造了一个自监督的学习信号,效果相当于有一个拥有学生无法访问的信息的教师。这个思路让我想到科学计算里的很多问题:我们能不能也通过制造类似的“信息差”来设计自监督任务?比如在PDE求解中,让模型根据不完整的物理参数去预测完整解,或者根据部分观测去推断全场景状态,这种“信息缺失”本身就是一种监督信号。 接下来想说说一篇评估方法论的论文。Beyond Final Scores对七个大模型在36个长期任务上做了系统评估,核心发现是当前agents更像是“工程优化器”而非“自主研究者”。这个判断很犀利,它指出我们不能只看最终分数,还要看过程中的行为模式——你的模型是怎么定义问题的、怎么执行的、怎么根据反馈调整的。这对AI4S领域特别有参考价值,因为我们经常让AI agent去做科学发现任务,但评估指标往往就是“有没有发现新规律”。问题是,发现过程中的推理路径可能比最终结果更有价值。一个只会闷头调参的agent和一个能够提出新假说的agent,在最终分数上可能差不多,但在方法论意义上完全不同。这篇工作提醒我们,是时候建立更精细的评估框架了。 然后是一个偏应用的检测工作。Can We Defend Against AI-Generated Video Attacks关注的是AI生成视频对真实危机事件的威胁,做了一个包含近18000个视频的大规模benchmark。他们发现检测器在不同生成条件下的表现差异很大,而且经过社交媒体传播后检测可靠性会下降。这个工作虽然是偏安全方向的,但它揭示了一个对科学计算也很重要的问题:当我们用AI生成的模拟数据来训练模型时,这些合成数据的“可检测性”会不会影响下游任务的表现?如果我们训练一个物理模拟器用的是GAN生成的假数据,模型会不会学到一些“假的纹理”,而在真实数据上失效?这其实是一个数据分布外泛化的问题。 最后聊聊机器人操作领域的benchmark。H2R-Bench评估的是视频世界模型能不能把人类的第一人称操作视频转换成机器人的操作视频。这是一个典型的跨本体迁移问题:人类的手和机器人的末端执行器动作形式完全不同,但底层的物理意图是一致的。如果视频模型能做好这个转换,意味着它学到的是比动作表象更深层的物理规律。这让我想到科学计算里的“元学习”思路:能不能训练一个模型,它学会的是“物理世界如何运作”,然后在不同任务、不同系统之间快速迁移? 好,让我们来收束一下今天的内容。我观察到的一个整体趋势是:无论是大模型的架构设计、视觉学习的自监督策略、AI agent的评估范式,还是跨模态的迁移学习,所有这些工作都在指向同一个方向——我们不再满足于“怎么做”,而是更关心“为什么这样做有效”以及“如何让有限的数据和计算发挥更大的价值”。知识要解耦、信号要自洽、评估要细粒度、迁移要本质。这种从“增量”走向“本质”的转变,或许正是AI for Science正在经历的一场范式升级。好,各位今天辛苦了,我们明天早餐时间再见。

本期涉及论文