Paper Morning 2026-09-22
2026-09-22
各位早上好,今天Paper Morning想聊一个特别有意思的话题。你们有没有注意到,最近AI领域有股趋势在慢慢浮现,不只在追求更强的语言能力,还在试图让模型理解我们生活的物理世界。这个趋势在今天几篇论文里都能看到影子。
第一篇是关于MiniMax-H3的评估工作。它是一个Omni-Modal的生成模型,能同时处理文本、图像、视频和音频。但这篇论文关心的不是生成质量本身,而是另一个更深层的问题:当模型能同时“看”和“听”的时候,它是否真的理解了物理世界的运作规律?比如东西掉下来会怎样,碰撞会发生什么。研究团队为此设计了一套全新的评估框架,从四个维度来考察模型的物理推理能力。这个工作的价值不在于它又刷新了什么生成分数,而在于它提出了一个根本性的问题:多模态的“对齐”到底能不能带来真正的“世界理解”。这其实是在质疑我们现在的评估范式是否出了问题。
第二篇JEPA-Anything更激进,它在问能不能用一个通用的学习原理来建模完全不同的物理系统。它提出了正交预测因子分解的方法,可以把复杂的目标分解成不同因子分别学习,然后在统一的预测框架里重新组合。论文在七个完全不同的领域做了测试,从视觉到生物,从临床轨迹到分子动力学,再到天气预测。这种跨领域的通用性让我想起NLP里foundation model的理想,一个模型能解决所有问题。科学计算领域也在往这个方向走,但难度更大,因为每个物理系统都有自己独特的规律。JEPA-Anything至少证明了一个统一的框架是可以处理这些差异的。
这两篇论文其实在回答同一个问题,AI能不能像人类一样理解物理世界。不过它们走的是不同路线,一个靠多模态,一个靠通用架构。这让我想到,也许真正的突破需要把两者结合起来。
再看今天另外两篇。第三篇IntBMoE表面上在改进MoE的模型结构,但它的思路其实很有意思。它把参与度、执行成本和参数实例化成本这三个量分开处理,本质上是在问一个scaling的问题:当模型变大的时候,我们能不能更灵活地控制计算和内存的消耗?这个方向对训练大规模的科学计算模型特别关键,因为神经算子的参数量增长起来是很快的。
最后两篇其实在解决一个更根本的问题,训练数据从哪来。EvoOntology提出给数据智能体做一个能自进化的本体层,让智能体可以理解数据的语义而不是只看到表面的结构。CodeMidas更直接,它让模型直接去读代码,从代码本身生成训练任务和验证环境,绕过了人工标注数据不够的瓶颈。这两篇加在一起,代表了一种趋势:以后训练AI agent可能不需要依赖大量人工标注的数据了。
把今天这几篇论文连起来看,我有一个整体的观察:大家都在试图打破某种瓶颈,物理理解有瓶颈,跨领域建模有瓶颈,模型scaling有瓶颈,训练数据也有瓶颈。而打破瓶颈的方法,归根结底就是让模型更主动地去理解和处理信息。这可能反映了整个AI领域正在从“堆参数、堆数据”的旧范式,向“让模型学会真正理解和推理”的新阶段转变。今天的Paper Morning就到这里。