Paper Morning 2026-09-20
2026-09-20
各位早上好,周末的早晨终于能喘口气了,Paper Morning又和大家见面了。
今天想先聊一篇挺有意思的评估工作,是关于MiniMax-H3这个全模态生成模型的。熟悉大模型的朋友可能知道,现在的多模态模型已经不只是处理图像或文本了,而是在往统一所有模态的方向走。MiniMax-H3就是这样一个尝试,把多模态理解和音视频生成塞进一个共享的潜在框架里。这篇文章问了一个很根本的问题:这种多模态的对齐到底能不能提升模型对物理世界的推理能力?作者为此设计了一套围绕物理世界推理的评估框架,分成四个互补的维度。这件事让我想到,咱们做科学计算的人其实也很关心模型能不能真正理解物理规律,而不只是拟合数据。如果多模态学习能让模型建立更好的世界表征,这或许会反过来影响我们做物理模拟和科学发现的方式。
接下来这篇LimiX-2很有意思,它代表了一个新的模型范式,叫做上下文机制网络。这个工作的背景是,传统的表格数据预训练模型通常在做一种叫做p的预测,就是给定上下文数据来预测目标。但LimiX-2换了个思路,它要建模的是p,也就是同时学习输入和输出在上下文中的联合结构。作者说这是从“以目标为中心的预测”转向“以机制为中心的联合建模”。他们用因果模型生成的合成数据来做预训练,数据涵盖各种图结构、功能机制和观察噪声。这件事让我特别感兴趣,是因为它把大语言模型里预训练和Scaling的思路,迁移到了结构化数据上。过去我们总觉得表格数据的智能处理是个相对小众的方向,但LimiX-2用 Scaling Law来指导模型和数据扩展的做法,或许说明这条路走得通。
然后第三篇是关于模型蒸馏中一个非常具体但重要的问题。大家知道模型蒸馏是让小模型学习大模型输出的过程,但这篇工作发现了一个很棘手的现象:学生的回答有时候会变得异常长,甚至把生成预算都耗尽了。他们研究后发现,问题的根源在于“结束符”的不匹配。具体来说,基础模型和后训练模型即使使用相同的停止符集合,它们对不同结束符的停止概率分布也可能完全不同。这种不匹配会压制学生模型原本偏好的终止行为,而又不能可靠地传递老师模型喜欢的终止方式。作者展示了把功能等价的结束符当作共享的语义终止动作来处理,能够显著缓解这个问题。这个发现很务实,因为它提醒我们,模型蒸馏不只是输出分布的对齐,还有一些看似微小但影响深远的细节。
第四篇是DeepSeek-V4.1-Flash,这是一个 multimodal mixture-of-experts模型,有552B的骨干参数,支持高达一百万token的上下文。他们引入了一个叫做因果编码器-解码器的架构,在解码时激活16B参数,但在预fill时只激活8B参数。这背后的动机是,长程Agent的场景让模型输入变得越来越重,虽然之前的工作已经降低了长上下文计算的成本,但预填充仍然很昂贵,而大的KV缓存对存储和带宽的压力也很大。这个MoE加CED的设计本质上是在做计算量的优化,让不同阶段使用不同的参数子集。对我们做科学计算的人来说,这种架构创新其实指向了一个现实问题:当模型变得越来越大、上下文越来越长的时候,怎么还能保持可接受的部署成本?
最后一篇JEPA-Anything很有意思,它试图回答一个更根本的问题:能不能有一种通用的学习原则,可以支撑完全不同系统里的世界建模?作者提出了一个叫做正交预测分解的框架,英文叫OPF。它把潜在目标分解成互补的因素,通过专门的路径来学习,然后在共享的预测设计中进行重组。他们在七个完全不同的领域做了实验:视觉、临床轨迹、控制、分子动力学、物理场、天气等等。这个工作的野心很大,它想让一个统一的框架学会跨领域的预测能力。如果这能成,或许我们就不用为每个科学问题单独训练一个世界模型了。
好了,今天聊了五篇文章,从全模态推理、表格数据的Scaling、蒸馏细节、长上下文架构优化、到跨领域的通用世界建模。我有一个整体的感受:现在AI领域的一个明显趋势是“统一”和“泛化”在各个层面展开——模型层面要统一多模态,数据层面要统一不同领域的结构,学习范式上要找到通用的预测机制。而这种统一的野心,正在从纯NLP和视觉,逐步渗透到科学计算的地盘上。我们拭目以待。