Paper Morning 2026-09-19

2026-09-19

各位早上好,Paper Morning 又和大家见面了。 今天想先从一个我们领域正在发生的大趋势聊起:过去几年,我们见证了 foundation model 在自然语言和图像领域的巨大成功,但现在,越来越多研究者开始把目光投向更广阔的场景——结构化数据、科学计算、乃至整个科研流程。这不,今天的几篇论文虽然没有直接挂上“AI4S”的标签,但细读之下,每一篇都在为科学智能添砖加瓦。 先来看 LimiX-2,这是 Tabular Foundation Model 领域的一个新进展。作者来自清华大学和 HuggingFace,提出的核心问题是:NLP 中预训练-微调这套范式,能不能迁移到结构化表格数据上?他们之前已经建立了 scaling laws,这次则是把模型和数据规模都往上推了一把。关键创新在于他们提出的 Contextual Mechanism Networks,简单说就是不再只学习 p(y|x, D_context) 这个条件概率,而是学习 p(x, y|D_context) 的联合分布,让模型理解数据生成的因果机制。这对科学计算意味着什么呢?我们知道很多科学问题本质上是从观测推断底层机制,如果模型能学会这种机制层面的表示,那它的泛化能力会远强于传统的回归模型。这条路走得通的话,未来的科学 AI 就不只是拟合数据,而是真正理解数据背后的物理规律。 说完模型层面的进展,我们把目光转向推理效率。DeepSeek-V4.1-Flash 这次带来了一个 552B 参数的 MoE 模型,支持百万 token 上下文,核心贡献在于 Causal Encoder-Decoder 架构和 KV cache 压缩。prefill 阶段只激活 8B 参数,但 decode 阶段是 16B,这是什么意思呢?相当于把长文档的预处理成本降了下来,而生成阶段保持高效。对于科学计算而言,这意味着我们可能有能力把整本教材、整个代码库、甚至整个实验数据流都喂给模型做上下文学习。长远来看,这种能力会是科学 AI agent 的基础设施。 接下来一篇很有趣,是关于 PPO 中 Critic 学习的问题。研究者发现了一个叫做“价值扁平化”的现象:虽然状态价值在不同中间态之间变化剧烈,但 Critic 的预测却相对平坦,导致训练不稳定。这个发现在 FrozenLake 环境下被验证,而且状态空间越大问题越严重。他们把根因归结为 critic loss 中隐含的方差惩罚,以及时间相关状态带来的冗余梯度。这项工作对我们有什么启发呢?想想看,如果我们要用 RL 来训练科学智能体,比如让 agent 自己设计实验方案、或者搜索化学分子空间,那么 value function 的可靠性至关重要。这篇工作算是给 RL 在科学领域的应用敲了个警钟,也提供了改进思路。 然后是置信度估计的工作。现在的语言模型经常会在不确定的时候也给出很自信的回答,这在科研场景是很危险的。XConf 这篇论文提出了一个很有洞察的想法:仅靠当前推理过程本身来判断置信度是不够的,模型应该结合自己积累的经验来做判断。具体做法是维护一个记忆库,记录过往任务的上下文、模型的自我反思、声称的置信度、以及实际outcome,从这些经验中学习更可靠的置信估计。这让我想到一个类比:人类专家的自信不是凭空来的,而是建立在多年经验基础上的。XConf 试图让模型也具备这种经验型的自信,而不是那种“幻觉型”的自信。对于科学应用来说,这种能力直接关系到系统能否安全地say no。 最后一篇 ScienceIDE 很契合我们 AI4S 社区的关切。作者认为科学代码库里蕴含着大量可执行的知识,但这些知识很难被现有的智能体利用——工具链碎片化、隐式的领域规范、专门的正确性标准,这些都是障碍。ScienceIDE 的做法是邀请领域专家定义一些验收标准,然后让智能体把代码库转换成可执行的环境,再基于这些环境做微调、强化学习和评估。本质上,它是在为科学 AI agent 搭建一个“训练场”和“健身房”。想象一下,如果 agent 能在真实的科学代码环境中学习和验证自己的想法,那将大大加速科学发现的自动化。 好,我们来总结一下今天的整体观察。这五篇论文看似分散,但从基础设施的视角看,它们其实在做同一件事:为科学智能构建更可靠的底层支撑——从模型架构、推理效率、训练稳定性、到置信校准、环境搭建。这让我觉得,AI for Science 可能正在进入一个新阶段:不再只是“用 AI 加速某个具体任务”,而是开始系统性地搭建科学智能的“操作系统”。这个操作系统能不能跑通,决定了我们能否真正走向“AI 科学家”的愿景。好了,今天的播报就到这里,我们下期再见。

本期涉及论文