Paper Morning 2026-10-07
2026-10-07
各位早上好,今天Paper Morning开播。
我想先从一个观察说起。这几年我们看到foundation model从NLP、CV火到了科学计算领域,很多人都在问:预训练范式到底能给科学问题带来什么?今天的几篇论文刚好从不同角度回答了这个问题。
先看遥感方向的进展。GeoSET提出了第一个通用的SAR到EO图像转换foundation model。我们知道SAR和EO是两种非常不同的观测手段,SAR是主动微波,EO是可见光或红外,传统方法往往针对特定传感器、特定分辨率训练一个模型。但GeoSET用了超过三百万对高质量数据,涵盖多种传感器和分辨率,训练了一个统一的“通用翻译器”。这让我想到NLP里GPT的做法——大数据、大模型、统一框架。遥感数据的多样性其实比自然图像更复杂,能在这种条件下学到跨传感器、跨分辨率的通用表征,背后的思路值得思考:它是怎么处理speckle噪声这种SAR特有的问题的?pretrain阶段用的图像生成器又是怎么和SAR encoder结合的?这些问题对其他科学领域的跨模态学习很有借鉴意义。
不过,模型能力强了之后,我们还得问一句:它对所有数据都一视同仁吗?FairRSFM就提出了一个很关键的问题:遥感foundation model在评估时往往只看整体准确率,但这背后可能掩盖了不同生态区域之间的显著差异。他们构建了一个biome-aware的benchmark,把14类陆地生物群落分成6个宏观组,结果发现aggregate performance确实会隐藏系统性的偏差。比如某个模型在热带雨林表现很好,但在干旱地区可能一塌糊涂。这其实是在提醒我们:foundation model的scaling不只是追求平均指标,更重要的是理解模型在不同数据分布上的行为。这种思路和AI4S中对PDE求解器在各种物理 regime 下的鲁棒性关注是一致的——我们需要的不是一个只在平均意义上好的模型,而是对分布外数据有清晰认识的模型。
今天播报的另外两篇论文虽然和AI4S的直接关联稍弱,但也很有意思。In-Distribution Forcing解决的是长视频生成中的drifting问题,用的方法是确保KV cache保持在训练分布内。这个思路其实和物理模拟中防止误差累积有相通之处——当autoregressive生成过程偏离了训练数据支持的区域,后续的预测就会越来越离谱。Inverse Distillation Unlearning则是让模型“忘记”某些训练数据,这在版权和隐私问题日益重要的今天很有价值。
今天的整体观察是:foundation model正在从“刷榜”走向“理解分布”。不管是遥感里的通用翻译器,还是公平性评估,都不再只追求单一指标的提升,而是在问:这个模型到底学到了什么?它对不同场景的表现为何不同?这种从performance到understanding的转变,或许正是预训练范式进入深水区的标志。我们下次再会。