Paper Morning 2026-09-04

2026-09-04

各位早上好,今天周五,Paper Morning又和大家见面了。 先说一篇很有意思的工作,SolarWM,做视频世界模型的。现在世界模型火得不行,但真正能打的开源方案很少。这篇工作最让我觉得实在的地方,是他们把数据pipeline和模型架构解耦了。你知道现在训练一个视频生成模型,数据来源五花八门,时间尺度、相机几何、视觉质量、运动模式都不一样,直接混在一起训效果肯定拉跨。SolarWM搞了一个可配置的多源数据引擎,把来自10个数据集的143万clip统一成了标准化的帧级标注。这个思路其实很像我们做科学计算数据清洗时的规范化流程,只是他们把它产品化了。 backbone-native adaptation framework也很关键,让不同架构的视频生成器都能复用这套数据。我觉得这件事的真正意义在于,它为世界模型的规模化训练扫清了工程障碍。过去我们老说缺数据、缺算力,但数据质量参差不齐、训练流程不稳定这些问题,往往比缺数据更致命。SolarWM至少在工程层面给出了解法。 说完世界模型,再看一篇关于agent基础设施的工作,Repo-To-Skill。这个工作提出的问题我觉得特别本质:现在的agent再强,也只是把模型本身的能力调用起来,但真正让一个方法work的那些trick、那些know-how,其实都在GitHub仓库和论文里写着,只是没人帮agent把它们蒸馏出来。Repo-To-Skill做的事情,就是把这种操作性知识变成可复用的技能单元。他们提出的DisCo agent可以在研究任务中动态调用这些技能。这个思路让我想到科学计算里的工作流系统——以前我们也是把求解器的调用流程封装成标准接口,让研究者能复用。现在只不过把这一套搬到了agent的设计空间里,而且 distillation出来的技能是可以跨任务迁移的,这就有意思了。 接下来聊一篇评估相关的工作,EarlyEval。现在大家训agent都训得很欢,但评估成本已经高到离谱了——前沿模型跑一个benchmark就要几百上千美元,而且还要反复迭代。EarlyEval的思路很直接:agent的最终成败,其实在中间过程里就能看出来。他们用轻量级的LightGBM模型来预测成功或失败,提前判断这个case还要不要跑完。听起来简单,但这个思路其实很深刻,它揭示了一个问题:我们以前做评估,都是等agent把所有动作都执行完才打分,这里面有很大的计算浪费。EarlyEval在保留评估准确度的前提下大幅降低成本,这对整个agent迭代开发流程是很有意义的。 最后一篇想说说Aspire,关于模糊目标下的自我进化。这个问题问得很有意思:人类学习常常是从一个模糊的目标开始的,比如“成为一个更好的研究者”,但现在LLM的自我进化都是给定具体任务和指标的。Aspire这个benchmark就是让agent在只有自然语言目标、且下游任务不公开的情况下去自己决定学什么、怎么学、如何验证。这其实触及了元学习和自主性的根本问题。虽然目前看来现有模型在模糊目标下的表现还比较初步,但这个benchmark的设计本身很有价值——它把“知道自己不知道什么”这个问题暴露出来了。 今天的这几篇工作,表面上看是世界模型、agent基础设施、评估方法、自我进化,看起来比较分散,但我感觉它们都在回答一个共同的问题:怎么让AI系统更自主、更可持续地变强?SolarWM解决的是训练基础设施的标准化,Repo-To-Skill是在扩展agent的能力边界,EarlyEval在降低迭代成本,Aspire则在探索自主学习的天花板。这几条线如果能汇合到一起,或许就是下一代AI4S系统的样子。 好了,今天的播报就到这里,我们明天见。

本期涉及论文