Paper Morning 2026-09-10
2026-09-10
各位早上好,今天周四,Paper Morning开播了。
最近AI圈有个很有意思的现象:各个方向的研究者似乎都在做同一件事——让系统学会“自己教自己”,而不是完全依赖人类提供的数据或者标注。今天要聊的几篇论文,虽然 topic 看起来比较分散,有自动驾驶、有 RL 训练框架、有语音生成、有视频蒸馏,还有人机交互,但它们背后其实都贯穿着一条主线:如何在闭环环境里,让模型通过交互和反馈来获得超越人类演示的能力。
先来看 DriveZero这篇工作。它做的是端到端自动驾驶,但有意思的是,作者们指出了一个很根本的问题:现在大多数端到端系统都是模仿学习,学的是人类司机的行车数据,这就意味着模型的表现永远被人类数据质量和覆盖范围所限制。DriveZero 尝试打破这个天花板,它把驾驶任务拆成感知模型和动作模型两部分来分别预训练,然后再组合成完整的 planner。这里有一个很值得我们关注的点:感知需要海量的多样化视觉数据来理解世界,而动作模型需要闭环反馈来学会与环境交互——这两者的学习范式天然就不同。作者在动作侧引入了 DriveRL,一个混合智能体的闭环强化学习框架,把真实驾驶场景的交互信号利用起来。这让我想到我们在做 PDE 求解或者物理模拟的时候,是不是也可以借鉴这种思路?不是说简单地收集更多标注数据,而是让模型在求解过程中获得反馈信号,自主地去探索更好的求解策略。
接着看 Miles v0.1,这个工作很有意思,它是一个生产级别的 RL 后训练全栈系统。提到 RL 训练,很多人的印象可能还是停留在科研阶段的单卡实验,但 Miles 想要解决的是如何在工业级规模上可靠地跑 RL。它基于 SGLang 构建了 rollout engine,trainer 支持 NVIDIA Megatron-LM 和 PyTorch FSDP 两种后端,还设计了三种权重同步传输方案来适配不同的部署拓扑。这篇论文让我想到 AI4S 领域的一个现实问题:我们有了很好的 neural operator 架构、很好的物理先验建模方法,但如何在大规模科学计算任务上高效地训练和部署这些模型?基础设施层面的创新往往是被低估的,而 Miles 至少在 RL 这个具体方向上给出了比较完整的工程答案。它还支持 LoRA RL、on-policy 蒸馏和监督微调,说明作者们也在探索不同参数规模下的训练策略灵活性。
然后是 Mask Forcing这篇关于视频扩散蒸馏的工作。它解决的问题是:如何把一个预训练好的双向扩散模型蒸馏成自回归的生成模型,同时保持高质量。之前的 DMD 方法在蒸馏过程中容易出现过度饱和和平滑的问题,作者们发现这其实是因为 reverse KL 目标天然具有 mode-seeking 的特性,容易让学生分布塌缩到教师分布的少数几个 mode 上。Mask Forcing 的核心思路很有意思,它在自回归学生的自我 rollout 过程中引入双噪声掩码 rollout,用扰动的方式来缓解这种 mode collapse。听起来是个很技术性的改进,但我更关心的是它背后反映的趋势:生成模型正在从单向扩散走向自回归架构,而蒸馏是把大模型能力迁移到高效架构的重要手段。在科学计算里,我们其实也经常面对类似的需求——如何在保持精度的前提下降低推理成本。
第四篇 AuK 是一个语音生成和编辑的开源基础模型。它用大约 30 亿条指令-音频对和近 200 万小时的监督数据,覆盖了语音生成、内容编辑、增强分离、副语言编辑和声学编辑五类任务。架构上,它结合了多模态大语言模型做语义条件化,以及一个联合训练的 VAE 做声学条件化,最后用混合 rectified-flow Transformer 来生成。这篇论文让我注意到一个趋势:语音领域正在快速向“统一模型”演进,一个模型能够通过自然语言指令完成多种语音处理任务。这和我们在科学计算里追求的 foundation model 其实是一致的——一个模型能够处理各种下游任务,而不是为每个任务单独训练一个模型。
最后来看 Gander,也就是 Omni Interaction Agent。它试图在单一框架里统一多模态感知、实时交互和 agent 能力。传统的对话系统往往是 turn-based 的,但 Gander 采用的是 continuous 范式,可以同时接收视频、语音、文本等多模态流式输入,用户可以随时打断模型,模型也可以主动提供中间反馈或者追问问题。为了实现这个,它设计了 Cerebellum-Brain 协作框架,Cerebellum 负责实时交互和全双工对话,Brain 处理更深层的推理和规划。这个设计理念很有意思,它把快速响应和深度思考分离开来,类似人脑的小脑和大脑的分工。我们在做科学计算的 agent 时,可能也需要这种分离:有些任务需要即时反馈,有些任务需要更深入的推理和规划。
好,今天的论文聊完了,我来总结一下整体的观察。这五篇论文看起来涉及不同领域,但它们其实都在回答一个共同的问题:如何构建能够超越人类数据限制、通过交互和反馈自主进化的 AI 系统。无论是自动驾驶的闭环 RL 训练、生产级 RL 系统的工程化、视频生成的蒸馏技术、语音的统一基础模型,还是人机交互的新范式,都在指向同一个方向——未来的 AI 系统不仅仅是模仿人类知识,而是在与环境的持续交互中发展出超越人类的能力。对于我们做 AI4S 的人来说,这其实是个很好的启示:科学计算本身就是一个天然的闭环环境,有明确的反馈信号,也许我们可以更勇敢地去探索那些不依赖人类标注数据的学习范式。
好了,今天的早间播报就到这里,我们明天见。