Paper Morning 2026-08-07

2026-08-07

各位早上好,Paper Morning又和各位见面了。 今天想和大家聊聊一个正在深刻改变AI研究格局的主题——Agent训练范式的演进。如果你过去一年关注过LLM Agent的发展,会发现一个有趣的现象:模型能力在快速提升,但训练方法却似乎有些跟不上。我们有了强大的基座模型,却常常在“如何让Agent真正学会长程推理”这个问题上卡住。那今天的几篇论文,正好从不同角度回应了这个挑战。 先看第一篇OSReward,它提出的问题非常根本:当我们用VLM作为Agent轨迹的评判者时,这个评判到底可不可靠?这篇工作构建了一个系统性的benchmark,发现目前主流的VLM judge存在显著的偏差,而且这个偏差在不同平台、不同任务上很不一致。这个发现很重要,因为现在很多Agent的RL训练和数据筛选都依赖VLM作为奖励信号,如果评判本身不可靠,那整个训练框架的可靠性都要打个问号。这篇工作不是要否定VLM judge的价值,而是提醒我们:在把Agent训练交给自动化评估之前,我们需要先校准这些“裁判”。 那么,既然评判这么重要,我们该怎样给Agent的学习过程提供有效的监督信号呢?这就引出了接下来两篇关于credit assignment的工作。 AgentOPSD提出一个很有洞察的观点:传统的RL方法在长程多轮的agentic任务中,往往只能看到最终结果是好是坏,但很难知道过程中哪一步决策真正起了作用。它采用递归自蒸馏的方式,把token级别的teacher-student差异聚合到turn级别,再用贝叶斯更新的方法来重新分配信用。这样做的好处是,即使任务失败了,我们也能识别出哪些决策其实是正确的,只是被后续的失误拖累了。这种“让成功部分获得应有credit”的思路,对于训练真正有用的长程推理Agent非常重要。 ABSeeker则从另一个角度切入这个问题,叫做Answer-Backtracked Credit Assignment。它的核心思想更有意思:既然我们知道最终答案是对的还是错的,那能不能从这个结果反向追溯,去评价过程中的每一步?具体做法是把稀疏的轨迹级监督信号,转化为密集的步级监督信号。即便是失败的轨迹,也能区分出哪些动作是有价值的、哪些是冗余甚至错误的。这两篇工作加起来,其实就是在回答一个根本问题:如何让Agent学会从结果中学习,而不是被简单的模仿学习束缚。 但还有一个前置问题:训练数据从哪儿来?这就是RST的贡献了。它发现高质量的长程任务数据非常昂贵,人工标注一套任务的成本可能高达上千美元,而且很难规模化。RST提出用递归合成的方式,从少量验证过的种子任务出发,逐步扩展生成新的任务,并且自动确保指令、解决方案和验证器之间的一致性。十五轮递归下来,它生成了大量的高质量训练任务。这个工作的意义不只是合成数据本身,更重要的是它展示了如何在保证质量的前提下实现数据规模化,这直接回答了“Agent训练的数据从哪里来”这个瓶颈问题。 现在把这几篇串起来看,你会发现一个很清晰的脉络:RST解决了训练数据的规模化问题,AgentOPSD和ABSeeker解决了训练过程中信用分配的问题,OSReward则负责评估这些Agent的真实能力。这其实是一个从数据到训练到评估的完整pipeline,而每一环都有独特的创新。 今天的最后一篇论文是关于MEG脑磁图解码的,和前面几篇主题不太一样,但它提醒我们AI方法的边界正在拓展。这篇工作用CLIP-style的对比学习,从非侵入式的脑信号中恢复被试听到的语音片段。更特别的是,它重新设计了空间注意力机制,用球面调和函数替代了传统的扁平化传感器布局,并且在保证解码性能的同时大幅减少了subject-specific的参数。这让我想到一个更宏观的趋势:AI for Science正在从“用AI加速科学计算”逐步走向“用AI理解和交互物理世界”,脑机接口就是一个例子。当我们的Agent能力越来越强的时候,它们能不能帮助我们更好地理解大脑、更好地与生物系统交互?这是值得期待的方向。 好,今天的播报就到这里。回头看这几篇论文,一个整体的感受是:Agent研究正在从“堆参数、刷榜单”的阶段,真正走向“系统性地解决训练中的核心难题”。数据、信用分配、评估,这三个环节每一环都有创新,而且它们开始形成一种互相支撑的生态。这或许预示着,下一阶段的Agent发展重点,不再是更多的能力展示,而是更扎实的训练方法论。我们Paper Morning会持续关注这个方向的进展。各位周末愉快,下周见。

本期涉及论文