OPSA让AIME24提升35.41分

今日概览

  • 更大的教师不等于更可靠的蒸馏监督,OPD中的教师评分可能随规模增大而产生更多噪声,无教师的OPSA在AIME24上反而提升35.41分。
  • PaperGym将科研计划评审变成可审计的奖励环境:通过分离问题与rubric来源,把评分标准泄漏率降至3.7%。
  • CAST用动作级批评监督降低长程工具调用中的高代价错误风险。该方法让模型在零售任务连续通过率上超过GPT-OSS-120B逾10%,并迁移至远程医疗场景。
  • NoisEasier无需微调即可修正视频对象关系,它在推理时优化扩散噪声,使属性绑定、物体交互等困难维度平均提高超过10%。

重点关注

01 训练优化 大教师未必带来更干净的蒸馏信号

大模型当老师,给出的反馈未必更可信:在on-policy distillation(OPD)中,教师需要评价学生生成、因而对自己属于离策略的轨迹,而摘要报告这种监督存在大量噪声,且噪声比例随教师规模增大。更反直觉的是,保留或移除这些噪声后,学生最终表现相近;真正推动学习的,似乎不是教师传递了多少知识,而是训练过程持续压低了低概率token。研究者甚至发现,用一个固定的负优势值替代教师评分,也能匹配原有方法的效果,并据此提出无需教师监督的OPSA:在高熵、模型最犹豫的位置施加强信号,抑制尾部token并重新分配头部概率。相比基础Qwen3-1.7B,它在AIME24上的Avg@32提升35.41分、相对增幅263%,并领先OPD16.77分;三个基准上的Pass@32均增长一倍以上。不过这些数字依赖多次采样指标,方法究竟改善了单次回答质量还是主要扩大了可命中答案的范围,仍需看全文确认。对训练团队更重要的提醒是:密集的token级反馈不天然比稀疏结果奖励可靠,部署OPD前应单独测量教师在学生轨迹上的判断质量,并用固定负反馈或无教师基线验证收益究竟来自「蒸馏」还是自我调整。

不要把更大教师等同于更可靠监督,先量化其在学生轨迹上的噪声为OPD加入固定负优势等消融基线,确认教师知识是否真的贡献增益评估OPSA类方法时同时检查单次准确率与多次采样指标,避免被Pass@32放大的收益误导

02 AI for Science 没有标准答案,研究计划该怎么获得可信奖励?

训练AI科学家的一大难点,是研究计划没有唯一正确答案,强化学习因而缺少可信的评审环境。PaperGym把论文拆成训练任务:从研究目标和背景生成问题,再从方法与实验提取评分准则,让rubric成为可审计的critic。这样的拆分专门防范「靠改写原文拿高分」,其评分标准泄漏率降至3.7%,而现有数据集为11.90%至34.10%。训练时,PaperGym先让模型参考评分准则学习,再用同一套准则提供GRPO奖励;在Qwen3-1.7B/4B/8B上,五项基准平均分别提升5.6、5.0和4.8分,且优于单独使用任一阶段或颠倒顺序。这个方向的价值不只是多造研究计划,而是把主观评价变成可检查的反馈工程;不过评分准则是否真正覆盖科研价值,仍需看全文和跨领域验证。

训练开放式科研能力时,先建设可信评审环境比单纯扩充生成数据更重要问题与评分标准应从论文不同部分提取,以降低答案泄漏和改写套利评估此类系统时,既要看分数提升,也要审查rubric能否代表真实科研质量

03 Agent 用动作级批评监督减少高代价错误

长程Agent的可靠性,不能只看整条任务最后是否成功:一次不可逆的错误动作,就足以让后续补救失去意义。CAST把稀疏任务结果转化为动作级监督,合成解释动作有效性的结构化理由,并用批评模型构造策略优化数据。基于Qwen3系列模型微调后,它在零售任务的连续4次通过率上超过GPT-OSS-120B逾10%,迁移到未见过的远程医疗场景时又带来9%的提升。对生产团队而言,这项工作的价值不只是提高平均成功率,而是提供一种利用动作级批评监督降低高代价局部失误风险的路径;不过批评模型自身的偏差如何影响策略,还需要看全文确认。

高风险工具调用应利用动作级监督降低错误风险,而不是只依赖任务结束后的奖励训练数据可以从Agent轨迹与稀疏任务结果中合成动作有效性的结构化理由,减少对纯提示词批评器的依赖评估生产Agent时应关注跨步骤、跨多次运行的稳定通过率,而非单次成功率

04 视频生成 推理时优化噪声,摆对视频对象关系

细粒度文本对齐通常靠奖励微调,但每换一批提示词就可能重新训练,还容易诱发奖励投机。NoisEasier把修正移到推理阶段:不改模型权重,直接用可微奖励优化扩散噪声。它不只调整初始噪声,而是联合优化整条随机生成轨迹,并结合短步生成器与多目标奖励控制开销。摘要称,该方法在多个模型上都带来稳定提升,属性绑定、物体交互和数量理解等困难维度平均提高超过10%。这种即插即用的灵活性值得关注,但测试时优化并非零成本,奖励是否真正对应视频质量、会不会被投机,仍需看全文和更多真实场景验证。

提示词分布经常变化时,可优先评估不改权重的测试时优化超过10%的困难维度增益说明噪声轨迹本身是有效控制入口部署决策不能只看对齐分数,还要核算额外推理成本与奖励投机风险
OPSA让AIME24提升35.41分

也值得关注

05
一阶段像素空间扩散叠加线性注意力,探索深度估计能否同时保住生成式质量与部署效率。 模型架构Lapis将两种设计整合进生成式深度估计框架。链接
06
几何题上的测试时扩展为何失效,以及如何重新激活多次推理带来的收益。 推理研究聚焦平面几何中的视觉感知与多步符号推导。链接
07
把多模态RAG从单图和封闭文档设定推向更接近真实知识库的多图检索场景。 检索Doc-REFRAG重新审视真实多模态文档中的检索增强生成。链接
08
韩语音节内部的字母单元错误揭示了普通字符扰动测试覆盖不到的语言特有脆弱面。 安全对齐研究量化并缓解韩语Jamo级拼写扰动风险。链接
09
无需重新训练,通过跨模型家族的表征引导恢复专业模型在微调后受损的安全性。 安全对齐方法把安全干预从token级指导推进到推理时内部表征控制。链接
10
当选择题榜单趋于饱和,用概率景观审计题目质量可能比继续堆高难题更重要。 评测该方法从模型响应概率分布检查MCQA基准。链接
11
针对每个场景实时调整HDR色调映射,让既有低动态范围检测器更充分利用高动态范围信息。 多模态场景自适应方案面向HDR目标检测中的动态范围转换。链接
12
会自行生成和演化技能的Agent也打开了新的攻击面,需要把恶意技能注入纳入红队测试。 AgentEvoSkill Injection检验自演化技能体系的注入风险。链接
13
把高资源语言中的内部特征迁移给低资源语言,为缩小跨语言推理差距提供模型内部干预路径。 推理研究针对语义相同任务在不同语言间的性能落差。链接
14
检测视觉幻觉不能只看模型有多自信,还要区分它是否真正依赖了对应的图像证据。 多模态VisER联合分析视觉证据与模型依赖程度。链接
15
多任务RL的数据配比不必固定,可根据训练进展动态调整仍然有学习价值的任务。 训练优化PAC用进度增强的优势课程减少已掌握任务继续占用训练预算。链接

今日观察

OPD、PaperGym、CAST与PAC指向同一个后训练瓶颈:问题已不只是能否产生反馈,而是反馈能否同时保持可信、独立、及时且仍有学习价值。教师对学生轨迹的密集评分可能带噪;问题与rubric同源可能泄漏答案线索;轨迹末端奖励无法及时阻止错误退款等高代价不可逆动作;固定任务混合则会让已经掌握的内容持续消耗预算。这四类风险分别对应反馈管线的四项检查:评分者能否可靠评价当前策略生成的数据,评价标准是否独立于答案来源,信号能否定位到错误发生的时刻,以及任务权重是否随学习进度更新。下一轮后训练启动前,应把这四项检查写成上线门禁,并为每项设置可量化阈值、失败回退方案和定期复测机制。