今日概览
- 更大的教师不等于更可靠的蒸馏监督,OPD中的教师评分可能随规模增大而产生更多噪声,无教师的OPSA在AIME24上反而提升35.41分。
- PaperGym将科研计划评审变成可审计的奖励环境:通过分离问题与rubric来源,把评分标准泄漏率降至3.7%。
- CAST用动作级批评监督降低长程工具调用中的高代价错误风险。该方法让模型在零售任务连续通过率上超过GPT-OSS-120B逾10%,并迁移至远程医疗场景。
- NoisEasier无需微调即可修正视频对象关系,它在推理时优化扩散噪声,使属性绑定、物体交互等困难维度平均提高超过10%。
重点关注
01 训练优化 大教师未必带来更干净的蒸馏信号
大模型当老师,给出的反馈未必更可信:在on-policy distillation(OPD)中,教师需要评价学生生成、因而对自己属于离策略的轨迹,而摘要报告这种监督存在大量噪声,且噪声比例随教师规模增大。更反直觉的是,保留或移除这些噪声后,学生最终表现相近;真正推动学习的,似乎不是教师传递了多少知识,而是训练过程持续压低了低概率token。研究者甚至发现,用一个固定的负优势值替代教师评分,也能匹配原有方法的效果,并据此提出无需教师监督的OPSA:在高熵、模型最犹豫的位置施加强信号,抑制尾部token并重新分配头部概率。相比基础Qwen3-1.7B,它在AIME24上的Avg@32提升35.41分、相对增幅263%,并领先OPD16.77分;三个基准上的Pass@32均增长一倍以上。不过这些数字依赖多次采样指标,方法究竟改善了单次回答质量还是主要扩大了可命中答案的范围,仍需看全文确认。对训练团队更重要的提醒是:密集的token级反馈不天然比稀疏结果奖励可靠,部署OPD前应单独测量教师在学生轨迹上的判断质量,并用固定负反馈或无教师基线验证收益究竟来自「蒸馏」还是自我调整。
原文:Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
02 AI for Science 没有标准答案,研究计划该怎么获得可信奖励?
训练AI科学家的一大难点,是研究计划没有唯一正确答案,强化学习因而缺少可信的评审环境。PaperGym把论文拆成训练任务:从研究目标和背景生成问题,再从方法与实验提取评分准则,让rubric成为可审计的critic。这样的拆分专门防范「靠改写原文拿高分」,其评分标准泄漏率降至3.7%,而现有数据集为11.90%至34.10%。训练时,PaperGym先让模型参考评分准则学习,再用同一套准则提供GRPO奖励;在Qwen3-1.7B/4B/8B上,五项基准平均分别提升5.6、5.0和4.8分,且优于单独使用任一阶段或颠倒顺序。这个方向的价值不只是多造研究计划,而是把主观评价变成可检查的反馈工程;不过评分准则是否真正覆盖科研价值,仍需看全文和跨领域验证。
原文:PaperGym: Rubric-Centered Evolution for Research-Plan Generation
03 Agent 用动作级批评监督减少高代价错误
长程Agent的可靠性,不能只看整条任务最后是否成功:一次不可逆的错误动作,就足以让后续补救失去意义。CAST把稀疏任务结果转化为动作级监督,合成解释动作有效性的结构化理由,并用批评模型构造策略优化数据。基于Qwen3系列模型微调后,它在零售任务的连续4次通过率上超过GPT-OSS-120B逾10%,迁移到未见过的远程医疗场景时又带来9%的提升。对生产团队而言,这项工作的价值不只是提高平均成功率,而是提供一种利用动作级批评监督降低高代价局部失误风险的路径;不过批评模型自身的偏差如何影响策略,还需要看全文确认。
原文:CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents
04 视频生成 推理时优化噪声,摆对视频对象关系
细粒度文本对齐通常靠奖励微调,但每换一批提示词就可能重新训练,还容易诱发奖励投机。NoisEasier把修正移到推理阶段:不改模型权重,直接用可微奖励优化扩散噪声。它不只调整初始噪声,而是联合优化整条随机生成轨迹,并结合短步生成器与多目标奖励控制开销。摘要称,该方法在多个模型上都带来稳定提升,属性绑定、物体交互和数量理解等困难维度平均提高超过10%。这种即插即用的灵活性值得关注,但测试时优化并非零成本,奖励是否真正对应视频质量、会不会被投机,仍需看全文和更多真实场景验证。
原文:NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation

也值得关注
今日观察
OPD、PaperGym、CAST与PAC指向同一个后训练瓶颈:问题已不只是能否产生反馈,而是反馈能否同时保持可信、独立、及时且仍有学习价值。教师对学生轨迹的密集评分可能带噪;问题与rubric同源可能泄漏答案线索;轨迹末端奖励无法及时阻止错误退款等高代价不可逆动作;固定任务混合则会让已经掌握的内容持续消耗预算。这四类风险分别对应反馈管线的四项检查:评分者能否可靠评价当前策略生成的数据,评价标准是否独立于答案来源,信号能否定位到错误发生的时刻,以及任务权重是否随学习进度更新。下一轮后训练启动前,应把这四项检查写成上线门禁,并为每项设置可量化阈值、失败回退方案和定期复测机制。