今日概览
- TRM先按案例制定量规,再给出细粒度分数,PD-GRPO则缓解传统成对偏好优化导致的分数极化,为视觉生成强化学习提供更具体的奖励信号。
- SAKI按师生分歧切换监督方式:接受位置保留反向KL,纠正位置直接学习教师首选token;匹配工作负载的生成吞吐量提高到4.22倍。
- GEB让长视频记忆沿实体身份追踪。该方法在4个全天至整周录像基准上均获提升,EgoLifeQA准确率达到72.0%,比此前最佳结果高4.4个百分点。
重点关注
01 图像生成 先定评分标准,再打分会更准吗?
同一张生成图,直接压成一个总分,往往说不清它究竟该重点考察主体一致性、文字准确度,还是局部编辑有没有越界。TRM换了个顺序:先针对每个生成或编辑案例制定评价量规,明确「该评什么」,再据此逐项检查并给出细粒度分数。另一项贡献PD-GRPO解决的是不同问题——传统成对偏好优化可能把分数推向两极,而它在利用成对监督增强区分力的同时,尽量保留逐点评分能力。摘要称,TRM在图像生成与编辑基准上超过其他开源奖励模型,并能与闭源方案竞争;把它用于强化学习,也能持续改善多种视觉生成模型。这意味着奖励模型不再只是裁判,还能给训练过程提供更具体的改进方向。不过这些优势在多复杂的真实提示词和编辑需求上仍然成立,以及量规本身是否稳定可靠,还需要看全文和更多实际测试确认。
原文:Think Before You Score: Thinking Reward Model for Visual Generation
02 训练优化 师生分歧决定何时切换监督方式
学生采样的token若也能被教师接受,继续采用基于该token的反向KL监督,可以保留在线轨迹的信息;只有双方真正分歧、触发纠正时,才直接学习教师概率最高的token。SAKI用最大耦合把这种分歧显式化:纠正概率恰好等于教师与学生分布的总变差距离,因此同一个信赖域约束既控制轨迹偏移,也限制干预和特殊监督的频率。配套的推测验证器在保持目标轨迹分布不变的前提下,将匹配工作负载的生成吞吐量提高到4.22倍,但这更像工程保障,而非方法的核心卖点。在7个数学推理基准上,0.6B和1.7B学生都优于对应的教师引导基线;具体收益是否能迁移到代码、工具调用等任务,还需要更多实验确认。
原文:SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation
03 视频生成 找对片段还不够,视频记忆得先认出「还是它」
长视频问答的瓶颈可能不是没找到相关事件,而是系统不知道不同片段里的相似物体究竟是不是同一个。Grounded Entity Biographies(GEB)把同一物理实体跨片段的观察串成可检索的「传记」,同时保留它在每个时刻的上下文。回答问题时,模型会同时读取事件证据和实体传记,从按描述搜索推进到沿身份线索追踪对象。该方法在4个包含全天乃至整周录像的基准上均有提升,EgoLifeQA准确率达到72.0%,比此前最佳结果高4.4个百分点;消融实验还显示,单纯增加描述无法完全替代实体关联。真正值得关注的是记忆系统的组织单位正在变化,但身份关联在遮挡、外观变化和相似物体密集场景中的可靠性仍需看全文确认。
原文:Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies
