TRM先定量规,SAKI匹配负载吞吐提至4.22倍

今日概览

  • TRM先按案例制定量规,再给出细粒度分数,PD-GRPO则缓解传统成对偏好优化导致的分数极化,为视觉生成强化学习提供更具体的奖励信号。
  • SAKI按师生分歧切换监督方式:接受位置保留反向KL,纠正位置直接学习教师首选token;匹配工作负载的生成吞吐量提高到4.22倍。
  • GEB让长视频记忆沿实体身份追踪。该方法在4个全天至整周录像基准上均获提升,EgoLifeQA准确率达到72.0%,比此前最佳结果高4.4个百分点。

重点关注

01 图像生成 先定评分标准,再打分会更准吗?

同一张生成图,直接压成一个总分,往往说不清它究竟该重点考察主体一致性、文字准确度,还是局部编辑有没有越界。TRM换了个顺序:先针对每个生成或编辑案例制定评价量规,明确「该评什么」,再据此逐项检查并给出细粒度分数。另一项贡献PD-GRPO解决的是不同问题——传统成对偏好优化可能把分数推向两极,而它在利用成对监督增强区分力的同时,尽量保留逐点评分能力。摘要称,TRM在图像生成与编辑基准上超过其他开源奖励模型,并能与闭源方案竞争;把它用于强化学习,也能持续改善多种视觉生成模型。这意味着奖励模型不再只是裁判,还能给训练过程提供更具体的改进方向。不过这些优势在多复杂的真实提示词和编辑需求上仍然成立,以及量规本身是否稳定可靠,还需要看全文和更多实际测试确认。

评估复杂视觉任务时,先明确个案标准比直接输出总分更有解释力不要混淆两项贡献,量规决定「评什么」,PD-GRPO负责减少成对训练带来的分数极化做图像生成强化学习的团队,可重点验证细粒度奖励能否带来比单一标量更稳定的优化信号

02 训练优化 师生分歧决定何时切换监督方式

学生采样的token若也能被教师接受,继续采用基于该token的反向KL监督,可以保留在线轨迹的信息;只有双方真正分歧、触发纠正时,才直接学习教师概率最高的token。SAKI用最大耦合把这种分歧显式化:纠正概率恰好等于教师与学生分布的总变差距离,因此同一个信赖域约束既控制轨迹偏移,也限制干预和特殊监督的频率。配套的推测验证器在保持目标轨迹分布不变的前提下,将匹配工作负载的生成吞吐量提高到4.22倍,但这更像工程保障,而非方法的核心卖点。在7个数学推理基准上,0.6B和1.7B学生都优于对应的教师引导基线;具体收益是否能迁移到代码、工具调用等任务,还需要更多实验确认。

在线蒸馏可按师生是否分歧来路由监督,而不必所有token统一处理最大耦合让干预频率成为可计算、可约束的训练信号评估类似方案时,应分别看监督机制带来的质量收益与推测验证带来的吞吐收益

03 视频生成 找对片段还不够,视频记忆得先认出「还是它」

长视频问答的瓶颈可能不是没找到相关事件,而是系统不知道不同片段里的相似物体究竟是不是同一个。Grounded Entity Biographies(GEB)把同一物理实体跨片段的观察串成可检索的「传记」,同时保留它在每个时刻的上下文。回答问题时,模型会同时读取事件证据和实体传记,从按描述搜索推进到沿身份线索追踪对象。该方法在4个包含全天乃至整周录像的基准上均有提升,EgoLifeQA准确率达到72.0%,比此前最佳结果高4.4个百分点;消融实验还显示,单纯增加描述无法完全替代实体关联。真正值得关注的是记忆系统的组织单位正在变化,但身份关联在遮挡、外观变化和相似物体密集场景中的可靠性仍需看全文确认。

做长视频问答时,检索命中事件不等于找对对象实体级记忆适合需要跨时间追踪物品、人物或设备的应用评估这类系统应单独检查身份关联错误,而不只看最终问答准确率
TRM先定量规,SAKI匹配负载吞吐提至4.22倍

也值得关注

04
异构模型的互补轨迹能补上全失败训练组 训练优化GRAFT替换全失败训练组,并以序列兼容性加权和词元级重要性比率裁剪控制跨模型偏差。链接
05
不扩充潜在表示,也能融合多层视觉细节 图像生成HiRAE以深层表示为锚点,在范数预算约束下加入各层残差信息,改善重建与文生图对齐。链接
06
先验证动作,再把成败经验带给机器人 机器人Real2Gym通过原生物理执行验证演示或重定向动作,并将成功尝试与失败提炼为流程、相对物体运动和恢复策略,无需更新底层模型权重。链接
07
模型可能改主意的位置,才值得重点探索 训练优化HDL根据事后反馈引起的词元似然变化定位分支点,仅从关键位置采样替代后续,在减少生成词元的同时集中探索决策。链接
08
多轮智能体可以先行动,再异步补齐推理 AgentActFirst-OPD将环境动作执行与完整推理生成解耦,先推进交互,再生成用于教师监督的思考—行动响应。链接
09
每项视频能力在同一骨干家族只需蒸馏一次 视频生成LongLive-Plug将单次CFG、少步采样和长上下文纠错分别蒸馏为可复用LoRA,再部署到兼容下游模型。链接
10
确定性几何代码能把空间查询模板扩展成数据 多模态Exemplar2VQA让协作智能体调用几何工具,将多样的静态、以物体为中心的查询模板扩展为大规模合成3D问答数据。链接