今日概览
- DiffusionOPSD在20种设置中19种居首:它把图像终点奖励转成当前策略轨迹上的逐步去噪目标,最高领先最强对手44.0%,训练GPU时长减少40%和63%。
- 记忆问答提分未换来满意度提升,直接问答准确率从19.7%升至70.1%,但真实对话能否适时、自然地引用记忆才与体验相关。
- OPDVR让逐token建议服从任务级验收。在线蒸馏提供密集指导,可验证奖励守住正确性,两类信号在当前策略轨迹上协调。
- TorchMorph补上GPU流水线的形态学断点:22个批量算子支持多达八个空间维度,避免CPU往返悄悄抵消端到端加速收益。
重点关注
01 图像生成 终点打分再准,也教不会每一步怎么去噪?
扩散模型偏好对齐有个关键断层:图像级奖励能判断最终结果好不好,却无法直接告诉中间去噪预测该往哪里改。DiffusionOPSD把奖励梯度转成围绕当前预测的正负目标,再让模型通过自蒸馏学习这些显式监督信号,相当于把模糊的终点评价拆成每一步都能执行的修改建议。更有意思的是,它使用当前行为策略实际生成的轨迹来取样状态,让训练目标紧贴模型真正会访问的生成路径,减少「训练时学一种状态、生成时遇到另一种状态」的错位。摘要披露的控制实验还揭示了一个容易忽略的问题:目标在理论上带来的改进越大,经过一次训练更新后实际兑现的收益未必越大,因此目标设计和模型能否学进去需要分开评估。在两个扩散模型、十个评估器组成的20种设置中,该方法有19种取得最佳最终留出集得分,最高领先最强对手44.0%;相比DiffusionNFT,训练GPU时长分别减少40%和63%。这些结果让「在当前策略轨迹上制造可学习目标」成为一条很值得关注的后训练路线,不过具体画质、多样性及跨奖励泛化表现仍需看全文确认。
原文:On-Policy Self-Distillation in Diffusion Models
02 评测 问得出来的记忆,未必聊得出来
四个月、40名用户、1,872次会话和7种记忆条件揭示了一个反直觉结果:直接问答准确率从19.7%升到70.1%,用户满意度却没有变化。原因可能在于,直接问答只测试「被问到时能否取回」,真实对话还要求系统主动判断何时相关,并把旧信息自然地融入回应。更夸张的是,在模型和上下文固定时,同一系统直接问答得分达到78.8%,实际对话中却只引用了7.9%的相关事实,相差近71个百分点。摘要结果显示,自然融入记忆与满意度相关,而直接问答无关,不过这仍是关联而非因果,需要看全文确认具体控制方式。做记忆产品的团队因此应该把「何时提及、怎样提及、是否改善交互」纳入核心评测,而不是继续单押事实召回率。
03 训练优化 老师给建议、结果来验收,能让训练信号不再互相打架吗?
大模型后训练常卡在两种不完整的反馈上:可验证奖励只告诉模型答案对不对,却难以指出每一步该怎么改;在线蒸馏能提供逐token指导,却可能让模型继承老师的错误上限。OPDVR尝试在当前策略生成的轨迹上协调两者:先根据整条轨迹是否正确重写蒸馏的隐式奖励,再用ReLU门控让正确轨迹获得非负奖励、错误轨迹获得非正奖励。这样,老师的分布仍提供密集建议,但建议必须服从任务的硬验收,而且不需要额外引入权重或切换阈值。摘要显示,该方法可直接接入GRPO等策略梯度算法,并在六个推理基准上持续优于标准在线蒸馏,不过具体提升幅度仍需看全文确认。对训练团队而言,真正值得借鉴的不是把两种损失放在一起,而是让逐步指导与最终正确性在模型自己的轨迹上保持方向一致。
原文:On-policy Distillation with Verifiable Reward
04 训练优化 真正拖慢GPU训练的,可能是一个「预处理」算子
训练流水线已经跑在GPU上,不代表它真的实现了端到端加速:一次形态学处理若只能调用CPU实现,就要把张量搬出设备再搬回来。TorchMorph补的是这个基础设施缺口,提供22个可直接处理批量张量的算子,并支持多达八个空间维度,覆盖传统工具常缺失的三维场景和复杂结构元素。它的接口刻意贴近SciPy,已有流程理论上只需少量修改就能迁移。相比单线程SciPy基线,灰度形态学的吞吐量最高提升约1100倍,精确欧氏距离变换最高约350倍,但这些数字不能直接等同于整体训练提速。更实际的价值是消除设备往返这个系统断点;最终收益仍取决于形态学算子在真实流水线中的调用频率和数据规模。

也值得关注
今日观察
DiffusionOPSD、OPDVR和错误代码驱动的测试合成指向同一个训练设计问题:反馈究竟应该以多细的分辨率进入学习过程。终点信号擅长确认整条轨迹是否朝着正确方向前进,却难以定位具体该改哪一步;状态级、步骤级或token级信号能够提供修改坐标,但也更容易诱导模型迎合局部代理指标。关键不是用密集奖励取代稀疏奖励,而是让两者形成制衡:中间反馈负责分配信用、缩小搜索范围,可验证终点负责校准方向并阻止局部目标漂移。实践中,先逐段审计训练轨迹,找出奖励无法定位责任的位置,再为这些缺口补充对应粒度的监督,同时保留独立、可验证的终点验收作为锚点。