今日概览
- 特权信息可能让自蒸馏性能下降:DAPD用双路径与双来源锚定限制不可复现的教师行为,在Qwen3-4B多项任务上平均提升2.00分。
- 提前暴露未来轨迹会污染驾驶推理监督,Deferred Exposure先让模型选择候选轨迹,再用真实轨迹验证,避免教师为既成结果补写理由。
- 成熟自回归模型可低成本迁移到扩散解码。 DiffusionGemma使用不到原模型10%的训练token预算,单张H100吞吐约1500token/s。
- 语义RGBA图层让生成结果可以继续编辑;UniWorld-Design将对象作为独立资产交付,在Crello基准上降低37%的逐图层RGB误差。
重点关注
01 训练优化 特权信息越多,学生反而学得越差
教师掌握更多信息,竟可能让自蒸馏后的模型性能下降。问题不只是能力差距,而是「特权幻觉」:教师依赖训练时可见的额外信息做出正确行为,学生却在推理时拿不到这些信息,仍被训练得仿佛它们存在。DAPD用双路径锚定加入一条由学生自身条件构成的桥梁,只在信息相匹配的路径间对齐教师与学生,避免把学生无法复现的行为硬塞过去;再用双来源锚定进行双向约束,在保留正确性监督的同时,降低对特权教师的依赖。摘要报告称,该方法在Qwen3-4B的多项任务上平均超过常规在线自蒸馏2.00分,增益还随规模保持,在4B和32B模型上分别达到2.69和2.78分。更值得注意的启示是,后训练不能只问教师「够不够强」,还要检查每个监督信号是否建立在学生推理时可达的信息之上;具体实验设置与代价仍需看全文确认。
原文:DAPD: Dual-Anchored Policy Distillation
02 机器人 先看答案再写理由,自动驾驶模型真的学会决策了吗?
把车辆的真实未来轨迹提前交给教师模型,监督任务就从「根据当下场景做决策」悄悄变成了「为既成结果补写理由」。论文将这种现象称为轨迹锚定偏差:生成的思维链看似合理,因果上却未必忠实,在需要辨别关键因果关系的场景中还会带来更严重的幻觉。直接隐藏真实轨迹也不够,因为让模型开放式生成轨迹,会把高层决策与精确几何、车辆动力学混在一起。作者因此把规划改造成候选轨迹选择题,并在模型作出选择后才暴露真实轨迹,用它作为强化学习的验证目标;摘要报告称,这能改善驾驶推理,同时维持甚至增强通用视觉能力。对生产自动驾驶训练数据的团队,更重要的检查项不只是解释写得是否流畅,而是标注者在推理时是否提前看见了本应预测的结果。
原文:Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
03 推理加速 DiffusionGemma从成熟模型迁移到扩散解码
扩散式文本生成真正有意思的突破,可能不是一次并行处理256个token,而是成熟的自回归模型可以直接迁移过去。DiffusionGemma以Gemma 4为底座,用不到原模型训练token预算的10%完成两阶段微调,先学习双向去噪,再通过强化学习和采样器蒸馏兼顾质量与效率。报告称,它在单张NVIDIA H100上平均每次前向生成约20个token,吞吐约1500 token/s,并显著快于采用先进推测解码的自回归模型。更有潜力的是,模型仍能以较小性能损失进行自回归生成,为扩散与自回归混合解码留下了空间。不过这仍是实验性开放权重模型,并行处理256个token不等于端到端加速256倍,工程价值还要看质量、迭代次数和硬件利用率能否同时兑现。
原文:DiffusionGemma Technical Report
04 图像生成 生成模型的下一步,是交付可继续工作的设计稿吗?
扁平图片一旦进入后续设计流程,局部移动、删除和复用都会暴露结构缺失的问题。UniWorld-Design把语义RGBA图层——带透明通道、对应完整对象的独立资产——作为生成、理解和编辑的基本单位,既能从文本生成素材,也能把成图拆成有顺序的完整图层。由于模型学习的是完整对象而非可见像素切片,移走或删除某个图层后,其余内容仍有望保持可用,这有望降低后续修改、复用和代理式编辑的成本。在Crello基准上,它将逐图层RGB误差降低37%,Alpha Soft IoU相对提升34%,但这些指标能否转化为真实设计流程中的时间节省,仍需看全文和实际工作流验证。对做设计工具或内容生产Agent的团队来说,值得重新评估的不是模型能否再多画好一点,而是输出是否保留了足够的结构。
原文:UniWorld-Design: From Pixel Generation to Layer-Native Design

也值得关注
今日观察
DAPD、Deferred Exposure、TurnSight与PCSD共同指向同一个后训练审计问题:监督密度增加,并不自动意味着学习信号更好。教师若看过答案、真实未来轨迹或逐轮后见上下文,确实可能产出更完整的解释与更细的反馈,但其中也可能混入学生部署时无法获得的证据、为结果补写的因果链,以及由局部偶然一致性制造的噪声。这样的教师可以在训练日志中显得更聪明,却未必提供学生能够独立复现的策略。
因此,后训练评估不能只看最终奖励是否上升,还要分别检查决策可达性与跨步骤一致性:移除特权信息后,学生是否仍能作出同样选择;把监督放进更长的交互轨迹后,策略是否继续稳定。下一轮构造教师分支时,应为每类答案、未来状态和后见上下文登记明确的可见边界,并加入「移除特权信息后的决策复现率」和「跨步骤一致率」两项独立验证。