DAPD提升2分,扩散解码达1500token/s

今日概览

  • 特权信息可能让自蒸馏性能下降:DAPD用双路径与双来源锚定限制不可复现的教师行为,在Qwen3-4B多项任务上平均提升2.00分。
  • 提前暴露未来轨迹会污染驾驶推理监督,Deferred Exposure先让模型选择候选轨迹,再用真实轨迹验证,避免教师为既成结果补写理由。
  • 成熟自回归模型可低成本迁移到扩散解码。 DiffusionGemma使用不到原模型10%的训练token预算,单张H100吞吐约1500token/s。
  • 语义RGBA图层让生成结果可以继续编辑;UniWorld-Design将对象作为独立资产交付,在Crello基准上降低37%的逐图层RGB误差。

重点关注

01 训练优化 特权信息越多,学生反而学得越差

教师掌握更多信息,竟可能让自蒸馏后的模型性能下降。问题不只是能力差距,而是「特权幻觉」:教师依赖训练时可见的额外信息做出正确行为,学生却在推理时拿不到这些信息,仍被训练得仿佛它们存在。DAPD用双路径锚定加入一条由学生自身条件构成的桥梁,只在信息相匹配的路径间对齐教师与学生,避免把学生无法复现的行为硬塞过去;再用双来源锚定进行双向约束,在保留正确性监督的同时,降低对特权教师的依赖。摘要报告称,该方法在Qwen3-4B的多项任务上平均超过常规在线自蒸馏2.00分,增益还随规模保持,在4B和32B模型上分别达到2.69和2.78分。更值得注意的启示是,后训练不能只问教师「够不够强」,还要检查每个监督信号是否建立在学生推理时可达的信息之上;具体实验设置与代价仍需看全文确认。

设计蒸馏管线时,应把训练与推理的信息边界列为一等约束教师依赖学生不可见的信息时,更强监督也可能制造不可复现行为双锚点的价值在于同时保留正确性指导,并限制知识转移在学生可达范围内

02 机器人 先看答案再写理由,自动驾驶模型真的学会决策了吗?

把车辆的真实未来轨迹提前交给教师模型,监督任务就从「根据当下场景做决策」悄悄变成了「为既成结果补写理由」。论文将这种现象称为轨迹锚定偏差:生成的思维链看似合理,因果上却未必忠实,在需要辨别关键因果关系的场景中还会带来更严重的幻觉。直接隐藏真实轨迹也不够,因为让模型开放式生成轨迹,会把高层决策与精确几何、车辆动力学混在一起。作者因此把规划改造成候选轨迹选择题,并在模型作出选择后才暴露真实轨迹,用它作为强化学习的验证目标;摘要报告称,这能改善驾驶推理,同时维持甚至增强通用视觉能力。对生产自动驾驶训练数据的团队,更重要的检查项不只是解释写得是否流畅,而是标注者在推理时是否提前看见了本应预测的结果。

审计推理数据时,应检查未来信息是否泄漏进教师上下文「能解释已发生动作」不能证明模型能从当前场景独立决策候选轨迹选择可把高层规划与低层轨迹生成解耦,但泛化效果仍需看全文和更多场景验证

03 推理加速 DiffusionGemma从成熟模型迁移到扩散解码

扩散式文本生成真正有意思的突破,可能不是一次并行处理256个token,而是成熟的自回归模型可以直接迁移过去。DiffusionGemma以Gemma 4为底座,用不到原模型训练token预算的10%完成两阶段微调,先学习双向去噪,再通过强化学习和采样器蒸馏兼顾质量与效率。报告称,它在单张NVIDIA H100上平均每次前向生成约20个token,吞吐约1500 token/s,并显著快于采用先进推测解码的自回归模型。更有潜力的是,模型仍能以较小性能损失进行自回归生成,为扩散与自回归混合解码留下了空间。不过这仍是实验性开放权重模型,并行处理256个token不等于端到端加速256倍,工程价值还要看质量、迭代次数和硬件利用率能否同时兑现。

成熟自回归模型可以低成本迁移到扩散解码,不必从零训练评估推理加速应看端到端吞吐与质量,而不是并行token数量混合扩散与自回归解码值得做生成基础设施的团队持续关注

04 图像生成 生成模型的下一步,是交付可继续工作的设计稿吗?

扁平图片一旦进入后续设计流程,局部移动、删除和复用都会暴露结构缺失的问题。UniWorld-Design把语义RGBA图层——带透明通道、对应完整对象的独立资产——作为生成、理解和编辑的基本单位,既能从文本生成素材,也能把成图拆成有顺序的完整图层。由于模型学习的是完整对象而非可见像素切片,移走或删除某个图层后,其余内容仍有望保持可用,这有望降低后续修改、复用和代理式编辑的成本。在Crello基准上,它将逐图层RGB误差降低37%,Alpha Soft IoU相对提升34%,但这些指标能否转化为真实设计流程中的时间节省,仍需看全文和实际工作流验证。对做设计工具或内容生产Agent的团队来说,值得重新评估的不是模型能否再多画好一点,而是输出是否保留了足够的结构。

评估图像模型时,把可编辑性和交付结构纳入画质之外的核心指标语义RGBA图层有望降低素材修改、复用和自动化协作成本基准提升值得关注,但真实设计流程中的可用性仍需验证
DAPD提升2分,扩散解码达1500token/s

也值得关注

05
JoyAI-Video-Edit把实时视频编辑改造成无未来帧、无预设时长的因果生成问题 视频生成重点是在持续编辑长视频时同时维持低延迟、源视频保真与时间一致性。链接
06
AURORA-LM不再为了扩散而过度压缩文本潜变量 模型架构它联合学习兼顾生成与精确解码的连续语言表示。链接
07
AgentStream检验自进化Agent的经验能否经受持续变化的任务流 评测流式评测重新审视独立任务上的积累是否仍然有效。链接
08
OmniPack在极低token预算下按查询保留跨时空证据 多模态压缩器需要判断哪些音视频信息不能丢失。链接
09
TurnSight用逐轮后见信息为长链工具调用分配训练信号 推理它尝试摆脱整条轨迹只有一个结果奖励的粗粒度监督。链接
10
PCSD用跨位置的持续一致性判断教师信号是否可信 训练优化目标是避免自蒸馏因单个token的偶然分歧频繁切换监督来源。链接
11
DocNavRAG让Agent沿文档结构有状态地构造证据 检索它在固定图遍历与无结构工具调用之间提供了另一条路径。链接
12
RING把外部检索到的知识注入生成模型 检索它尝试以训练和架构成本换取更低的上线延迟与系统复杂度。链接
13
Principles of Robot Autonomy从现场部署视角梳理完整自治栈 机器人这份综述可作为理解机器人自主性成熟方法与工具的实践入口。链接
14
字母大小写可能像视觉显著性线索一样调制模型注意力 可解释性Attention is Case-Sensitive提示提示词格式本身也是干预变量。链接
15
SEER用查询绑定的局部证据减少空间判断中的实例误选 多模态空间关系失败有时并非没认出物体,而是选错了指代对象。链接

今日观察

DAPD、Deferred Exposure、TurnSight与PCSD共同指向同一个后训练审计问题:监督密度增加,并不自动意味着学习信号更好。教师若看过答案、真实未来轨迹或逐轮后见上下文,确实可能产出更完整的解释与更细的反馈,但其中也可能混入学生部署时无法获得的证据、为结果补写的因果链,以及由局部偶然一致性制造的噪声。这样的教师可以在训练日志中显得更聪明,却未必提供学生能够独立复现的策略。

因此,后训练评估不能只看最终奖励是否上升,还要分别检查决策可达性与跨步骤一致性:移除特权信息后,学生是否仍能作出同样选择;把监督放进更长的交互轨迹后,策略是否继续稳定。下一轮构造教师分支时,应为每类答案、未来状态和后见上下文登记明确的可见边界,并加入「移除特权信息后的决策复现率」和「跨步骤一致率」两项独立验证。