今日概览
- Pivot-SD只监督少数枢纽提交,以200道题胜过全序列SFT与同预算扩散RL,每题仅采样4次;结果限于LLaDA-8B-Instruct的数学和代码基准,能否推广仍待验证。
- 物理对比训练改善检索,却让物理属性回归退步:在来自80个系列的8000个受控模拟案例中,语义对齐与定量信息可恢复性呈现交换关系,而更好的参考视频检索改善了MiniMax-H3的物理保真度。
- Queen经七轮蒸馏将棋力从1782提升至2697 Elo。 这个4B参数棋类语言模型通过交叉注意力整合棋类编码器和指令微调语言模型;基于语言模型的流畅性与连贯性评估不能证明解释忠实。
重点关注
01 训练优化 只训练少数关键位置,为什么反而胜过全序列训练?
只用200道题、每题4次采样,挑出少数关键提交来训练,竟然胜过了完整序列监督微调和同预算的扩散强化学习。Pivot-SD针对掩码扩散语言模型的信用分配难题:生成过程中,某些位置一旦确定,就会大幅降低其余掩码位置的不确定性,但常规后训练往往把整条轨迹近乎平均地对待。它用信息增益找出这些「枢纽」提交,对成功轨迹中的枢纽使用交叉熵强化,对失败轨迹中的枢纽进行定向非似然训练,同时不碰失败轨迹的其余部分。这并不能证明高信息增益位置就是所有模型中具有因果作用的通用关键token,却提示训练数据的价值可能不只取决于数量,更取决于监督落在哪里。摘要报告其在LLaDA-8B-Instruct的数学和代码基准上均取得优势,但是否适用于其他扩散模型、更多数据和更大规模训练,仍需看全文及后续验证。对资源有限的后训练团队来说,先改善信用分配,可能比盲目扩大采样量更值得尝试。
原文:Pivot-SD: Efficient Self-Distillation for Masked Diffusion Language Models
02 视频生成 文本对齐变强,物理属性回归却可能退步
专门用物理视频—文本对继续做对比训练后,模型的检索和配对分类变好了,物理属性回归却反而退步:语义对齐与保留可计算的物理信息,并不是同一种能力。这个包含来自80个系列的8000个受控模拟案例的基准进一步发现,受评估的预训练全模态嵌入模型检索表现偏弱,同一系列内的视频—描述配对分类接近随机,但轻量探针仍能从冻结的视频表示中恢复出有用的物理信息。更实际的结果是,把检索到的参考视频交给MiniMax-H3后,生成视频的物理保真度有所改善,而且检索模型越强,实验中的增益越大。对视频生成团队来说,这意味着不能再用一个综合分代替验收,而应分别测试语义检索、物理量可恢复性和最终生成效果。至于这些增益有多大、能否迁移到真实世界视频,还需要看全文和更多场景验证。
03 可解释性 专业决策不必都塞进语言模型
Queen是一个4B参数的棋类语言模型,通过交叉注意力将专用棋类编码器与指令微调语言模型整合起来,使后者从编码器表示中提取棋类概念。它还会分析候选走法的后续局面,将结论整合为当前解释,再反复蒸馏回模型。经过七轮迭代,棋力从1782提升至2697 Elo,说明「沉默专家+语言接口」可能比单纯扩大语言模型更适合专业领域。需要警惕的是,摘要只报告基于语言模型的流畅性与连贯性评估;其中连贯性接近GPT-5.6-Sol(high),但这不等于解释忠实反映了专家编码器的实际决策依据。对机器人和计算机操作等已有专用编码器的场景,这套架构值得验证,但首先应补上忠实性测试。
