Pivot-SD在LLaDA-8B-Instruct上以200题、每题4次采样胜过全序列SFT,Queen七轮从1782升至2697

今日概览

  • Pivot-SD只监督少数枢纽提交,以200道题胜过全序列SFT与同预算扩散RL,每题仅采样4次;结果限于LLaDA-8B-Instruct的数学和代码基准,能否推广仍待验证。
  • 物理对比训练改善检索,却让物理属性回归退步:在来自80个系列的8000个受控模拟案例中,语义对齐与定量信息可恢复性呈现交换关系,而更好的参考视频检索改善了MiniMax-H3的物理保真度。
  • Queen经七轮蒸馏将棋力从1782提升至2697 Elo。 这个4B参数棋类语言模型通过交叉注意力整合棋类编码器和指令微调语言模型;基于语言模型的流畅性与连贯性评估不能证明解释忠实。

重点关注

01 训练优化 只训练少数关键位置,为什么反而胜过全序列训练?

只用200道题、每题4次采样,挑出少数关键提交来训练,竟然胜过了完整序列监督微调和同预算的扩散强化学习。Pivot-SD针对掩码扩散语言模型的信用分配难题:生成过程中,某些位置一旦确定,就会大幅降低其余掩码位置的不确定性,但常规后训练往往把整条轨迹近乎平均地对待。它用信息增益找出这些「枢纽」提交,对成功轨迹中的枢纽使用交叉熵强化,对失败轨迹中的枢纽进行定向非似然训练,同时不碰失败轨迹的其余部分。这并不能证明高信息增益位置就是所有模型中具有因果作用的通用关键token,却提示训练数据的价值可能不只取决于数量,更取决于监督落在哪里。摘要报告其在LLaDA-8B-Instruct的数学和代码基准上均取得优势,但是否适用于其他扩散模型、更多数据和更大规模训练,仍需看全文及后续验证。对资源有限的后训练团队来说,先改善信用分配,可能比盲目扩大采样量更值得尝试。

扩散语言模型的后训练可以优先监督显著降低剩余不确定性的提交成功与失败轨迹应采用不同的局部训练信号,而非统一拟合整段文本小数据结果很有吸引力,但目前不应外推到LLaDA-8B-Instruct之外

02 视频生成 文本对齐变强,物理属性回归却可能退步

专门用物理视频—文本对继续做对比训练后,模型的检索和配对分类变好了,物理属性回归却反而退步:语义对齐与保留可计算的物理信息,并不是同一种能力。这个包含来自80个系列的8000个受控模拟案例的基准进一步发现,受评估的预训练全模态嵌入模型检索表现偏弱,同一系列内的视频—描述配对分类接近随机,但轻量探针仍能从冻结的视频表示中恢复出有用的物理信息。更实际的结果是,把检索到的参考视频交给MiniMax-H3后,生成视频的物理保真度有所改善,而且检索模型越强,实验中的增益越大。对视频生成团队来说,这意味着不能再用一个综合分代替验收,而应分别测试语义检索、物理量可恢复性和最终生成效果。至于这些增益有多大、能否迁移到真实世界视频,还需要看全文和更多场景验证。

对比训练可能用定量物理信息换取更好的文本对齐评测视频表示时应拆分检索、物理属性回归和同一系列内的视频—描述配对分类参考视频检索值得接入生成流程,但必须以生成端物理保真度单独验收

03 可解释性 专业决策不必都塞进语言模型

Queen是一个4B参数的棋类语言模型,通过交叉注意力将专用棋类编码器与指令微调语言模型整合起来,使后者从编码器表示中提取棋类概念。它还会分析候选走法的后续局面,将结论整合为当前解释,再反复蒸馏回模型。经过七轮迭代,棋力从1782提升至2697 Elo,说明「沉默专家+语言接口」可能比单纯扩大语言模型更适合专业领域。需要警惕的是,摘要只报告基于语言模型的流畅性与连贯性评估;其中连贯性接近GPT-5.6-Sol(high),但这不等于解释忠实反映了专家编码器的实际决策依据。对机器人和计算机操作等已有专用编码器的场景,这套架构值得验证,但首先应补上忠实性测试。

专业能力已有可靠模型时,可优先构建语言接口而非重新训练通才逾900 Elo的提升表明迭代蒸馏能把后续分析转化为更强决策能力评估解释系统时应将语言连贯性与决策忠实性分开衡量
Pivot-SD在LLaDA-8B-Instruct上以200题、每题4次采样胜过全序列SFT,Queen七轮从1782升至2697

也值得关注

04
静态场景重建能力不能直接外推到动态世界 评测4DCodeBench要求Agent把视频中的形变、流体和断裂还原为可执行图形程序。链接
05
目标帧与未来表示让自回归视频模型提前规划 视频生成ProAR分别约束长程结果和短程过渡,仅用25%的训练步数便超过完整训练的标准自回归基线。链接
06
按细粒度行为选择并组织多个模型,比单模型基线更能降低偏见 安全对齐CBM的收益仍需与多模型协作带来的推理成本共同核算。链接
07
无动作标注视频也能直接预训练动作策略 机器人NAVA-WAM将视频中的未来变化监督传入策略学习,为减少机器人控制对标注轨迹的依赖提供新路径。链接
08
程序进化应优化单位成本内的改进速度 代码智能FrugalEvo让强模型探索策略、低价模型实现与迭代,并用BA-AUC显式衡量成本曲线。链接
09
浏览Agent的难点正转向跨模态证据与多步线索连接 评测HyperBrowseComp收录13种语言的423道人工编写并验证的问题,覆盖冷门来源、视频、扫描文档、图像和地图。链接
10
序数筛选可替代重复分组采样 训练优化FTW利用回放缓冲区复用轨迹,为有状态环境中的无评论家强化微调提供用CPU内存换取采样的方案。链接
11
下游任务未知时,也能学习先获取哪种模态 多模态ECHO-k以预训练模型的内部表示作为代理目标,形成与标签和具体任务无关的测量顺序。链接
12
推理数据合成会同时演化任务与生成工具链 训练优化在线改进把中间求解失败转成可复用技能,批次后的改进再修订技能、提示词和工作流;模型权重与验证标准保持固定。链接
13
持续适应的世界模型不该保留所有旧知识 评测论文按不变时间尺度区分永久物理规律与应及时修订的实例事实,并主张同时报告不变量回归和修订延迟。链接
14
无标签目标记录可以直接生成多模态适配器 多模态ZeroMAG在冻结EEG编码器的前提下接入伴随生理信号,平均仅落后监督式多模态适配0.50个百分点。链接
15
限制解码器表达力,反而能保留更可迁移的三维几何结构 多模态SNAP采用局部解码器和潜空间重建目标,在相机偏移下比标准二维表示退化得更缓慢。链接