NCP用51.3%训练token追平,T1升至64%

今日概览

  • 负向教师由模型按题自造,门控只惩罚推理缺陷:NSD让模型扮演「粗心的推理者」生成负向条件,再自动识别推理关键token,使训练远离错误行为而不破坏语言先验。
  • 页面向量可以按需重建:GLIE每页仅存4个向量,仍在ViDoRe v1上保留未压缩系统近80%的nDCG@5。
  • NCP把预测单位扩展到跨token概念。 8.9B模型用51.3%的训练token达到OLMo-3-7B的最终预训练损失,同时保留标准自回归生成。
  • T1精确回放采样token与MoE路由;TITO配合逐token专家选择回放,将训练—推理log概率差从0.021降至0.013,Terminal-Bench 2.1解决率从43.8%升至64.0%。

重点关注

01 训练优化 自造「粗心教师」,如何只忘掉推理缺陷?

强行模仿掌握标准答案的自信教师,会压制复杂推理所需的不确定性表达与自我纠错;NSD因此让学生远离模型构造的问题特定负向教师分布。冲突来自常见的在策略自蒸馏:教师利用标准答案等特权信息生成过度自信的推理过程,学生照搬时,探索、表达不确定性和主动纠错反而可能受到惩罚。NSD不依赖标准答案或外部监督,而是让模型针对每个问题构造负向条件,例如扮演「粗心的推理者」,再推动学生的输出分布远离相应的负向教师。

直接套用遗忘目标仍有风险,因为错误推理与基础语言共享大量token,若不加区分地惩罚,可能同时破坏模型的基础语言能力。论文因此加入动态门控,自动识别并隔离推理关键token,让梯度更新集中于行为缺陷,同时保留语言先验。摘要称该方法持续优于传统在策略自蒸馏和其他无标签自举强化学习基线,但具体任务、提升幅度及语言能力保留情况仍需看全文确认。

对训练推理模型的团队来说,这项工作提供的并非又一种正向模仿配方,而是对教学信号方向的调整:先构造模型应避开的条件,再限制负向更新作用的位置。实际验证时,除了比较复杂推理任务上的收益,还应同时检查负向条件是否确实对应目标缺陷、门控是否稳定锁定推理关键token,以及基础语言能力是否因负向训练而退化。

模型可为每道题构造「粗心推理者」等负向条件,无需外部错误样本动态门控把梯度更新集中在推理关键token,降低负向训练误伤语言先验的风险采用负向训练时必须同时验证负向条件质量与语言能力保留情况

02 检索 向量不用全存,也能在需要时找回来?

视觉文档检索的上千个页面向量,可能不必逐个保存:研究发现,它们虽然处于高维空间,却集中在内在维度仅5至6的流形附近。GLIE据此只存少量代表向量,先用它们完成检索,再为排名靠前的候选页面重建完整向量集并精确重排,把压缩从「保留哪些证据」变成「何时重建证据」。在ViDoRe v1上,每页只存4个向量仍保留未压缩系统近80%的nDCG@5,而此前最好的后处理方法约为70%。训练成本也很轻:解码网络仅41.5万参数,用1000个页面、不到3分钟GPU时间即可拟合,而且不需要重训编码器。对索引存储紧张、但能接受候选集重排开销的团队,这种「紧凑检索+按需重建」很值得验证,真正需要评估的是端到端延迟与业务数据上的召回表现。

高维页面向量若集中在低维流形附近,可用生成式重建替代粗暴删减每页4个向量仍保留近80%的原始检索效果,明显优于同预算的既有后处理方案适合存储受限且允许候选重排的系统,落地前应重点测量重建延迟与真实数据召回率

03 模型架构 一次预测两种尺度,预训练多了一条演进路线

这项工作的价值不只是增加一项辅助损失,而是让模型在逐token生成之外,同时学习预测跨越多个token的离散概念。它从隐藏状态中构建概念词表,再将预测出的概念反馈给token层,由此保留标准自回归生成,也为跨token概念提供显式训练信号。摘要数据显示,8.9B参数模型用51.3%的训练token便达到OLMo-3-7B的最终预训练损失,完整训练后的下游平均分高出2.45分,其中GSM8K高出5.99分。更值得关注的是兼容性:这条路线没有放弃成熟的token级训练与生成接口,概念空间还能用于轻量领域适配和辅助推测解码。它是否真是改造既有训练栈的低摩擦方案,仍取决于概念词表构建、额外模块和联合训练的工程复杂度,需要看全文与更多规模实验才能判断。

双粒度预测提供了一条保留自回归生成、同时引入概念级监督的架构路径训练效率和推理收益已有积极信号,但不能仅凭跨参数规模对比下结论计划升级既有预训练栈的团队应重点评估概念模块的接入成本与跨领域稳定性

04 Agent 精确回放token与MoE路由,缩小训练—推理偏差

长时程Agent连续执行数百步时,训练与采样之间的细小偏差会沿轨迹累积。T1用TITO直接训练实际采样得到的token标识,并在轮次边界修复漂移;针对MoE模型,它还记录采样器在每个MoE层为每个token选择的专家,并在训练时原样回放路由。TITO与路由回放R3将训练—推理log概率差从0.021降至0.013,同时让损失区域内的token漂移精确归零。在此基础上,T1通过真实shell运行任务自带验证器,并按通过的检查数量提供密集过程奖励。摘要报告称,这套流程将Terminal-Bench 2.1解决率从基础模型的43.8%提升到64.0%;在Long-Horizon Terminal Bench上达到27.9%,并超过GPT-5.4和GLM-5.1。其训练种子和合成任务还与Terminal-Bench 2.1保持隔离,为能力迁移而非基准过拟合提供了证据。不过,122B参数模型、云沙箱和复杂训练基础设施意味着复现门槛不低;对多数团队而言,可优先检查token构造与MoE路由是否在训练和采样阶段保持一致。

长轨迹训练需要精确复现采样阶段的token标识与MoE专家路由TITO与R3将训练—推理log概率差从0.021降至0.013,并消除损失区域内的token漂移隔离训练语料后,Terminal-Bench 2.1解决率由43.8%升至64.0%,Long-Horizon Terminal Bench达到27.9%并超过GPT-5.4和GLM-5.1
NCP用51.3%训练token追平,T1升至64%

也值得关注

05
先区分周期性网格与内容纠缠颗粒,再按成因修复 图像生成Mi-Ripple尝试在清除反复AI编辑痕迹时更好地保护原图结构。链接
06
8B MoT在无独立编码器、无VAE的架构中统一视觉能力 多模态SenseNova-U1.5覆盖视觉理解、推理与生成,可用于观察原生统一接口能否减少模块间损耗。链接
07
通用层级Transformer尝试取代光流估计的领域专用组件 模型架构FreeFlow移除相关体、特征扭曲和迭代细化,以更简单的前馈管线检验通用架构的能力。链接
08
场景程序与求解器同步递归生成复杂3D世界 多模态RCWM从单张参考图逐步处理组合结构,避免一次性生成整段场景代码。链接
09
开放奥数金牌配方不依赖形式证明器 推理该方案把专用检查点、验证与答案精炼整合进同一套测试时计算管线。链接
10
跨任务共享的解剖结构可辅助通用医学图像复原 AI for ScienceUniH³同时建模模态差异、退化类型与结构共性,以降低训练难度并增强泛化。链接
11
动态角色图显式组织多智能体的分工与关系 机器人DRG-MAPPO为需要持续战术协同的自主系统提供层级决策表示。链接
12
求解器判定正确仍可能掩盖语义偏离 评测生成式奖励模型尝试识别结论可通过、形式翻译却不忠实的自动形式化漏洞。链接

今日观察

NCP、负向自蒸馏和T1分别改变了监督信号的粒度、方向与语义:NCP把预测目标从单个token扩展到跨token概念;负向自蒸馏用自造的负向条件替代对特权答案轨迹的模仿,标出模型应避开的推理行为;T1则让任务自身的可执行验证器定义什么才算真正完成。三者共同减少了训练对单一标准轨迹的依赖,使模型既能学习多种尺度的目标,也能识别错误边界,并接受结果约束。

团队可以选取一个现有训练任务,检查损失函数是否只奖励复制单一答案,并在下一轮实验中分别加入概念级目标、缺陷负例和可执行结果约束,比较三类信号对泛化能力与错误率的实际影响。