今日概览
- 负向教师由模型按题自造,门控只惩罚推理缺陷:NSD让模型扮演「粗心的推理者」生成负向条件,再自动识别推理关键token,使训练远离错误行为而不破坏语言先验。
- 页面向量可以按需重建:GLIE每页仅存4个向量,仍在ViDoRe v1上保留未压缩系统近80%的nDCG@5。
- NCP把预测单位扩展到跨token概念。 8.9B模型用51.3%的训练token达到OLMo-3-7B的最终预训练损失,同时保留标准自回归生成。
- T1精确回放采样token与MoE路由;TITO配合逐token专家选择回放,将训练—推理log概率差从0.021降至0.013,Terminal-Bench 2.1解决率从43.8%升至64.0%。
重点关注
01 训练优化 自造「粗心教师」,如何只忘掉推理缺陷?
强行模仿掌握标准答案的自信教师,会压制复杂推理所需的不确定性表达与自我纠错;NSD因此让学生远离模型构造的问题特定负向教师分布。冲突来自常见的在策略自蒸馏:教师利用标准答案等特权信息生成过度自信的推理过程,学生照搬时,探索、表达不确定性和主动纠错反而可能受到惩罚。NSD不依赖标准答案或外部监督,而是让模型针对每个问题构造负向条件,例如扮演「粗心的推理者」,再推动学生的输出分布远离相应的负向教师。
直接套用遗忘目标仍有风险,因为错误推理与基础语言共享大量token,若不加区分地惩罚,可能同时破坏模型的基础语言能力。论文因此加入动态门控,自动识别并隔离推理关键token,让梯度更新集中于行为缺陷,同时保留语言先验。摘要称该方法持续优于传统在策略自蒸馏和其他无标签自举强化学习基线,但具体任务、提升幅度及语言能力保留情况仍需看全文确认。
对训练推理模型的团队来说,这项工作提供的并非又一种正向模仿配方,而是对教学信号方向的调整:先构造模型应避开的条件,再限制负向更新作用的位置。实际验证时,除了比较复杂推理任务上的收益,还应同时检查负向条件是否确实对应目标缺陷、门控是否稳定锁定推理关键token,以及基础语言能力是否因负向训练而退化。
原文:Negative Self-Distillation: Learning to Reason by Avoiding Flaws
02 检索 向量不用全存,也能在需要时找回来?
视觉文档检索的上千个页面向量,可能不必逐个保存:研究发现,它们虽然处于高维空间,却集中在内在维度仅5至6的流形附近。GLIE据此只存少量代表向量,先用它们完成检索,再为排名靠前的候选页面重建完整向量集并精确重排,把压缩从「保留哪些证据」变成「何时重建证据」。在ViDoRe v1上,每页只存4个向量仍保留未压缩系统近80%的nDCG@5,而此前最好的后处理方法约为70%。训练成本也很轻:解码网络仅41.5万参数,用1000个页面、不到3分钟GPU时间即可拟合,而且不需要重训编码器。对索引存储紧张、但能接受候选集重排开销的团队,这种「紧凑检索+按需重建」很值得验证,真正需要评估的是端到端延迟与业务数据上的召回表现。
原文:Generative Late-Interaction Embeddings For Visual Document Retrieval
03 模型架构 一次预测两种尺度,预训练多了一条演进路线
这项工作的价值不只是增加一项辅助损失,而是让模型在逐token生成之外,同时学习预测跨越多个token的离散概念。它从隐藏状态中构建概念词表,再将预测出的概念反馈给token层,由此保留标准自回归生成,也为跨token概念提供显式训练信号。摘要数据显示,8.9B参数模型用51.3%的训练token便达到OLMo-3-7B的最终预训练损失,完整训练后的下游平均分高出2.45分,其中GSM8K高出5.99分。更值得关注的是兼容性:这条路线没有放弃成熟的token级训练与生成接口,概念空间还能用于轻量领域适配和辅助推测解码。它是否真是改造既有训练栈的低摩擦方案,仍取决于概念词表构建、额外模块和联合训练的工程复杂度,需要看全文与更多规模实验才能判断。
04 Agent 精确回放token与MoE路由,缩小训练—推理偏差
长时程Agent连续执行数百步时,训练与采样之间的细小偏差会沿轨迹累积。T1用TITO直接训练实际采样得到的token标识,并在轮次边界修复漂移;针对MoE模型,它还记录采样器在每个MoE层为每个token选择的专家,并在训练时原样回放路由。TITO与路由回放R3将训练—推理log概率差从0.021降至0.013,同时让损失区域内的token漂移精确归零。在此基础上,T1通过真实shell运行任务自带验证器,并按通过的检查数量提供密集过程奖励。摘要报告称,这套流程将Terminal-Bench 2.1解决率从基础模型的43.8%提升到64.0%;在Long-Horizon Terminal Bench上达到27.9%,并超过GPT-5.4和GLM-5.1。其训练种子和合成任务还与Terminal-Bench 2.1保持隔离,为能力迁移而非基准过拟合提供了证据。不过,122B参数模型、云沙箱和复杂训练基础设施意味着复现门槛不低;对多数团队而言,可优先检查token构造与MoE路由是否在训练和采样阶段保持一致。
原文:T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

也值得关注
今日观察
NCP、负向自蒸馏和T1分别改变了监督信号的粒度、方向与语义:NCP把预测目标从单个token扩展到跨token概念;负向自蒸馏用自造的负向条件替代对特权答案轨迹的模仿,标出模型应避开的推理行为;T1则让任务自身的可执行验证器定义什么才算真正完成。三者共同减少了训练对单一标准轨迹的依赖,使模型既能学习多种尺度的目标,也能识别错误边界,并接受结果约束。
团队可以选取一个现有训练任务,检查损失函数是否只奖励复制单一答案,并在下一轮实验中分别加入概念级目标、缺陷负例和可执行结果约束,比较三类信号对泛化能力与错误率的实际影响。