Qwen3.5-4B以5%视觉token将9基准平均保留性能从68.6%升至82.3%

今日概览

  • 相关文档不等于好证据集,AdaTutoRank按候选集合质量调整教学强度,并将提示效果蒸馏为逐token优势,以区分关键证据与「搭便车」文档。
  • MALA看遍全部合法注意力分数后再分配算力:128K上下文的算子测试中,训练前向、反向分别加速2.2倍和3.0倍,解码加速1.6倍。
  • 极限视觉压缩还要修正学生自身轨迹。LT-OPD在仅保留5%视觉token时,将Qwen3.5-4B的9个基准的平均保留性能从68.6%提升至82.3%。

重点关注

01 检索 相关文档堆在一起,不等于一套好证据

相关文档不等于好证据集:复杂问题需要的是完整、互补且少重复的材料组合,而不是把单篇相关性最高的文档依次塞给模型。AdaTutoRank把重排改写成「组建证据集」,并用三层、九维评价标准同时提供冷启动银标签和强化学习奖励。更有意思的是信用分配:传统集合评分会让冗余文档跟着得奖、关键证据陪着受罚,它则根据候选集合质量调整指导强度——强结果只看评价标准,较弱结果会获得参考集合,必要时再加入两者差异的反思。随后,系统比较有无提示时教师模型的重新评分,把提示带来的改善蒸馏成逐token优势,尝试区分真正贡献证据的文档和「搭便车」的文档。摘要称它在覆盖RAG、深度研究和集合评估的10个基准上取得最佳综合表现,同时减少了检索调用;但具体提升幅度和调用成本仍需看全文确认。值得保持警惕的是,参考集合和反思信号来自策略自身的冻结快照,自我指导可能放大原有偏差;即便如此,这项工作仍给出了一个很实用的判断:训练重排器时,只标「相关不相关」已经不够了。

评估重排器时应加入完整性、互补性和冗余度,而不只看单篇相关性集合级总分会掩盖关键证据与「搭便车」文档,需要更细粒度的信用分配采用策略冻结快照提供的参考集合和反思信号前,应额外检查偏差是否在闭环中被放大

02 推理加速 看遍全局之后再削减后续计算

MALA有意思的地方,是它没有预先删掉注意力连接:每个合法的因果交互仍会完成打分,再由归一化后的注意力贡献决定后续计算是否值得继续。这样既保留了全局可达性,又跳过大量贡献极低的后半段工作,形成密集注意力和预设稀疏模式之外的第三条路。摘要报告,在128K上下文的算子测试中,训练前向和反向分别加速2.2倍、3.0倍,解码加速1.6倍;8K关联回忆准确率则为89.67%,接近完整注意力的89.97%。从0.6B到14B的训练也基本跟住完整注意力的困惑度,同时减少总训练FLOPs,说明这种按注意力质量动态分配算力的思路具备扩展潜力。不过这些数字需要分开看:算子级延迟、训练总计算量和真实应用的端到端延迟不是一回事,后者仍需结合完整系统验证。

保留全部合法打分,让模型按实际贡献动态削减后续计算长上下文算子加速亮眼,同时任务精度与完整注意力接近评估落地价值时,应重点核对端到端延迟而非直接套用算子倍数

03 多模态 图像只剩5%后,为什么老师还得跟着学生走?

真正棘手的不是挑出哪5%的视觉token,而是模型会在残缺信息下走进一套不同的生成轨迹,普通蒸馏未必教过它如何从这些状态继续作答。LT-OPD让低token学生先自行生成,再由冻结的全token副本沿着学生实际走过的轨迹提供分布监督——老师不是示范标准路线,而是跟到学生迷路的地方纠偏。为了避免压缩过猛导致训练失稳,它还用课程式预算逐步减少视觉token。摘要报告称,在Qwen3.5-4B的9个基准上,仅保留5%视觉token时,平均保留性能从68.6%回升至82.3%,并迁移到另外3个模型(Qwen3.5-9B、GLM-4.6V-9B和LLaVA-OV-1.5-4B);同时KV缓存和预填充计算量都减少约85%,且不增加推理开销。对做多模态推理优化的团队来说,这意味着极限压缩不能只优化图块筛选,还要处理压缩后由模型自身行为造成的分布偏移。

视觉token压到5%时,学生自身生成轨迹是关键训练数据全token教师沿学生轨迹纠偏,比只教标准路径更贴近部署状态评估压缩方案时,应同时检查token选择和压缩后的分布匹配
Qwen3.5-4B以5%视觉token将9基准平均保留性能从68.6%升至82.3%

也值得关注

04
CIS按token置信度动态收紧重要性权重上限 训练优化它针对RLVR训练与推理引擎给同一token不同概率的问题,在3个混合专家模型的5项数学推理基准平均分上均优于所评基线。链接
05
完整因果覆盖可以由KV头共同完成 模型架构CoWA让不同头分担长程历史,在128K算子测试中将训练前向、反向延迟分别降低至完整注意力的1/7.4和1/8.6。链接
06
保义变换下,任务能力与安全性出现不对称泛化 安全对齐模型适应变换后仍大体保留效用,但有害输出率可能急剧上升,显示对齐更依赖输入的表面分布。链接
07
解出每个中间步骤仍不等于能组合出最终答案 推理OracleLadder在354道NuminaMath题和6个模型上发现,组合缺口是所有模型最大的失败类别。链接
08
外挂记忆并不稳定优于原生记忆 AgentSCLATE用共享事件时钟把跨月场景压缩到数小时;比较显示,不同模型使用相同harness与记忆配置的效果差异很大,对Qwen3.5-4B的后训练使用了未修改的harness和记忆系统,并取得改善。链接
09
NTRL-Code只用未标注的含噪指令推动测试期自我改进 代码智能它以保守去噪生成语义锚点,再通过AST聚合多个候选程序来构造代理目标。链接
10
模型改进指定弱起点比优化可编辑的胜任基线更一致 评测OptiArena固定五轮编辑、脚手架和资源预算,同时专门检查可编辑的胜任基线被改坏的退化风险。链接
11
延迟问答监督可显式训练测试时记忆 模型架构将问答放到大量无关事件之后,能直接训练事实的长期保留与更新,但收益中有多少来自「延迟」仍待拆分。链接
12
World SLAM Model把SLAM机制直接变成长时世界模型 机器人它将持续状态更新、持久记忆和后端误差纠正纳入端到端导航,而非只把SLAM作为上游模块。链接
13
遭入侵的商业广告账户检测中,Agent更适合调查而非裁决 Agent在遭入侵的商业广告账户检测中,让包含符号规则、朴素贝叶斯校准和数据调优矛盾层的神经符号阶段接管最终裁决,可将精度从0.250提升至0.446,但召回率从0.920降至0.660。链接
14
PULSE按模型内部的示例效用特征挑选演示 可解释性它从稀疏自编码器中定位与目标模型收益相关的特征,替代单纯依赖文本相似度的检索标准。链接
15
高压缩率下的动态低秩崩溃源于被忽略的曲率耦合项 训练优化SDLRT用轻量补偿缓冲补回关键奇异方向,并以负反馈稳定各层秩。链接

今日观察

三篇主文共同指向一种更细粒度的效率设计,但作用阶段并不相同:AdaTutoRank在训练期按候选集合质量分配教学强度,LT-OPD沿低token模型自己的生成状态补回监督,MALA则在完整打分后按归一化注意力贡献分配后续算子计算。因此,训练期额外成本、算子级加速和下游质量保留需要分别核算,不能把不同基准上的百分比放在一起比较。

可执行的关键,是先定位压缩造成的损失究竟集中在哪些候选集合、生成状态或注意力连接,再将监督与算力投向这些局部。下一轮压缩实验中,为每个被削减单元记录质量损失及所属阶段,并优先对损失最高的一组做定向补偿。