今日概览
- 相关文档不等于好证据集,AdaTutoRank按候选集合质量调整教学强度,并将提示效果蒸馏为逐token优势,以区分关键证据与「搭便车」文档。
- MALA看遍全部合法注意力分数后再分配算力:128K上下文的算子测试中,训练前向、反向分别加速2.2倍和3.0倍,解码加速1.6倍。
- 极限视觉压缩还要修正学生自身轨迹。LT-OPD在仅保留5%视觉token时,将Qwen3.5-4B的9个基准的平均保留性能从68.6%提升至82.3%。
重点关注
01 检索 相关文档堆在一起,不等于一套好证据
相关文档不等于好证据集:复杂问题需要的是完整、互补且少重复的材料组合,而不是把单篇相关性最高的文档依次塞给模型。AdaTutoRank把重排改写成「组建证据集」,并用三层、九维评价标准同时提供冷启动银标签和强化学习奖励。更有意思的是信用分配:传统集合评分会让冗余文档跟着得奖、关键证据陪着受罚,它则根据候选集合质量调整指导强度——强结果只看评价标准,较弱结果会获得参考集合,必要时再加入两者差异的反思。随后,系统比较有无提示时教师模型的重新评分,把提示带来的改善蒸馏成逐token优势,尝试区分真正贡献证据的文档和「搭便车」的文档。摘要称它在覆盖RAG、深度研究和集合评估的10个基准上取得最佳综合表现,同时减少了检索调用;但具体提升幅度和调用成本仍需看全文确认。值得保持警惕的是,参考集合和反思信号来自策略自身的冻结快照,自我指导可能放大原有偏差;即便如此,这项工作仍给出了一个很实用的判断:训练重排器时,只标「相关不相关」已经不够了。
02 推理加速 看遍全局之后再削减后续计算
MALA有意思的地方,是它没有预先删掉注意力连接:每个合法的因果交互仍会完成打分,再由归一化后的注意力贡献决定后续计算是否值得继续。这样既保留了全局可达性,又跳过大量贡献极低的后半段工作,形成密集注意力和预设稀疏模式之外的第三条路。摘要报告,在128K上下文的算子测试中,训练前向和反向分别加速2.2倍、3.0倍,解码加速1.6倍;8K关联回忆准确率则为89.67%,接近完整注意力的89.97%。从0.6B到14B的训练也基本跟住完整注意力的困惑度,同时减少总训练FLOPs,说明这种按注意力质量动态分配算力的思路具备扩展潜力。不过这些数字需要分开看:算子级延迟、训练总计算量和真实应用的端到端延迟不是一回事,后者仍需结合完整系统验证。
原文:MassAlloc Attention: Let Attention Allocate Its Own Compute
03 多模态 图像只剩5%后,为什么老师还得跟着学生走?
真正棘手的不是挑出哪5%的视觉token,而是模型会在残缺信息下走进一套不同的生成轨迹,普通蒸馏未必教过它如何从这些状态继续作答。LT-OPD让低token学生先自行生成,再由冻结的全token副本沿着学生实际走过的轨迹提供分布监督——老师不是示范标准路线,而是跟到学生迷路的地方纠偏。为了避免压缩过猛导致训练失稳,它还用课程式预算逐步减少视觉token。摘要报告称,在Qwen3.5-4B的9个基准上,仅保留5%视觉token时,平均保留性能从68.6%回升至82.3%,并迁移到另外3个模型(Qwen3.5-9B、GLM-4.6V-9B和LLaVA-OV-1.5-4B);同时KV缓存和预填充计算量都减少约85%,且不增加推理开销。对做多模态推理优化的团队来说,这意味着极限压缩不能只优化图块筛选,还要处理压缩后由模型自身行为造成的分布偏移。
原文:Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction

也值得关注
今日观察
三篇主文共同指向一种更细粒度的效率设计,但作用阶段并不相同:AdaTutoRank在训练期按候选集合质量分配教学强度,LT-OPD沿低token模型自己的生成状态补回监督,MALA则在完整打分后按归一化注意力贡献分配后续算子计算。因此,训练期额外成本、算子级加速和下游质量保留需要分别核算,不能把不同基准上的百分比放在一起比较。
可执行的关键,是先定位压缩造成的损失究竟集中在哪些候选集合、生成状态或注意力连接,再将监督与算力投向这些局部。下一轮压缩实验中,为每个被削减单元记录质量损失及所属阶段,并优先对损失最高的一组做定向补偿。