今日概览
- 分块KV缓存压缩窗口会制造周期性检索弱点:同一信息仅因所处相位不同,准确率最高可相差40个百分点,部署前需要跨相位扫描,而非只看平均分。
- 可写上下文把信息控制权交给模型,Context Language Models在BrowseComp-Plus上将准确率提高11.4%,同时把计算量减少21.5%。
- 追问能力可拆成水平、垂直与停止策略。Q&D提问器在相同检索预算下胜过提示版本,并在3个多跳问答基准中的2个超过大15倍的提示模型。
重点关注
01 推理加速 分块KV缓存压缩的相位落差最高达40个百分点
同一条信息,仅因在分块KV缓存压缩窗口中的相位不同,长上下文检索准确率最高可相差40个百分点。分块键值(KV)缓存压缩会按固定步长合并连续token,也因此悄悄引入一个新坐标:信息相对窗口边界所处的「相位」。没想到的是,这并非普通的压缩损失,而是随位置周期性出现的检索弱点——总体平均分看起来不错,特定相位却可能系统性失灵。
研究者从头训练了多组采用不同KV压缩设计的模型,都复现了这种相位敏感性。摘要中的因果干预分析显示,不同注意力组件会分别偏向检索不同相位的信息;理想化模型进一步暗示,训练时的梯度流可能主动塑造这种尖锐分工,不过其普遍性仍需阅读全文确认。对准备部署长上下文模型的团队来说,评测不能只报总体准确率和显存节省,还应让同一信息遍历压缩窗口中的所有相位,专门寻找这些周期性故障点。
原文:Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression
02 模型架构 当模型接管上下文,效果与计算量同时改善
长时任务里,上下文管理通常由外部编排器控制。Context Language Models把上下文变成模型可改写的文件,让模型学习哪些信息最值得保留;摘要报告其在BrowseComp-Plus上准确率提高11.4%,同时FLOPs减少21.5%。CLM还可自然扩展到多个Agent上下文以文件形式共存。由于模型可以不受限地更新上下文文件,部署时可另行评估更新过程的可观测性与恢复需求;这些工程风险并未在摘要中得到验证。
03 Agent 真正难的不是主动,而是知道该追到哪一层
水平主动性追问当前上下文已暴露的缺口,垂直主动性沿依赖链追踪只有前序证据才会揭示的需求,停止条件则判断何时收手。论文从基准分解中恢复「需求图」,可从交互记录直接评估三者,无需模型裁判。Q&D不依赖奖励模型;在相同检索预算下,受训提问器在3个多跳问答基准上都优于同模型的提示版本,并在其中2个上胜过大15倍的提示模型。它未经额外训练迁移到模拟客服后,也能以更少提问完成更多任务。
原文:Asking for What Was Never Requested: Horizontal and Vertical Proactivity in Agents

也值得关注
今日观察
三篇主文共同揭示了Agent系统中容易被总分遮蔽的「信息控制面」:压缩窗口决定已存在的信息是否还能被取回,模型自身决定哪些内容继续留在上下文,提问策略则决定尚未出现的信息会不会被主动获取。检索会受相位影响,获取会受需求层级与停止条件影响;信息保留虽已转由模型控制,但对应的失效模式与可靠性风险仍需另行验证,因此单一任务成功率无法说明上下文系统是否可靠。下一轮评测应建立独立的信息控制账本:按压缩相位记录取回率,按需求层级记录证据获取率;基于模型可不受限地更新上下文这一架构变化,可另行验证其可观测性与恢复需求。