分块KV缓存压缩的检索落差最高达40个百分点

今日概览

  • 分块KV缓存压缩窗口会制造周期性检索弱点:同一信息仅因所处相位不同,准确率最高可相差40个百分点,部署前需要跨相位扫描,而非只看平均分。
  • 可写上下文把信息控制权交给模型,Context Language Models在BrowseComp-Plus上将准确率提高11.4%,同时把计算量减少21.5%。
  • 追问能力可拆成水平、垂直与停止策略。Q&D提问器在相同检索预算下胜过提示版本,并在3个多跳问答基准中的2个超过大15倍的提示模型。

重点关注

01 推理加速 分块KV缓存压缩的相位落差最高达40个百分点

同一条信息,仅因在分块KV缓存压缩窗口中的相位不同,长上下文检索准确率最高可相差40个百分点。分块键值(KV)缓存压缩会按固定步长合并连续token,也因此悄悄引入一个新坐标:信息相对窗口边界所处的「相位」。没想到的是,这并非普通的压缩损失,而是随位置周期性出现的检索弱点——总体平均分看起来不错,特定相位却可能系统性失灵。

研究者从头训练了多组采用不同KV压缩设计的模型,都复现了这种相位敏感性。摘要中的因果干预分析显示,不同注意力组件会分别偏向检索不同相位的信息;理想化模型进一步暗示,训练时的梯度流可能主动塑造这种尖锐分工,不过其普遍性仍需阅读全文确认。对准备部署长上下文模型的团队来说,评测不能只报总体准确率和显存节省,还应让同一信息遍历压缩窗口中的所有相位,专门寻找这些周期性故障点。

分块KV缓存压缩会引入新的位置可靠性风险,不只是常规的精度换效率平均准确率可能掩盖高达40个百分点的相位落差上线前应固定内容并跨窗口相位扫描检索表现

02 模型架构 当模型接管上下文,效果与计算量同时改善

长时任务里,上下文管理通常由外部编排器控制。Context Language Models把上下文变成模型可改写的文件,让模型学习哪些信息最值得保留;摘要报告其在BrowseComp-Plus上准确率提高11.4%,同时FLOPs减少21.5%。CLM还可自然扩展到多个Agent上下文以文件形式共存。由于模型可以不受限地更新上下文文件,部署时可另行评估更新过程的可观测性与恢复需求;这些工程风险并未在摘要中得到验证。

上下文管理正从外部规则转向模型自身能力由模型管理上下文时,效果与FLOPs可以同时改善部署前可另行评估不受限上下文更新的可观测性与恢复需求,这并非摘要已验证的必要条件

03 Agent 真正难的不是主动,而是知道该追到哪一层

水平主动性追问当前上下文已暴露的缺口,垂直主动性沿依赖链追踪只有前序证据才会揭示的需求,停止条件则判断何时收手。论文从基准分解中恢复「需求图」,可从交互记录直接评估三者,无需模型裁判。Q&D不依赖奖励模型;在相同检索预算下,受训提问器在3个多跳问答基准上都优于同模型的提示版本,并在其中2个上胜过大15倍的提示模型。它未经额外训练迁移到模拟客服后,也能以更少提问完成更多任务。

设计主动型Agent时,应分别定义当前缺口、依赖链上的后续需求和明确停止条件评估追问能力可以基于需求图与证据覆盖率,不必依赖另一个模型打分在相同检索预算下,专门训练的小型提问器可能比大15倍的提示模型更有效
分块KV缓存压缩的检索落差最高达40个百分点

也值得关注

04
1301项专业工程任务中,最佳模型EngiScore仅44.3,多软件闭环成功率更只有3.6% 评测通用电脑操作成绩尚未转化为跨专业软件的工业交付能力。链接
05
先读低分辨率全局,再按推理需要放大局部,RULER得分从57.5升至87.4 多模态两种方法的输入压缩率接近,分别为3.0倍与2.9倍。链接
06
中文专用编码器以15毫秒平均延迟完成候选项决策 推理加速专业领域平均准确率达到Jev的92%,同时取得17倍加速。链接
07
在4个数据集中的3个,仅解释5%的位置就保留了近乎全部获取威胁相关解释的成功率 可解释性简单对话结构通常比模型内部计算信号更能选出值得审计的位置。链接
08
FRAC用有限个对数间隔的指数模式逼近幂律记忆 模型架构这种归纳偏置让状态空间模型摆脱单纯指数遗忘,同时保留有界状态解码。链接
09
Agent设计的库往往不是功能不足,而是接口僵硬难用 代码智能下游Agent即使已有可用能力,仍会因复用成本过高而重新实现。链接
10
对齐审计可以前移到训练之前,预测特定微调是否会放大失配行为 安全对齐数据过滤在选择题评测中多数有效,但开放式对话的收益仍不明确。链接
11
视频文字的内容识别与字形正确性并不同步 视频生成局部改字尤其容易破坏未指定区域,静态OCR指标难以暴露这种时序与编辑失败。链接
12
统计两模型在同一推理轨迹上的强分歧token,比依赖所选token概率更能校准置信度 推理白盒评测的平均期望校准误差降至13.0%,标准全序列方法为32.7%至42.4%。链接
13
并非每条反思纠正都值得学习,优先选择让advisor评分产生较大差异的建议更有效 训练优化AdviSD让advisor比较同一份既有执行器响应在有无建议时的评分,并按差异幅度选择监督目标,无需额外执行器采样。链接

今日观察

三篇主文共同揭示了Agent系统中容易被总分遮蔽的「信息控制面」:压缩窗口决定已存在的信息是否还能被取回,模型自身决定哪些内容继续留在上下文,提问策略则决定尚未出现的信息会不会被主动获取。检索会受相位影响,获取会受需求层级与停止条件影响;信息保留虽已转由模型控制,但对应的失效模式与可靠性风险仍需另行验证,因此单一任务成功率无法说明上下文系统是否可靠。下一轮评测应建立独立的信息控制账本:按压缩相位记录取回率,按需求层级记录证据获取率;基于模型可不受限地更新上下文这一架构变化,可另行验证其可观测性与恢复需求。