仓库经验被炼成技能,模型开始自主管理长上下文

今日概览

  • 技能库让研究Agent复现能力跃升,DisCo从1000个机器学习仓库提炼出5000多项技能,使Agent在MLE-bench上的得分提高134.3%、在PaperBench上提高34.4%。
  • 模型开始自己筛选长上下文:Declarative Attention让模型主动声明注意范围,两款模型的注意token分别减少52.0%和31.1%,准确率仅下降1.27和2.75个百分点。
  • EarlyEval能提前结束Agent评测。它在三个基准上减少13%—26%的执行步骤,但失败误判和晚期翻盘仍可能影响模型排序。
  • 剪枝会改变人设偏差分布,Debias-SparseGPT把去偏约束纳入剪枝过程,要求部署验收同时衡量性能、稀疏度与公平性。

重点关注

01 Agent|代码仓库读完就丢?更值钱的是把经验炼成技能

研究型Agent通常在任务开始后才阅读代码仓库,仓促摸索配置、执行顺序和踩坑经验,而DisCo试图把这些散落的「操作知识」提前提炼成可复用、可验证的技能。它既能批量压缩常用仓库,也能围绕具体任务按需制作技能;由此构建的AREX-Skill Library从1000个机器学习仓库中提炼出5000多项技能,覆盖20个领域和178类能力。更有意思的是,在GPT-5.5、研究脚手架和执行预算保持不变的条件下,加入技能后,Agent在MLE-bench上的得分提高134.3%,在PaperBench上提高34.4%,说明复现能力未必只能靠更强模型或更多试错来换。

这套思路把代码仓库从一次性参考资料变成了可积累的技能资产:如果安装、调参和验证流程不用每次重新发现,团队复现实验的时间与失败成本都有机会显著下降。但摘要中的结果主要证明了技能层在固定实验设置下有效,尚不能回答最关键的迁移问题——从某个仓库提炼出的经验,换数据、换框架或换任务后还能保留多少价值,需要看全文中的跨任务评测才能确认。对正在构建研究Agent的团队来说,值得开始衡量的不只是Agent能读多少代码,而是它能否把一次成功复现沉淀成下一次可直接调用的能力。

将仓库经验提炼成技能,有望减少Agent反复摸索环境、参数和执行流程的成本固定模型与执行预算后的显著增益,说明可复用技能层可能成为研究Agent的新能力来源采用这类方案前,应重点检查技能在跨仓库、跨框架和新任务上的迁移可靠性

02 推理加速|模型开始自己决定该看哪里了

百万token上下文的低效之处在于:模型明明只需要少数历史信息,每生成一个token却仍要扫描整份KV缓存。Declarative Attention把模型变成自己的检索控制器,让它在推理过程中主动声明需要全局浏览、聚焦特定区域,还是只看最近输出,推理引擎据此跳过无关内容。零样本测试中,两款现成模型的总注意token分别减少52.0%和31.1%,准确率仅下降1.27和2.75个百分点,而且模型越大,损失越小。这条路线真正有意思的地方,是把长上下文控制权从外部打分器移进模型本身,但选错区域可能直接漏掉关键信息,后续训练能否改善判断、又会增加多少成本,仍需看全文和进一步实验。对服务团队而言,下一步不该只盯复杂度,而要验证它在真实请求长度、并发和缓存带宽压力下能否兑现收益。

长上下文模型可以兼任自己的检索控制器,减少对外部逐步扫描的依赖注意力读取明显下降,但必须把区域选择错误纳入质量评估部署前应以真实流量测试延迟、吞吐和训练成本,而非只看理论节省

03 评测|轨迹未完,EarlyEval已开始判定成败

一条Agent轨迹跑到中途,往往已经暴露了最终会成功还是失败,EarlyEval因此把评测改造成一个带置信度的提前停止问题。它用两套轻量级LightGBM分类器,结合行为、文本和参考解法特征分别预测成功与失败,一旦置信度越过校准阈值就终止运行。摘要显示,该方法在三个基准上减少了13%—26%的执行步骤,最多节省44.1%的输入token和29.4%的输出token,同时保持89%—97%的预测准确率,各Agent解决率平均只偏移1—2个百分点。真正需要权衡的不是能省多少,而是误判落在哪里:过早判定失败会抹掉晚期翻盘,进而让团队低估擅长长程纠错的模型,甚至把优化方向带偏。实际采用时,应按任务类型单独校准阈值,并保留一部分完整轨迹作为对照,而不能把总体准确率直接当作评测可靠性的保证。

提前停止能与缩减评测集叠加,进一步压低Agent评测成本选阈值时应重点检查「失败误判」和晚期翻盘,而不只看总体准确率用于模型迭代前应保留完整轨迹对照,确认1—2个百分点的偏移不会改变模型排序

04 安全对齐|剪掉权重,也会改变模型对不同人设的态度

给大模型做剪枝,表面上只是删权重,没想到还可能放大模型已有的偏差,让相同问题因提示词中的人设线索而得到明显不同的回答。Debias-SparseGPT把去偏直接放进剪枝过程,通过人口群体对照输入约束模型内部表示,避免压缩时把某些差异进一步强化。在摘要列出的多类生成式LLM以及25%、50%和2:4结构化稀疏设置中,它相比SparseGPT持续降低了剪枝引入的偏差,同时保住了困惑度和零样本准确率。即便在模型质量受损最严重的2:4稀疏下,加入长上下文、信息更丰富的校准样本,还能同时改善任务表现与公平性。对部署团队来说,这意味着压缩验收不能只看速度和准确率:偏差变化也应成为上线前的硬指标,而不是事后修补项。

剪枝并非价值中立,删权重也可能重新分配人设线索对输出的影响评估压缩方案时应同时检查性能、稀疏度与公平性采用结构化稀疏时,校准数据的长度和内容丰富度尤其值得投入
仓库经验被炼成技能,模型开始自主管理长上下文

也值得关注

05
CRISP按输入结构动态选择长上下文稀疏预填充模式 推理加速值得核算路由开销是否会吞掉理论节省。链接
06
PaperCompiler先把论文编译成仓库级规格,再交给编码Agent 代码智能结构化中间表示旨在守住跨文件一致性与实验协议。链接
07
只定位推理轨迹中的第一个错误,也能提供过程监督 训练优化Cliff尝试省去为全部中间步骤训练专用奖励模型的成本。链接
08
竞赛编程专门化可以拆成题库、合成轨迹、SFT与强化学习流水线 代码智能各训练阶段的实际贡献值得分别检验。链接
09
同一隐藏状态会因透镜拟合语料不同而被解读成不同token 可解释性解码读数不能直接等同于模型内部语义。链接
10
让优化Agent显式维护代码修改与分数变化的世界模型 AgentBelief-Calibrated Optimization试图减少只凭最近一次反馈盲目试错。链接
11
企业部署要检验Agent能否达到指定可靠性门槛 评测平均基准分数领先并不足以证明系统已经适合上线。链接
12
统一的率失真视角让不同视觉量化方法有了共同坐标系 图像生成可用于比较向量、乘积与标量量化并辅助视觉tokenizer选型。链接
13
真实用户反馈可能包含模型无法自行推断的独特信号 训练优化关键是把有效信息从交互噪声中可靠分离出来。链接
14
表示纠缠可能扩大机器遗忘的连带损伤 安全对齐受控实验为面向可删除性的结构设计提供了直接证据。链接

今日观察

今天多项工作都在把高成本流程改造成「先判断,再投入计算」:模型自行筛选长上下文,CRISP按输入路由稀疏预填充,EarlyEval则在轨迹结束前预测结果。它们的共同变化并非简单减少计算,而是由学习到的控制信号决定资源投向;一旦判断失误,收益背后就可能隐藏漏掉关键上下文、错误路由或过早终止等低频但高影响的风险。实际部署时,应为每个控制器同时建立计算节省账本与尾部错误账本,并保留固定比例的完整计算样本作为持续对照。