今日概览
- 技能库让研究Agent复现能力跃升,DisCo从1000个机器学习仓库提炼出5000多项技能,使Agent在MLE-bench上的得分提高134.3%、在PaperBench上提高34.4%。
- 模型开始自己筛选长上下文:Declarative Attention让模型主动声明注意范围,两款模型的注意token分别减少52.0%和31.1%,准确率仅下降1.27和2.75个百分点。
- EarlyEval能提前结束Agent评测。它在三个基准上减少13%—26%的执行步骤,但失败误判和晚期翻盘仍可能影响模型排序。
- 剪枝会改变人设偏差分布,Debias-SparseGPT把去偏约束纳入剪枝过程,要求部署验收同时衡量性能、稀疏度与公平性。
重点关注
01 Agent|代码仓库读完就丢?更值钱的是把经验炼成技能
研究型Agent通常在任务开始后才阅读代码仓库,仓促摸索配置、执行顺序和踩坑经验,而DisCo试图把这些散落的「操作知识」提前提炼成可复用、可验证的技能。它既能批量压缩常用仓库,也能围绕具体任务按需制作技能;由此构建的AREX-Skill Library从1000个机器学习仓库中提炼出5000多项技能,覆盖20个领域和178类能力。更有意思的是,在GPT-5.5、研究脚手架和执行预算保持不变的条件下,加入技能后,Agent在MLE-bench上的得分提高134.3%,在PaperBench上提高34.4%,说明复现能力未必只能靠更强模型或更多试错来换。
这套思路把代码仓库从一次性参考资料变成了可积累的技能资产:如果安装、调参和验证流程不用每次重新发现,团队复现实验的时间与失败成本都有机会显著下降。但摘要中的结果主要证明了技能层在固定实验设置下有效,尚不能回答最关键的迁移问题——从某个仓库提炼出的经验,换数据、换框架或换任务后还能保留多少价值,需要看全文中的跨任务评测才能确认。对正在构建研究Agent的团队来说,值得开始衡量的不只是Agent能读多少代码,而是它能否把一次成功复现沉淀成下一次可直接调用的能力。
原文:Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
02 推理加速|模型开始自己决定该看哪里了
百万token上下文的低效之处在于:模型明明只需要少数历史信息,每生成一个token却仍要扫描整份KV缓存。Declarative Attention把模型变成自己的检索控制器,让它在推理过程中主动声明需要全局浏览、聚焦特定区域,还是只看最近输出,推理引擎据此跳过无关内容。零样本测试中,两款现成模型的总注意token分别减少52.0%和31.1%,准确率仅下降1.27和2.75个百分点,而且模型越大,损失越小。这条路线真正有意思的地方,是把长上下文控制权从外部打分器移进模型本身,但选错区域可能直接漏掉关键信息,后续训练能否改善判断、又会增加多少成本,仍需看全文和进一步实验。对服务团队而言,下一步不该只盯复杂度,而要验证它在真实请求长度、并发和缓存带宽压力下能否兑现收益。
原文:Language Models Can Control Their Own Attention
03 评测|轨迹未完,EarlyEval已开始判定成败
一条Agent轨迹跑到中途,往往已经暴露了最终会成功还是失败,EarlyEval因此把评测改造成一个带置信度的提前停止问题。它用两套轻量级LightGBM分类器,结合行为、文本和参考解法特征分别预测成功与失败,一旦置信度越过校准阈值就终止运行。摘要显示,该方法在三个基准上减少了13%—26%的执行步骤,最多节省44.1%的输入token和29.4%的输出token,同时保持89%—97%的预测准确率,各Agent解决率平均只偏移1—2个百分点。真正需要权衡的不是能省多少,而是误判落在哪里:过早判定失败会抹掉晚期翻盘,进而让团队低估擅长长程纠错的模型,甚至把优化方向带偏。实际采用时,应按任务类型单独校准阈值,并保留一部分完整轨迹作为对照,而不能把总体准确率直接当作评测可靠性的保证。
原文:EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
04 安全对齐|剪掉权重,也会改变模型对不同人设的态度
给大模型做剪枝,表面上只是删权重,没想到还可能放大模型已有的偏差,让相同问题因提示词中的人设线索而得到明显不同的回答。Debias-SparseGPT把去偏直接放进剪枝过程,通过人口群体对照输入约束模型内部表示,避免压缩时把某些差异进一步强化。在摘要列出的多类生成式LLM以及25%、50%和2:4结构化稀疏设置中,它相比SparseGPT持续降低了剪枝引入的偏差,同时保住了困惑度和零样本准确率。即便在模型质量受损最严重的2:4稀疏下,加入长上下文、信息更丰富的校准样本,还能同时改善任务表现与公平性。对部署团队来说,这意味着压缩验收不能只看速度和准确率:偏差变化也应成为上线前的硬指标,而不是事后修补项。
原文:Debias-SparseGPT: Bias-Aware Pruning for Large Language Models

也值得关注
今日观察
今天多项工作都在把高成本流程改造成「先判断,再投入计算」:模型自行筛选长上下文,CRISP按输入路由稀疏预填充,EarlyEval则在轨迹结束前预测结果。它们的共同变化并非简单减少计算,而是由学习到的控制信号决定资源投向;一旦判断失误,收益背后就可能隐藏漏掉关键上下文、错误路由或过早终止等低频但高影响的风险。实际部署时,应为每个控制器同时建立计算节省账本与尾部错误账本,并保留固定比例的完整计算样本作为持续对照。