今日概览
- ContextPilot让Agent主动重组上下文:它把规划、长期记忆、柔性卸载变成可学习操作,并以细粒度RL训练关键编辑决策。
- ElephantBench揭示「答对但只知一面」,32个模型中最强者也只在52.4%的问题上找回冲突双方说法。
- RCCA把奖励落到责任代码。它在MiniAppBench上将得分从9.05升至41.25,并区分格式、运行时与功能失败。
重点关注
01 Agent Agent能不能学会「整理思路」,而不只是压缩历史?
ContextPilot把全局规划、长期记忆和柔性卸载加入Agent的上下文工具集,让模型在长程任务中主动改变信息结构。更有意思的是,它没有把最终成败平均归因给所有编辑动作,而是根据上下文和输出不确定性的变化,找出关键决策并展开分支采样,再为具体动作估算收益。这样训练的目标便从「尽量缩短历史」转向「在正确时机改变信息结构」,更接近长程Agent真正需要的工作方式。摘要显示,该方法在长上下文问答和深度搜索任务中,以更紧凑的工作上下文取得了优于基线的表现,但具体提升幅度和额外训练成本仍需看全文确认。对构建研究、客服或复杂工作流Agent的团队来说,接下来该关注的不只是压缩率,而是模型能否稳定学会何时规划、何时存档、何时把信息重新调回工作区。
原文:ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL
02 评测 答对事实的模型,可能只看见了半只大象
事实问答通常把世界压成一个标准答案,但冷门事件存在相互冲突的来源时,模型即使「答对」,也可能只是记住了更常见的那套叙事。ElephantBench用1,094个可追溯来源的问题测试这种盲区,重点不是模型能否复述事实,而是能否同时保留、区分并呈现多个版本。结果颇为意外:测试的32个模型中,最强者也只在52.4%的问题上找回双方说法,其余多数情况不是完全不知道,而是只漏掉其中一方。扩大模型、增加推理时计算能改善召回,却没有消除这种不完整性;摘要中的语料分析还显示,模型明显偏向曝光更多的主流版本。对评测和知识产品团队来说,真正该升级的不是又一套单答案准确率,而是检查模型是否系统性地抹掉了少数叙事。
原文:Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge
03 训练优化 奖励该落到失灵按钮对应的代码
一个按钮失灵时,真正需要更新的是相关事件处理器、状态更新或样式代码。RCCA把自然语言要求拆成局部反馈,并将评测器给出的原因对齐到相关代码片段和生成token,让训练信号落到真正负责问题的位置。它还分层区分格式、源码、运行时和功能失败,避免不同性质的错误被混成同一种惩罚。训练后的模型在MiniAppBench上从9.05分升至41.25分,略超Claude Opus 4.5;在ArtifactsBench上也比SFT基线提高4.48分。这个方向对训练Coding Agent很实用,但局部归因是否稳定、能否迁移到更复杂项目,仍需看全文和更多场景验证。
原文:Rubric-to-Code Credit Assignment for Reinforcement Learning

也值得关注
今日观察
ContextPilot、Rubric-to-Code、故障归因框架与dispatch级instrumentation可以拼成一套Agent工程检查法:记录每次上下文编辑及其信息变化,保留工具调度是否发生及其返回状态,把需求子项得分关联到责任代码,再将协作故障映射到具体角色节点。四类记录对应不同诊断问题:上下文编辑追踪信息去向,dispatch记录工具路径,rubric映射责任代码,故障归因定位角色节点。生产实现的关键是统一事件schema与因果顺序,使一次运行能够跨层检索和回放。可以先选择一条高频Agent链路,为上述四类事件建立统一schema,并用三次真实失败验证能否定位首个责任节点。