RCCA让MiniAppBench升至41.25分

今日概览

  • ContextPilot让Agent主动重组上下文:它把规划、长期记忆、柔性卸载变成可学习操作,并以细粒度RL训练关键编辑决策。
  • ElephantBench揭示「答对但只知一面」,32个模型中最强者也只在52.4%的问题上找回冲突双方说法。
  • RCCA把奖励落到责任代码。它在MiniAppBench上将得分从9.05升至41.25,并区分格式、运行时与功能失败。

重点关注

01 Agent Agent能不能学会「整理思路」,而不只是压缩历史?

ContextPilot把全局规划、长期记忆和柔性卸载加入Agent的上下文工具集,让模型在长程任务中主动改变信息结构。更有意思的是,它没有把最终成败平均归因给所有编辑动作,而是根据上下文和输出不确定性的变化,找出关键决策并展开分支采样,再为具体动作估算收益。这样训练的目标便从「尽量缩短历史」转向「在正确时机改变信息结构」,更接近长程Agent真正需要的工作方式。摘要显示,该方法在长上下文问答和深度搜索任务中,以更紧凑的工作上下文取得了优于基线的表现,但具体提升幅度和额外训练成本仍需看全文确认。对构建研究、客服或复杂工作流Agent的团队来说,接下来该关注的不只是压缩率,而是模型能否稳定学会何时规划、何时存档、何时把信息重新调回工作区。

把上下文管理视为可学习的动作策略,而非固定的压缩管线评估Agent时应检查信息重组和长期记忆调用是否改善最终任务,而不只看上下文长度落地前需进一步核对分支采样的训练成本及其跨任务稳定性

02 评测 答对事实的模型,可能只看见了半只大象

事实问答通常把世界压成一个标准答案,但冷门事件存在相互冲突的来源时,模型即使「答对」,也可能只是记住了更常见的那套叙事。ElephantBench用1,094个可追溯来源的问题测试这种盲区,重点不是模型能否复述事实,而是能否同时保留、区分并呈现多个版本。结果颇为意外:测试的32个模型中,最强者也只在52.4%的问题上找回双方说法,其余多数情况不是完全不知道,而是只漏掉其中一方。扩大模型、增加推理时计算能改善召回,却没有消除这种不完整性;摘要中的语料分析还显示,模型明显偏向曝光更多的主流版本。对评测和知识产品团队来说,真正该升级的不是又一套单答案准确率,而是检查模型是否系统性地抹掉了少数叙事。

单答案准确率可能高估模型的知识完整性,争议事实应按多来源版本评测模型规模和推理计算只能缓解偏差,不能替代对长尾语料覆盖的检查构建搜索、研究或问答产品时,应把来源区分与少数叙事召回纳入验收标准

03 训练优化 奖励该落到失灵按钮对应的代码

一个按钮失灵时,真正需要更新的是相关事件处理器、状态更新或样式代码。RCCA把自然语言要求拆成局部反馈,并将评测器给出的原因对齐到相关代码片段和生成token,让训练信号落到真正负责问题的位置。它还分层区分格式、源码、运行时和功能失败,避免不同性质的错误被混成同一种惩罚。训练后的模型在MiniAppBench上从9.05分升至41.25分,略超Claude Opus 4.5;在ArtifactsBench上也比SFT基线提高4.48分。这个方向对训练Coding Agent很实用,但局部归因是否稳定、能否迁移到更复杂项目,仍需看全文和更多场景验证。

训练前端Agent时,应优先把功能反馈映射到责任代码,而不是只优化整段输出分开处理格式、运行时与功能错误,可减少奖励信号互相干扰榜单提升显著,但采用前仍应验证局部归因在真实代码库中的可靠性
RCCA让MiniAppBench升至41.25分

也值得关注

04
把视频生成模型的结构化知识和丰富先验用于联合深度与表面法线估计,能否减少标注数据需求。 视频生成研究将视频生成先验用于几何学习。链接
05
把反事实推理从固定变量题扩展到开放世界因果链,检验模型是否真的会传播条件变化。 评测新基准关注条件改变后的下游后果。链接
06
用等变的「孪生世界」检查答案是否受证据支持,为拒答提供不同于置信度估计的判据。 安全对齐方法面向证据不足时的可靠拒答。链接
07
借助稀疏自编码器中的可解释特征,在不重训模型的情况下增强有害请求拒答。 可解释性REINS在推理阶段调节模型行为。链接
08
多Agent失败后不再要求所有角色集体反思,而是先定位真正导致故障的责任节点。 Agent归因结果用于触发针对性的协作修正。链接
09
伪装成正常材料的投毒文档说明,RAG安全不能只依赖查询关键词或显眼触发器。 安全对齐CamoDocs研究隐蔽文档对检索增强系统的操纵。链接
10
最终输出通过忠实度检查仍可能完全没有调用数据源,工具级轨迹才暴露结构化输出约束造成的静默失效。 Agentdispatch级instrumentation记录实际工具调用路径。链接
11
模型合并的偏差不只在参数空间,按解码器实际消费表示的方式做校准可能更关键。 模型架构DARTS从解码器视角调整合并后的表示。链接
12
面向频繁更新的企业视觉文档,视觉优先的晚交互检索试图绕开OCR成本与图表信息损失。 检索PULSAR针对演示文稿等视觉密集材料设计。链接
13
不同语言间的音高、能量和时序模式有哪些可迁移的相关性? 多模态研究用多语配音数据做细粒度比较,为表达性语音翻译提供依据。链接

今日观察

ContextPilot、Rubric-to-Code、故障归因框架与dispatch级instrumentation可以拼成一套Agent工程检查法:记录每次上下文编辑及其信息变化,保留工具调度是否发生及其返回状态,把需求子项得分关联到责任代码,再将协作故障映射到具体角色节点。四类记录对应不同诊断问题:上下文编辑追踪信息去向,dispatch记录工具路径,rubric映射责任代码,故障归因定位角色节点。生产实现的关键是统一事件schema与因果顺序,使一次运行能够跨层检索和回放。可以先选择一条高频Agent链路,为上述四类事件建立统一schema,并用三次真实失败验证能否定位首个责任节点。