今日概览
- Agent任务合成要保证意图与执行状态一致:FACET让任务目标、初始环境、参考解法和验证器共享同一容器状态,并通过执行验证和定向修复提高任务有效性。
- 长期决策能力需要在累积后果中检验,FM-Bench让Agent经营俱乐部20个赛季,模型排名直到后期才趋于稳定。
- 仓库适配可以前置为技能蒸馏。SkillForge从合成issue的修复轨迹中提炼项目技能,价值取决于跨缺陷迁移率。
- 逆合成评测应承认一题多解:C3LM基于约4560万条反应训练,将候选多样性与化学合理性同时纳入Top-K范式。
重点关注
01 训练优化|任务组件齐全,为什么Agent任务仍可能不可执行?
给Agent合成任务时,指令、初始环境、参考解法和验证器缺一不可,但组件齐全并不代表任务有效:如果它们基于不同假设生成,任务可能无法求解,或被验证器错误评价。FACET针对这一问题,在多阶段合成过程中保留原始来源里的目标、依赖、状态转换和操作约束,先实现并修复执行环境,再基于最终容器状态生成指令、解法和验证器。执行验证发现问题后,它只定向修复出错组件,避免不必要地重新生成其他有效部分。摘要称,由这些任务收集的成功轨迹能提供数据高效的监督,在不同规模模型上微调后均提升Terminal-Bench 2.1表现;对替代生成方案的分析也支持环境落地对任务有效性及解法与验证器对齐的重要性。至于这种一致性机制能否进一步支持随模型能力持续调整的课程,仍是需要额外方案和实验验证的方向。
原文:FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
02 评测|Agent开始为二十年后的决策买单
FM-Bench把Agent放进一个持续20个赛季的足球俱乐部经营环境,约340至400次决策会逐年累积,竞争对手也会对交易和资源配置作出响应。评测由确定性引擎计算最终得分,不依赖LLM裁判或人工打分,因此重点不在模型能否调用26个工具,而在它能否处理现金、续约、设施投资和阵容规划之间的长期牵连。15个前沿模型都能完成整个周期,但排名直到后期才稳定,竞技场冠军更在10个模型之间轮换,说明短期领先很难代表持续的管理优势。高分模型更懂得在周期末减少回报缓慢的投资、避免现金闲置并提前启动续约,不过没有模型能从数百次失败报价中学出隐藏的市场价格,自主管理记忆也会滑向「只增不减的档案」或「每年推倒重写的计划」。对开发长期运行Agent的团队,真正值得测的是决策后果能否跨阶段保留并修正,而不是单次工具调用是否成功。
原文:FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents
03 代码智能|先给仓库「预习」,代码Agent才更会修吗?
通用代码Agent进入具体仓库后,真正拉开差距的往往是项目惯例和隐含知识,而不只是编程能力。SkillForge把学习环节前置:在真实issue出现前,通过重新实现已有测试覆盖的核心功能来合成项目问题,再从修复过程中提炼可复用技能,并绑定到相关代码实体。摘要称,这套方法在开源和闭源模型上都稳定优于强基线,但没有给出具体提升幅度和前置训练成本。它的工程价值最终取决于技能能否跨缺陷迁移——如果每类新问题都要重新探索,成本只是从修复阶段搬到了准备阶段。对维护长期演进代码库的团队来说,值得关注的不是「自蒸馏」这个标签,而是项目知识能否被低成本更新、检索和复用。
原文:SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution
04 AI for Science|逆合成不缺答案,缺的是承认答案不止一个的评测
逆合成天然是一题多解:同一个目标分子可能对应多条可行路线,用单一标准答案训练和评测,会把合理但未收录的预测误判为错误。这项工作把Top-K做成贯穿训练与推理的范式,让模型显式学习输出多种候选,而不只是部署时增加采样次数。C3LM基于约4560万条验证反应训练,并结合ChemCensor化学约束审查和新颖性奖励,试图同时扩大候选空间、压低不合理反应。摘要称其在分布外URSA-expert-2026基准上达到最佳表现,还发现语言模型与传统模型探索的反应空间具有互补性,为集成式逆合成提供了依据。不过,「候选更多」不等于「有效路线更多」,实际采用前仍应同时检查化学有效率、Top-K命中率和候选之间的真实差异,具体审查规则与专家验证强度也需要看全文确认。
原文:Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

也值得关注
今日观察
FACET与SkillForge分别处理Agent数据供应链中的两个问题:前者让任务指令、执行环境、参考解法和验证器共享同一容器状态,并通过执行验证与定向修复提高任务有效性;后者则从合成issue的修复过程中提炼与代码实体关联的仓库技能,供后续真实问题复用。把两者放在一起,衡量系统价值不能只看合成任务或技能数量:上游状态不一致或验证器错误会污染训练数据,技能无法跨缺陷迁移则会让Agent反复支付探索成本。团队可以分别监控任务可解率、验证器误判率、技能检索命中率和跨任务复用率,并追踪任务质量是否真正转化为后续问题解决能力。下个训练周期可先为这些指标建立基线,再决定应该修复任务生成流程,还是重新蒸馏和组织仓库技能。