今日概览
- 置信度要查询历史成败:XConf在24组比较中的23组达到或超过10次采样的自洽性方法,生成成本仅为其十分之一。
- 科学代码库可被编译为训练环境,ScienceIDE用领域规范和正确性判据,将科研软件转化为可训练、可评测的基础设施。
- 平稳critic可能正在压平真实价值。Value Flattening让PPO无法准确描述推理轨迹中的回报起伏,削弱其降低方差的依据。
- 多Agent协作要保存可复跑谱系:Agora用追加式Git DAG记录研究资产,13个Agent在近12天内完成165次独立复现。
- 示范数据也能在部署期生效,GPT-Policy让VLM读取情境示范临时调整机器人行为,同时由受约束控制器验证执行。
重点关注
01 评测 可靠性不只藏在这次推理里,而在过去的成败中
当前这一次推理并不足以判断模型是否可靠:token概率、自省和重复采样都只盯着眼前,却不知道模型过去在同类任务上究竟做对过多少次。XConf把模型完成过的任务、反思、置信度、真实结果和事后教训存成经验库;遇到新任务时,它检索任务类型和初始置信度相近的记录,用历史成功率修正判断,并让模型识别自己反复出现的失败模式。这相当于把「我觉得这次能行」变成「我过去在这种情况下有多常成功」,补上了单次推理无法提供的实证依据。摘要报告称,在覆盖推理、编程、多模态问答和交互式Agent的9个基准上,XConf在24组比较中的23组达到或超过10次采样的自洽性方法,校准误差更低,生成成本仅为后者的十分之一。更实际的是,当系统拒绝交付置信度最低的10%任务时,Agent任务的实际成功率最多提高8.7个百分点——这会直接影响产品何时交付结果、自动重试或升级给人工。不过,经验带来的优势取决于经验库是否覆盖当前任务;一旦场景、工具或数据分布变化,旧成功率可能反而制造错误安全感,需要看全文确认其更新机制和抗分布漂移能力。
原文:Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents
02 AI for Science 把科学代码库编译成可训练环境
ScienceIDE用专家定义的科学案例和验收标准,引导Agent把现有代码仓库改造成可生成任务、执行流程并验证科学正确性的环境。这一转换针对的难点是,仓库里的领域惯例、工具链和正确性标准往往藏在代码与专家经验里,无法直接变成训练信号。这样,数十年积累的科学软件就不再只是工具集合,而成为能同时支持监督微调、强化学习和评测的可执行经验底座。团队基于验证过的交互轨迹训练了4B、9B和72B三个模型,并报告它们在留出的科学代码修复任务以及部分通用代码、推理和知识基准上都有提升,说明这种科学经验可能产生正向迁移。不过摘要没有给出具体增幅和基线,效果强弱仍需看全文确认;对做科学Agent的团队来说,更值得立刻关注的是这套「仓库—环境—训练数据」的基础设施能否规模化复制。
原文:ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments
03 训练优化 回报明明剧烈起伏,critic为什么只画一条平线?
沿着同一条推理轨迹,蒙特卡洛续写估出的真实回报会剧烈起伏,PPO的critic预测却近乎一条平线。作者将这种信号失真称为Value Flattening,并在FrozenLake实验中发现:状态空间越大,压平现象越明显。原因可能是价值损失隐含地惩罚方差,加上相邻状态梯度相似、重复更新,最终让critic学会了「稳定」,却没学会准确描述中间状态。论文提出只监督每条回答中3个相隔较远的状态,在不同规模的Qwen3-Base和多组评测上都改善了策略表现,不过具体增益仍需看全文确认。对使用PPO训练推理模型的团队来说,critic曲线平稳未必是好消息——如果它跟不上真实回报的变化,所谓降低策略更新方差的价值也要重新检验。
原文:Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening
04 Agent Agora把研究协作单位从对话变成Git提交
在近12天的实验中,13个无中央规划的Agent围绕同一问题持续研究;Agora用追加式Git DAG记录假设、结果、验证和报告,使每项贡献都成为可检出、可复跑且保留谱系的不可变提交,减少彼此隔离的会话反复验证同一条路。它们发布了1703项贡献,将评测结果从3.39降至1.899bits/byte,最终方案的145次提交横跨15个账户,并通过165次独立复现。这个结果证明了协作流程可以持续运转,但尚不能单独证明共享研究状态比独立搜索更节省算力——期间仍有一次人工干预,严格的对照实验也还没完成。对搭建研究Agent系统的团队而言,更值得借鉴的不是增加会话数量,而是把协作单位从聊天消息升级为有谱系、可验证的研究资产。
原文:Agora: Git as Shared Memory for Collective AutoResearch
05 机器人 示范数据开始从训练集走向运行时
GPT-Policy在部署时把人类视频、动作参考和交互反馈编译成运行时上下文,让VLM无需梯度更新就能临时调整操作。GPT-Policy并不让VLM直接控制机器人,而是由它提出动作,再交给受约束控制器验证、执行并回报结果,将开放式理解与物理执行隔开。摘要称,哪怕人类视频没有机器人动作标签,也能提高真实机器人的任务完成率;在接触敏感任务中,对齐的动作参考还能进一步改善表现。值得克制的是,商业VLM具备通用Agent能力,不代表它已经成为可靠的机器人策略,摘要也未给出具体提升幅度和失败分布。对机器人团队而言,更现实的机会是把示范做成可随任务调用的运行时资源,同时保留严格的动作约束与结果验证。

也值得关注
今日观察
今天多篇工作都在把「经验」从一次性轨迹变成可管理的系统资源。XConf检索历史任务的真实成败来校准置信度,ScienceIDE把科学代码和验收标准编译为可学习环境,Agora用Git DAG保存可检出、可复跑的研究过程,机器人Agent则在部署时读取与当前情境相关的示范。这里的共同变化不只是经验被保存下来,而是每段经验开始附带来源、运行环境、结果和正确性判据,因而能够跨任务承担训练、决策和复现等不同职责。
这也意味着Agent扩展的下一层基础设施不能只是一套更大的日志系统。轨迹必须能验证,失败必须能定位,环境与工具版本必须能还原;否则历史经验既可能把过时的成功率带进置信决策,也可能让训练数据和研究结论无法复跑。具体行动是:本周就为Agent经验记录新增任务与环境版本、轨迹来源、失败位置、可执行验收结果四类必填字段,并选取一批记录同时进行置信度回测和任务复跑。