XConf降至1/10成本,Agora完成165次复现

今日概览

  • 置信度要查询历史成败:XConf在24组比较中的23组达到或超过10次采样的自洽性方法,生成成本仅为其十分之一。
  • 科学代码库可被编译为训练环境,ScienceIDE用领域规范和正确性判据,将科研软件转化为可训练、可评测的基础设施。
  • 平稳critic可能正在压平真实价值。Value Flattening让PPO无法准确描述推理轨迹中的回报起伏,削弱其降低方差的依据。
  • 多Agent协作要保存可复跑谱系:Agora用追加式Git DAG记录研究资产,13个Agent在近12天内完成165次独立复现。
  • 示范数据也能在部署期生效,GPT-Policy让VLM读取情境示范临时调整机器人行为,同时由受约束控制器验证执行。

重点关注

01 评测 可靠性不只藏在这次推理里,而在过去的成败中

当前这一次推理并不足以判断模型是否可靠:token概率、自省和重复采样都只盯着眼前,却不知道模型过去在同类任务上究竟做对过多少次。XConf把模型完成过的任务、反思、置信度、真实结果和事后教训存成经验库;遇到新任务时,它检索任务类型和初始置信度相近的记录,用历史成功率修正判断,并让模型识别自己反复出现的失败模式。这相当于把「我觉得这次能行」变成「我过去在这种情况下有多常成功」,补上了单次推理无法提供的实证依据。摘要报告称,在覆盖推理、编程、多模态问答和交互式Agent的9个基准上,XConf在24组比较中的23组达到或超过10次采样的自洽性方法,校准误差更低,生成成本仅为后者的十分之一。更实际的是,当系统拒绝交付置信度最低的10%任务时,Agent任务的实际成功率最多提高8.7个百分点——这会直接影响产品何时交付结果、自动重试或升级给人工。不过,经验带来的优势取决于经验库是否覆盖当前任务;一旦场景、工具或数据分布变化,旧成功率可能反而制造错误安全感,需要看全文确认其更新机制和抗分布漂移能力。

评估Agent可靠性时,应把历史真实成败纳入置信度,而不只看token概率或自我判断相比重复采样,经验检索可能以更低生成成本提供更好的交付与重试依据落地前要检查经验库覆盖率,并持续监测任务分布变化造成的置信度失真

02 AI for Science 把科学代码库编译成可训练环境

ScienceIDE用专家定义的科学案例和验收标准,引导Agent把现有代码仓库改造成可生成任务、执行流程并验证科学正确性的环境。这一转换针对的难点是,仓库里的领域惯例、工具链和正确性标准往往藏在代码与专家经验里,无法直接变成训练信号。这样,数十年积累的科学软件就不再只是工具集合,而成为能同时支持监督微调、强化学习和评测的可执行经验底座。团队基于验证过的交互轨迹训练了4B、9B和72B三个模型,并报告它们在留出的科学代码修复任务以及部分通用代码、推理和知识基准上都有提升,说明这种科学经验可能产生正向迁移。不过摘要没有给出具体增幅和基线,效果强弱仍需看全文确认;对做科学Agent的团队来说,更值得立刻关注的是这套「仓库—环境—训练数据」的基础设施能否规模化复制。

科学代码只有配上领域规范和验收标准,才能成为可靠的Agent训练环境建设科学Agent时,应把环境生成、执行和科学验证视为同一套基础设施通用能力提升释放了积极信号,但迁移强度仍需结合完整实验判断

03 训练优化 回报明明剧烈起伏,critic为什么只画一条平线?

沿着同一条推理轨迹,蒙特卡洛续写估出的真实回报会剧烈起伏,PPO的critic预测却近乎一条平线。作者将这种信号失真称为Value Flattening,并在FrozenLake实验中发现:状态空间越大,压平现象越明显。原因可能是价值损失隐含地惩罚方差,加上相邻状态梯度相似、重复更新,最终让critic学会了「稳定」,却没学会准确描述中间状态。论文提出只监督每条回答中3个相隔较远的状态,在不同规模的Qwen3-Base和多组评测上都改善了策略表现,不过具体增益仍需看全文确认。对使用PPO训练推理模型的团队来说,critic曲线平稳未必是好消息——如果它跟不上真实回报的变化,所谓降低策略更新方差的价值也要重新检验。

把critic预测与多次续写估出的中间状态回报对齐检查,平滑可能意味着失真状态空间越大,越应警惕Value Flattening稀疏监督少量、彼此分隔的状态,可能比密集更新整条轨迹更有效

04 Agent Agora把研究协作单位从对话变成Git提交

在近12天的实验中,13个无中央规划的Agent围绕同一问题持续研究;Agora用追加式Git DAG记录假设、结果、验证和报告,使每项贡献都成为可检出、可复跑且保留谱系的不可变提交,减少彼此隔离的会话反复验证同一条路。它们发布了1703项贡献,将评测结果从3.39降至1.899bits/byte,最终方案的145次提交横跨15个账户,并通过165次独立复现。这个结果证明了协作流程可以持续运转,但尚不能单独证明共享研究状态比独立搜索更节省算力——期间仍有一次人工干预,严格的对照实验也还没完成。对搭建研究Agent系统的团队而言,更值得借鉴的不是增加会话数量,而是把协作单位从聊天消息升级为有谱系、可验证的研究资产。

扩大Agent数量前,先检查是否存在重复搜索和结果不可见的问题用追加式Git提交保存假设、实验与验证,才能让后续Agent复用真实进展把「单位算力产生的新发现」纳入对照评测,再判断多Agent协作是否有效

05 机器人 示范数据开始从训练集走向运行时

GPT-Policy在部署时把人类视频、动作参考和交互反馈编译成运行时上下文,让VLM无需梯度更新就能临时调整操作。GPT-Policy并不让VLM直接控制机器人,而是由它提出动作,再交给受约束控制器验证、执行并回报结果,将开放式理解与物理执行隔开。摘要称,哪怕人类视频没有机器人动作标签,也能提高真实机器人的任务完成率;在接触敏感任务中,对齐的动作参考还能进一步改善表现。值得克制的是,商业VLM具备通用Agent能力,不代表它已经成为可靠的机器人策略,摘要也未给出具体提升幅度和失败分布。对机器人团队而言,更现实的机会是把示范做成可随任务调用的运行时资源,同时保留严格的动作约束与结果验证。

示范数据可以在部署期直接帮助适应新任务,不必每次都触发重新训练无动作标签的人类视频已有价值,接触敏感任务则更需要对齐的动作参考评估VLM机器人方案时,应重点检查控制约束、执行验证和失败分布
XConf降至1/10成本,Agora完成165次复现

也值得关注

06
Zing-0.5把键盘动作与在线文本指令同时接入世界模型,让「可实时操控」成为生成世界的新门槛 视频生成这是一个面向可玩世界的5B自回归模型。链接
07
ComPO用比较预言机提供方向信息,为绕开小似然差和传统梯度信号探索另一条偏好对齐路径 安全对齐研究提出了面向LLM偏好对齐的零阶范式。链接
08
PANORAMA把完整描述与像素级落点放进同一任务,尝试减少描述覆盖率和分割准确性之间的取舍 多模态方法通过掩码候选选择实现全景式视觉定位描述。链接
09
跨两套协作任务统一注视行为标签,检验目光能否成为双方已建立共同理解的可观测证据 多模态分析覆盖MapTask与MUNDEX两个语料库。链接
10
EvolveTrade把交易Agent的系统提示视为可演化策略,探索其能否随市场状态调整取证、调用、验证与风控流程 Agent研究聚焦经验驱动的交易策略自我改进。链接
11
长任务不能只看最终成功率,定位中途失败、恢复行为与不可逆损害才能提供可靠性改进抓手 评测工作将隐藏故障的发生位置纳入长程Agent评估。链接
12
文本共享泄露的不只是单条记录,还可能暴露性别、诊断或立场比例等数据集级属性 安全对齐QuanText把隐私保护的威胁模型扩展到数据集整体秘密。链接
13
DualSQL让schema linking与SQL生成通过多Agent强化学习协同训练,检验两个模块能否互相提供有效学习信号 代码智能方法面向传统Text-to-SQL流水线的联合优化。链接
14
MoRE把专家混合与权重复用结合起来,力图避免参数量随专家数量线性增长 模型架构其目标是在控制内存占用的同时保留专家容量。链接
15
通才—专家混合结构用于多模态罕见病理检测,关注共享表征与模态专长能否兼得 AI for Science研究针对纯MoE架构中的跨模态权衡。链接

今日观察

今天多篇工作都在把「经验」从一次性轨迹变成可管理的系统资源。XConf检索历史任务的真实成败来校准置信度,ScienceIDE把科学代码和验收标准编译为可学习环境,Agora用Git DAG保存可检出、可复跑的研究过程,机器人Agent则在部署时读取与当前情境相关的示范。这里的共同变化不只是经验被保存下来,而是每段经验开始附带来源、运行环境、结果和正确性判据,因而能够跨任务承担训练、决策和复现等不同职责。

这也意味着Agent扩展的下一层基础设施不能只是一套更大的日志系统。轨迹必须能验证,失败必须能定位,环境与工具版本必须能还原;否则历史经验既可能把过时的成功率带进置信决策,也可能让训练数据和研究结论无法复跑。具体行动是:本周就为Agent经验记录新增任务与环境版本、轨迹来源、失败位置、可执行验收结果四类必填字段,并选取一批记录同时进行置信度回测和任务复跑。