相同嵌入模型下,Agent式检索相对标准检索的nDCG@10提高8.7点

今日概览

  • 在相同嵌入模型下,Agent式检索相对标准检索将nDCG@10提高8.7点,代价是约160倍的平均延迟;平均每次查询的延迟从0.67秒增至107.4秒,并消耗76.41万输入token,可优先考虑用于高价值、低频任务。
  • OnePO把教师变成可条件退出的临时引导:早期强化低概率但信息量高的教师token,当前策略超过教师输出后撤掉指导;20K医疗样本在HealthBench(Total)上达到67.2分,分别比SFT+RL和纯RL高2.7分、7.4分,摘要报告的证据限于医疗适配。
  • ARRO同时惩罚漏改与误改。 它让视觉语言奖励模型审计候选编辑并生成奖励,FLUX.1 Kontext-dev的平均EditScore从5.21升至5.88,600个样本中的越界像素变化减少8.4%。

重点关注

01 检索 平均多等约107秒,值得换来相同嵌入模型下相对标准检索的nDCG@10提高8.7点吗?

平均每次查询的延迟从0.67秒增至107.4秒,并平均消耗76.41万输入token——Agent式检索的效果账单比预想中昂贵得多。它在ReAct式Agent循环中结合大模型推理与基于检索器的语料探索,在使用相同嵌入模型时,相对标准检索将nDCG@10提高了8.7点。更意外的是,同一套流程在ViDoRe v3和BRIGHT两个排行榜上都取得了有竞争力的结果,泛化性可能比针对单一领域优化的专用检索方法更强。但平均延迟约为标准检索的160倍,加上平均每次查询5.8K输出token,使其在常见延迟和成本约束下难以直接替换面向大流量的标准检索。现阶段更合理的部署方式,是把它留给尽调、复杂研究和高价值决策等低频任务,并为普通查询保留快速检索通道;具体成本还需结合模型单价与并发规模进一步确认。

在相同嵌入模型下,Agent式检索相对标准检索可用推理将nDCG@10提高8.7点平均每次查询107.4秒和76万余输入token会给高频部署带来明显的延迟和成本压力部署时应按查询价值分流,而不是全面替换标准检索

02 训练优化 OnePO用临时教师指导简化RL-only领域适配

领域适配中的教师模型往往一路参与训练,但当学生已经更强,旧的教师输出反而可能把它锚定在过时分布上。OnePO把教师改成「可退休的临时教练」:早期强化学生尚不熟悉、但信息量高的低概率教师token,缓解纯强化学习冷启动时的有效梯度不足。一旦当前策略能够超过教师输出,训练便撤掉教师指导,以避免Teacher-Distribution Anchoring。医疗适配实验中,它用20K样本在HealthBench(Total)上得到67.2分,分别比SFT(监督微调)加RL和纯RL高2.7分、7.4分,说明删掉多阶段流程不必以效果为代价。对领域适配团队来说,这是一条值得测试的简化路线,但来源摘要中的实验证据限于医疗适配,不能据此判断跨领域表现。

OnePO在其报告的医疗适配设置中将教师输出作为阶段性引导,而非贯穿训练的固定目标设计领域强化学习时,应同时考虑早期有效梯度和后期教师分布锚定准备简化SFT+RL流程的团队可测试OnePO,但不应直接外推医疗基准上的收益

03 图像生成 只改对还不够,还得保证别乱改

图像编辑模型既可能漏掉用户要求的修改,也可能意外改动无关内容。ARRO让视觉语言奖励模型同时审计两类失败——用户要求的修改是否遗漏,以及无关内容是否被越界改动——再用强化学习直接优化最终图像。它不依赖逐条指令的人工标注,而是汇总并核验多个候选结果中的问题,把「最小改动」变成可规模化训练的双向约束。在FLUX.1 Kontext-dev上,平均EditScore从5.21升至5.88,600个样本中的越界像素变化也比基础模型减少8.4%,迁移到OmniGen2后仍有改善。对图像编辑产品而言,这意味着「听话」和「克制」终于可以作为同一份产品契约来训练。

评估编辑模型时必须同时检查漏改与误改,单边指标很容易掩盖失败缺少逐指令人工标注的团队可以考虑用视觉语言模型构造可扩展奖励「最小改动」正从主观偏好变成能够直接优化的产品约束
相同嵌入模型下,Agent式检索相对标准检索的nDCG@10提高8.7点

也值得关注

04
DP-ES把隐私预算集中用于完整提示词评估 安全对齐种群搜索避开逐token贪心决策在强噪声下的漂移,结果更稳定,但真实敏感部署仍待验证。链接
05
形式化验证让算法稳定性成为可检验规范 评测该框架减少对解析假设的依赖,并以常数次算法运行计算可靠的期望泛化差距上界。链接
06
RoSA持续冻结前部层并轮换后部可训练层块 训练优化它可减少优化器状态显存、缩短反向传播并叠加现有PEFT;只有缓存最后冻结层的激活时,才能进一步减少前向计算。链接
07
BrainTRACE把脑部MRI判断拆成可审计的证据链 评测纵向比较、多序列整合和三维定位评测显示,当前VLM能识别孤立线索,却很少能将其组合成有依据的纵向判断。链接
08
Wander用随机游走统一三类图任务 模型架构它把节点分类、同质图链接预测和知识图谱链接预测表述为部分观测图补全,并允许单个检查点在推理时扩大结构上下文。链接
09
EpicWorldModel用预测方差引导遮挡场景探索 机器人随机JEPA表达多种可能未来,规划器据此搜索更可能藏有目标的未知区域。链接
10
MoCAR让连续运动码同时携带轨迹与坐标变换 机器人自回归预测可以直接延续潜在状态,无需反复在轨迹空间重新分词。链接
11
TrustmeWatcher把状态预测与参与者解释接入同一工作流 可解释性系统还整合活动记录、自报问卷和隐私控制,但现有研究仅覆盖17名参与者。链接

今日观察

三篇主文分别把检索、领域适配和图像编辑从固定流程改造成按当前状态调整的闭环:检索Agent决定下一步搜索,OnePO根据当前策略是否已超过教师输出决定是否保留指导,ARRO则依据候选编辑中的漏改与误改生成奖励。这些方法尚不足以证明自适应闭环普遍优于固定流程,但已经提出一套更细的验收要求:除最终任务分数外,还应记录每次任务的循环次数、退出条件和token、延迟、显存等资源消耗,同时分别统计漏改与误改,避免收益被循环延迟、陈旧指导或单边指标掩盖。下一步可先在评测看板中为这四类数据建立独立字段,并按成功与失败任务分别检查分布。