今日概览
- 在相同嵌入模型下,Agent式检索相对标准检索将nDCG@10提高8.7点,代价是约160倍的平均延迟;平均每次查询的延迟从0.67秒增至107.4秒,并消耗76.41万输入token,可优先考虑用于高价值、低频任务。
- OnePO把教师变成可条件退出的临时引导:早期强化低概率但信息量高的教师token,当前策略超过教师输出后撤掉指导;20K医疗样本在HealthBench(Total)上达到67.2分,分别比SFT+RL和纯RL高2.7分、7.4分,摘要报告的证据限于医疗适配。
- ARRO同时惩罚漏改与误改。 它让视觉语言奖励模型审计候选编辑并生成奖励,FLUX.1 Kontext-dev的平均EditScore从5.21升至5.88,600个样本中的越界像素变化减少8.4%。
重点关注
01 检索 平均多等约107秒,值得换来相同嵌入模型下相对标准检索的nDCG@10提高8.7点吗?
平均每次查询的延迟从0.67秒增至107.4秒,并平均消耗76.41万输入token——Agent式检索的效果账单比预想中昂贵得多。它在ReAct式Agent循环中结合大模型推理与基于检索器的语料探索,在使用相同嵌入模型时,相对标准检索将nDCG@10提高了8.7点。更意外的是,同一套流程在ViDoRe v3和BRIGHT两个排行榜上都取得了有竞争力的结果,泛化性可能比针对单一领域优化的专用检索方法更强。但平均延迟约为标准检索的160倍,加上平均每次查询5.8K输出token,使其在常见延迟和成本约束下难以直接替换面向大流量的标准检索。现阶段更合理的部署方式,是把它留给尽调、复杂研究和高价值决策等低频任务,并为普通查询保留快速检索通道;具体成本还需结合模型单价与并发规模进一步确认。
原文:Beyond Semantic Similarity: Performance and Costs of Agentic Retrieval for Complex Tasks
02 训练优化 OnePO用临时教师指导简化RL-only领域适配
领域适配中的教师模型往往一路参与训练,但当学生已经更强,旧的教师输出反而可能把它锚定在过时分布上。OnePO把教师改成「可退休的临时教练」:早期强化学生尚不熟悉、但信息量高的低概率教师token,缓解纯强化学习冷启动时的有效梯度不足。一旦当前策略能够超过教师输出,训练便撤掉教师指导,以避免Teacher-Distribution Anchoring。医疗适配实验中,它用20K样本在HealthBench(Total)上得到67.2分,分别比SFT(监督微调)加RL和纯RL高2.7分、7.4分,说明删掉多阶段流程不必以效果为代价。对领域适配团队来说,这是一条值得测试的简化路线,但来源摘要中的实验证据限于医疗适配,不能据此判断跨领域表现。
原文:HuatuoGPT-3: RL-Only Domain Adaptation from Base Models
03 图像生成 只改对还不够,还得保证别乱改
图像编辑模型既可能漏掉用户要求的修改,也可能意外改动无关内容。ARRO让视觉语言奖励模型同时审计两类失败——用户要求的修改是否遗漏,以及无关内容是否被越界改动——再用强化学习直接优化最终图像。它不依赖逐条指令的人工标注,而是汇总并核验多个候选结果中的问题,把「最小改动」变成可规模化训练的双向约束。在FLUX.1 Kontext-dev上,平均EditScore从5.21升至5.88,600个样本中的越界像素变化也比基础模型减少8.4%,迁移到OmniGen2后仍有改善。对图像编辑产品而言,这意味着「听话」和「克制」终于可以作为同一份产品契约来训练。
原文:Scalable Minimal-Change Learning for Controllable Image Editing

也值得关注
今日观察
三篇主文分别把检索、领域适配和图像编辑从固定流程改造成按当前状态调整的闭环:检索Agent决定下一步搜索,OnePO根据当前策略是否已超过教师输出决定是否保留指导,ARRO则依据候选编辑中的漏改与误改生成奖励。这些方法尚不足以证明自适应闭环普遍优于固定流程,但已经提出一套更细的验收要求:除最终任务分数外,还应记录每次任务的循环次数、退出条件和token、延迟、显存等资源消耗,同时分别统计漏改与误改,避免收益被循环延迟、陈旧指导或单边指标掩盖。下一步可先在评测看板中为这四类数据建立独立字段,并按成功与失败任务分别检查分布。