今日概览
- SEED的teacher不是更大的模型,而是同一个模型的后见之明——它读完自己刚跑完的轨迹,总结成自然语言技能,再拿「带技能/不带技能」两种上下文的概率差,去填结果奖励在中间几十步留下的监督空白。
- 检索agent原地打转烧光预算,缺的不是更强的模型:SearchOS把任务进度从对话历史里搬出来,做成一张能直接查覆盖率的关系表,再让中间件而不是模型本身去判定「该打断了」。
- 语言和视觉想象被塞进同一条计划序列,每步计划天然锚在物理状态上,省掉VLM和世界模型之间的对接工程;代价是误差串联,想象错一步,后面的语言推理就建在错误前提上。
- 把人群拆细分别问再加权聚合,比直接问总体更贴近真实调查数据。这条恒等式不需要标准答案就能验,任何拿LLM估分布的pipeline当天都能自查一遍。
重点关注
01 训练优化 这个teacher不比student强,它只是知道结局
结果奖励只在轨迹末尾给一次分,中间几十步决策全靠这一个标量往回摊,token级的策略更新基本等于在猜——SEED补的就是这段监督空白,做法是在RL循环里挂一路稠密的token级蒸馏信号。真正值得追问的是这个teacher从哪来:它不是另一个更大的模型,而是同一个策略模型读完自己刚跑完的轨迹后,用自然语言写出来的「技能」——可复用的流程、起决定作用的那个观察、该避开的失败模式。SEED把这些技能回填进上下文,让同一批动作在「带技能」和「不带技能」两种上下文下各被打一次分,两者的概率差就成了逐token的监督信号,与结果奖励联合优化;而所谓self-evolving,是指收集轨迹和分析轨迹用的是同一个模型,策略变强,它总结技能的能力也跟着变强。所以teacher的优势不在能力,在信息:它有后见之明,知道这条轨迹最后成没成、栽在哪一步。这也就划出了收益边界——如果失败是「当时没意识到该这么做」,一句自然语言技能确实能纠回来;如果失败是模型压根不具备那个能力,后见之明再准也变不出来,这跟几天前那篇拆解on-policy蒸馏的文章结论一致:蒸馏搬运的是已有能力,不是新增能力。摘要给的是「稳定提升」和样本效率改善这类定性说法,没有放具体数字,文本和视觉两类agent任务都做了实验,代码已开源,想判断值不值得上自己的任务,跑一遍基线比看摘要靠谱。
原文:SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
02 Agent 检索agent原地打转烧光预算,缺的不是更强的模型
检索agent的失败有个固定形状:一次搜索没捞到有用证据,模型判断不出该换什么方向,于是换个近义词再搜一遍——交互历史越滚越长,任务进度反而越跟越丢,预算烧完了答案还是残的。SearchOS把病因归在「进度只存在于对话历史里」:隐式、易丢、还没法在多个agent之间共享。它的解法是把进度搬到模型外面——任务被建模成一张要填满的关系表,发现实体、补齐字段、每个值挂上来源证据,「还差哪些格子」于是变成可以直接查询的覆盖率,而不是靠模型自己回忆;另一半是把已经试过并失败的搜索方式记下来,再用一层拦在模型和工具之间的中间件盯住停滞和预算耗尽,让「该打断了」成为外部判定,而不是等模型自己醒悟。WideSearch和GISA上它在所有对比指标上领先单agent和多agent基线,但摘要里分不出这些收益有多少来自显式状态、多少来自同时上的并行调度——吞吐上去本身就意味着更多次搜索,要看消融才好下结论。不过那条设计原则是可以直接搬的:把「已覆盖什么、什么已经失败过」从上下文里拎出来变成外部可查的状态,在自己的harness层就能做,不用等更强的模型。
原文:SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
03 机器人 RxBrain把语言和视觉想象塞进了同一条计划序列
具身模型做计划一直分两条路走:视觉语言模型(VLM)用文字拆任务、做决策,世界模型预测未来画面,两边各管一段,中间靠工程手段对接。腾讯这条具身线的上一篇算的是效率账,RxBrain动的则是更上游的问题——计划本身该怎么表示:它干脆取消了那个接口,让语言和视觉想象交替出现在同一条计划序列里,语言负责任务拆解、约束、时序和决策逻辑,视觉想象负责把每一步锚到具体的物理状态上。好处很直接:计划的每一步天然带着「执行完世界会变成什么样」,不需要再多一层去校验语言决策和物理状态对不对得上。代价同样直接:单条序列意味着误差会串联,中间状态想象错了,后面的语言推理就在一个错误前提上继续往下推,而摘要没有交代这种误差怎么被约束。摘要还提到不做大规模动作数据预训练也能在真机上跑出结果,但用词是「promising」,得看全文的实验规模才好判断——对做具身的团队来说,真正该盯的是单序列这条路线扛不扛得住误差累积,而不是自建benchmark上的数字。
原文:RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
04 可解释性 把人群拆开问再加起来,比直接问更准
直觉上,把一个总体问题拆成十几个子群分别去问、再加权拼回来,误差只会越滚越大。这篇用二叉树把人群递归切成越来越细的子群,逐个喂给模型再按先验权重聚合,结果反过来了:拆得越细,聚合出的估计反而越贴近真实的人类调查数据,作者管这叫「宏观谬误」。逻辑起点其实很朴素——如果prompt真是在指定条件、输出真是那个条件分布的估计,那么按任意合法方式切分人群再加权聚合,都该还原出同一个总体分布;实测下来主流前沿模型在多个领域普遍违背这条恒等式,说明子群层面的知识模型是有的,只是直接问总体时传不上去。这个自检最实用的地方在于不需要标准答案:同一个问题按年龄切一次、按地域切一次,两组聚合值应该对得上,对不上就说明你拿到的不是条件分布,而是模型对「某类人该怎么答」的笼统印象。做合成用户调研和persona模拟的团队,值得先跑一遍这个测试再决定信不信自己手里的数。
原文:Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models

也值得关注
今日观察
今天三篇论文修的是同一个毛病,只是各自修在了不同的地方:模型自己那条主信号,撑不住变长的任务。SEED面对的是结果奖励——一条轨迹跑完只回来一个标量,中间几十步没人管,于是它在旁边补了一路teacher的token级信号;SearchOS面对的是越滚越长的交互历史——进度隐在对话里,越查越丢,于是它在旁边补了一张外部可查的覆盖率表;RxBrain面对的是纯语言的计划——每一步决策都悬空,不知道执行完世界会变成什么样,于是它在旁边补了一路视觉想象。三者都没有去把那条主信号本身做得更强,而是各自加了第二路信号,把长程任务重新锚住。
这给出的排查顺序,比「再换个更强的模型」实在得多。你的agent跑长了走偏、原地打转、越推越离谱,多半不是模型不够聪明,而是它手上只有一路信号,而这路信号在长程上会被稀释掉。第二信号可以补在三个位置,成本差着量级:系统层最便宜——在harness里加一份外部进度状态、加一条停滞判定,改的是你自己的代码,当天就能试;表示层次之——改计划或中间结果的表示形式,让它自带可核对的锚点,动的是模型的输入输出约定;训练层最贵——要teacher、要轨迹、要重跑RL,SEED那套的门槛就在这里。
所以顺序应该倒过来走,先在系统层试。挑你手上跑得最长的那个agent,别动模型,先把「已经完成了什么、什么已经试过并失败了」从对话历史里拎出来,写成一份每一步都能查的显式状态,再加一条「连续N步没有新进展就打断」的硬规则。跑一周看走偏率降了多少——如果这一步就把问题按住了,后面两层的钱你就不用花了。