一套模型月接1.16亿请求,机器人成功率翻倍

今日概览

  • 生产流量决定后训练方向:按200多个内部应用的真实请求补齐能力后,一套自托管模型每月承接1.16亿次请求,为退役旧服务和整合GPU创造条件。
  • 无动作视频显著提升机器人泛化,12万小时第一视角视频将真实机器人零样本成功率从36.1%推至77.8%,未见任务受益尤其明显。
  • 像素文本编码需要四项协同设计。动态分辨率、真实图文、版式保留和多语言课程共同支撑泛化,压缩80%视觉token后仍保持稳健。
  • 中期蒸馏会分化推理与记忆收益:按教师预测熵切换训练目标,可将推理表现提升至1.61—1.71倍,同时保留96.7%—96.8%的事实记忆。
  • GUI Agent的竞争延伸到基础设施,同一闭环覆盖手机、网页和桌面的同时,还需共同扩展环境、任务构造与奖励核验能力。

重点关注

01 训练优化 与其追逐新模型,不如先让旧模型真正退役

企业自托管大模型的隐性成本,往往来自「只进不出」:新基座不断上线,旧模型却因各自承载着特定业务而无法退役,最终把有限的GPU资源切成越来越碎的服务池。这项工作的思路是从200多个内部应用的真实错误出发,将生产请求按任务分层,分别评估指令遵循、函数调用和企业内部任务,并用确定性验证器或校准后的模型裁判追踪质量,而不是依赖一个与实际流量脱节的综合榜单。训练上,作者没有把所有目标塞进一次优化,而是为三个能力轴分别训练GRPO专家,再通过两阶段球面线性插值(SLERP)合并,以减少不同奖励之间的干扰;摘要还显示,各专家分别暴露出语义坍缩、过度调用工具和「靠啰嗦骗奖励」等问题,需要逐项修正。作者报告,合并后的模型在非推理模式下以69.6比65.8超过总参数量约大7倍的内部基线,指令遵循和函数调用也分别从0.83升至0.85、从0.77升至0.79——增幅不算戏剧性,但足以影响生产流量能否迁移。最终,一套模型承接了平台50%的流量,即每月1.16亿次请求,其价值不只是降低单次推理成本,更在于让旧服务具备退役条件、把分散的GPU重新整合起来。不过,这些结论主要依赖内部请求分布和内部Arena,评测如何防止数据偏置、模型合并在持续迭代中是否稳定,仍需要看全文确认。

先按生产流量分层评测,再决定补哪些能力,比追逐最新基座更有利于收缩模型舰队指令遵循和函数调用的小幅提升,也可能成为业务能否迁移、旧模型能否退役的关键门槛评估后训练方案时,应同时检查跨任务奖励干扰和语义坍缩、过度调用、verbosity hacking等奖励投机行为

02 机器人 机器人的数据瓶颈,可能不在动作标注

机器人要学会跨环境操作,未必只能等待更多昂贵的动作轨迹。ZimaBlue先用超过12万小时的人类与机器人第一视角视频,学习接触、工具使用和长程行为中的视觉变化,再通过统一动作表示把这些无标注经验接到不同机器人的控制数据上。结果很亮眼:相比只用目标机器人数据,真实机器人零样本任务成功率从36.1%提升到77.8%,而且未见任务上的增益尤其明显。为了把庞大的世界模型用于实时控制,它还设计了异步Slow-Fast双系统,让轻量分支在RTX 4090上以30Hz预测动作。真正值得关注的是,无动作视频或许无法直接教机器人「怎么动」,却能提前提供跨物体、跨场景的物理经验,让有限的动作标注更值钱。

机器人团队可以先扩展第一视角视频规模,不必把数据预算全部押在动作采集上无动作预训练的核心价值可能是跨环境泛化,而非直接替代控制数据评估类似方案时,应同时关注未见任务表现与实时控制速度

03 多模态 四项协同设计支撑像素文本泛化

分辨率与字体尺度、真实图文对、版式感知渲染、多语言课程——这项工作的核心不是再报一个模型分数,而是通过受控消融拆出四个关键设计变量。作者发现,动态分辨率帮助模型适应高清文档,真实图像负责建立视觉落地,保留版式可避免模型走像素捷径,而两阶段训练则改善跨语言对齐。基于这套配方训练的Pixel Linguist II使用2.8亿个样本,在英语、跨语言和多语言视觉语义任务上取得了新的最佳结果。更值得关注的是,作者报告它在压缩80%视觉token后仍保持稳健,意味着大量文字内容或许能先被编码器压缩,再交给多模态大模型处理。对文档智能团队而言,这四项设计可以直接变成训练检查清单,但压缩后的具体损失与计算成本仍需看全文确认。

训练像素文本编码器时,应同时覆盖分辨率、真实图像、版式和多语言,单补一项很难解决泛化问题真实图文数据不是可有可无的配料,它决定模型是在理解视觉文字还是记住渲染规律80%视觉token压缩值得文档智能团队关注,但应先核对各任务上的质量损失与额外编码成本

04 训练优化 同一种蒸馏,为何会教会推理却拖慢记忆?

同样是前向KL蒸馏,介入阶段不同,学生继承的能力竟会发生分化:预训练时推理与事实记忆同步受益,中期训练时却变成推理继续增强、事实记忆获取放缓。作者将原因归结为教师在不同数据上的信心不对称——它更擅长指导程序化推理,而学生此时已能较早掌握确定性较高的事实知识。Switch Distillation据此用预测熵判断教师是否足够自信:自信时蒸馏,否则退回标准交叉熵训练。相较普通的下一词预测,这种切换策略将推理表现提升至1.61-1.71倍,同时保留96.7%-96.8%的事实记忆,且优势在后训练后仍然存在。真正值得带走的不是「蒸馏损害事实能力」,而是蒸馏介入的时机与范围,本身就是决定模型更偏向继承解题过程还是知识库存的训练旋钮。

不要把预训练阶段的蒸馏收益直接外推到中期训练中期蒸馏应按教师信心选择性介入,而非覆盖所有token评估蒸馏方案时需分别追踪推理、知识与事实记忆,综合分数可能掩盖能力分化

05 Agent GUI Agent走向产品,需要三套基础设施

UI-Venus-2把手机、网页和桌面纳入统一闭环,并同步扩展环境覆盖、任务构造和奖励核验。它还通过深度研究流程生成贴近真实功能的任务,再结合视觉关键点、多模型投票和轨迹级评估,提高强化学习反馈的可信度。对涉及后果的操作,系统加入了安全控制机制,但实际可靠性仍需结合全文与真实部署结果判断。对GUI Agent团队而言,更值得复用的不是又一个榜单模型,而是环境、任务和核验三套基础设施一起扩展的工程路线。

评估GUI Agent时应从单项成功率转向跨终端覆盖与闭环稳定性任务生成和奖励核验正在成为与模型能力同等重要的壁垒面向真实产品选型时,还需重点验证高风险操作的安全边界
一套模型月接1.16亿请求,机器人成功率翻倍

也值得关注

06
把安全状态纳入模型原生记忆演化,而非只依赖外部护栏 安全对齐Safin-1关注长程交互中安全状态能否持续积累与适应。链接
07
保留预训练VLM架构,也能接入3D感知、问答与运动规划 多模态Qwen-Drive-1.0探索统一驾驶模型的视觉表征能否支撑空间决策。链接
08
用分层错误记忆决定自演化系统下一轮该练什么 推理DiagEvo针对尚未解决的弱点出题,减少仅凭难度和多样性进行训练的盲目性。链接
09
让查询端与商品端生成器通过强化学习共同演化 检索生成式组件由查询扩写助手进一步进入候选匹配过程本身。链接
10
训练数据应覆盖上下文压缩造成的分叉历史 AgentMemoryWalker不再假设生产Agent始终能看到完整、线性的执行轨迹。链接
11
流式视频问答需要学习何时值得深入检索 视频生成StreamScout让不同问题按需支付检索成本,而非统一翻查有限记忆。链接
12
用电力潮流不收敛检验Agent的迭代修复能力 AI for ScienceRestoreBench考察系统能否理解中间结果、调用工具并处理高约束工程故障。链接
13
用条件流匹配直接生成PDE约束的逆向设计候选 AI for Science该方法探索减少昂贵迭代求解及初始化敏感性的路径。链接
14
把检索目标从当前相关性转向未来思想影响 检索MUSES挑战系统对热门和中心论文的偏好,寻找可能塑造后续研究的思想根源。链接
15
能用方向干预模型,不等于模型原本依靠该方向决策 可解释性这项工作追问上下文与参数记忆冲突时的真实因果机制。链接
16
分别用结构与外观扩散先验修复少视角3D重建 图像生成DualDiff3D针对几何缺失和新视角伪影的不同来源进行处理。链接

今日观察

今天几项工作共同指向一种分层的数据策略。第一层追求廉价且宽覆盖的通用表征:第一视角视频提供跨物体、跨场景的物理经验,像素文本则覆盖分辨率、版式和语言变化。第二层转向窄而关键的失败分布,用真实生产流量发现企业请求中的能力缺口,以分层错误记忆定位尚未解决的弱点,并将Agent运行时上下文压缩产生的分叉历史纳入训练。第三层负责让改进回到系统,通过确定性验证、可核验任务与闭环执行确认模型是否真正完成目标。

这三层承担的功能不同,也不应继续混入同一个数据规模指标:覆盖面数据池应衡量环境、语言和行为的多样性;失败样本回流管道应衡量关键错误的发现率、复现率与修复周期;可验证执行集则应衡量端到端成功率、核验可靠性和高风险操作边界。具体行动是本周选一个现有模型或Agent项目,将数据资产按这三层重新盘点,并为每层各设一个独立指标和负责人。