今日概览
- 生产流量决定后训练方向:按200多个内部应用的真实请求补齐能力后,一套自托管模型每月承接1.16亿次请求,为退役旧服务和整合GPU创造条件。
- 无动作视频显著提升机器人泛化,12万小时第一视角视频将真实机器人零样本成功率从36.1%推至77.8%,未见任务受益尤其明显。
- 像素文本编码需要四项协同设计。动态分辨率、真实图文、版式保留和多语言课程共同支撑泛化,压缩80%视觉token后仍保持稳健。
- 中期蒸馏会分化推理与记忆收益:按教师预测熵切换训练目标,可将推理表现提升至1.61—1.71倍,同时保留96.7%—96.8%的事实记忆。
- GUI Agent的竞争延伸到基础设施,同一闭环覆盖手机、网页和桌面的同时,还需共同扩展环境、任务构造与奖励核验能力。
重点关注
01 训练优化 与其追逐新模型,不如先让旧模型真正退役
企业自托管大模型的隐性成本,往往来自「只进不出」:新基座不断上线,旧模型却因各自承载着特定业务而无法退役,最终把有限的GPU资源切成越来越碎的服务池。这项工作的思路是从200多个内部应用的真实错误出发,将生产请求按任务分层,分别评估指令遵循、函数调用和企业内部任务,并用确定性验证器或校准后的模型裁判追踪质量,而不是依赖一个与实际流量脱节的综合榜单。训练上,作者没有把所有目标塞进一次优化,而是为三个能力轴分别训练GRPO专家,再通过两阶段球面线性插值(SLERP)合并,以减少不同奖励之间的干扰;摘要还显示,各专家分别暴露出语义坍缩、过度调用工具和「靠啰嗦骗奖励」等问题,需要逐项修正。作者报告,合并后的模型在非推理模式下以69.6比65.8超过总参数量约大7倍的内部基线,指令遵循和函数调用也分别从0.83升至0.85、从0.77升至0.79——增幅不算戏剧性,但足以影响生产流量能否迁移。最终,一套模型承接了平台50%的流量,即每月1.16亿次请求,其价值不只是降低单次推理成本,更在于让旧服务具备退役条件、把分散的GPU重新整合起来。不过,这些结论主要依赖内部请求分布和内部Arena,评测如何防止数据偏置、模型合并在持续迭代中是否稳定,仍需要看全文确认。
02 机器人 机器人的数据瓶颈,可能不在动作标注
机器人要学会跨环境操作,未必只能等待更多昂贵的动作轨迹。ZimaBlue先用超过12万小时的人类与机器人第一视角视频,学习接触、工具使用和长程行为中的视觉变化,再通过统一动作表示把这些无标注经验接到不同机器人的控制数据上。结果很亮眼:相比只用目标机器人数据,真实机器人零样本任务成功率从36.1%提升到77.8%,而且未见任务上的增益尤其明显。为了把庞大的世界模型用于实时控制,它还设计了异步Slow-Fast双系统,让轻量分支在RTX 4090上以30Hz预测动作。真正值得关注的是,无动作视频或许无法直接教机器人「怎么动」,却能提前提供跨物体、跨场景的物理经验,让有限的动作标注更值钱。
原文:ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training
03 多模态 四项协同设计支撑像素文本泛化
分辨率与字体尺度、真实图文对、版式感知渲染、多语言课程——这项工作的核心不是再报一个模型分数,而是通过受控消融拆出四个关键设计变量。作者发现,动态分辨率帮助模型适应高清文档,真实图像负责建立视觉落地,保留版式可避免模型走像素捷径,而两阶段训练则改善跨语言对齐。基于这套配方训练的Pixel Linguist II使用2.8亿个样本,在英语、跨语言和多语言视觉语义任务上取得了新的最佳结果。更值得关注的是,作者报告它在压缩80%视觉token后仍保持稳健,意味着大量文字内容或许能先被编码器压缩,再交给多模态大模型处理。对文档智能团队而言,这四项设计可以直接变成训练检查清单,但压缩后的具体损失与计算成本仍需看全文确认。
原文:On the Design Fundamentals of Pixel Text Representation Learning
04 训练优化 同一种蒸馏,为何会教会推理却拖慢记忆?
同样是前向KL蒸馏,介入阶段不同,学生继承的能力竟会发生分化:预训练时推理与事实记忆同步受益,中期训练时却变成推理继续增强、事实记忆获取放缓。作者将原因归结为教师在不同数据上的信心不对称——它更擅长指导程序化推理,而学生此时已能较早掌握确定性较高的事实知识。Switch Distillation据此用预测熵判断教师是否足够自信:自信时蒸馏,否则退回标准交叉熵训练。相较普通的下一词预测,这种切换策略将推理表现提升至1.61-1.71倍,同时保留96.7%-96.8%的事实记忆,且优势在后训练后仍然存在。真正值得带走的不是「蒸馏损害事实能力」,而是蒸馏介入的时机与范围,本身就是决定模型更偏向继承解题过程还是知识库存的训练旋钮。
原文:Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall
05 Agent GUI Agent走向产品,需要三套基础设施
UI-Venus-2把手机、网页和桌面纳入统一闭环,并同步扩展环境覆盖、任务构造和奖励核验。它还通过深度研究流程生成贴近真实功能的任务,再结合视觉关键点、多模型投票和轨迹级评估,提高强化学习反馈的可信度。对涉及后果的操作,系统加入了安全控制机制,但实际可靠性仍需结合全文与真实部署结果判断。对GUI Agent团队而言,更值得复用的不是又一个榜单模型,而是环境、任务和核验三套基础设施一起扩展的工程路线。

也值得关注
今日观察
今天几项工作共同指向一种分层的数据策略。第一层追求廉价且宽覆盖的通用表征:第一视角视频提供跨物体、跨场景的物理经验,像素文本则覆盖分辨率、版式和语言变化。第二层转向窄而关键的失败分布,用真实生产流量发现企业请求中的能力缺口,以分层错误记忆定位尚未解决的弱点,并将Agent运行时上下文压缩产生的分叉历史纳入训练。第三层负责让改进回到系统,通过确定性验证、可核验任务与闭环执行确认模型是否真正完成目标。
这三层承担的功能不同,也不应继续混入同一个数据规模指标:覆盖面数据池应衡量环境、语言和行为的多样性;失败样本回流管道应衡量关键错误的发现率、复现率与修复周期;可验证执行集则应衡量端到端成功率、核验可靠性和高风险操作边界。具体行动是本周选一个现有模型或Agent项目,将数据资产按这三层重新盘点,并为每层各设一个独立指标和负责人。