OSWorld平均任务得分33.0%→40.8%

今日概览

  • 后训练提高单次成功率,却可能缩小解法覆盖。 研究覆盖4个模型家族、3个Agent基准的42个案例,Sharpening Tax在多数设置中出现;给足测试时预算后,基础模型的pass@K往往更高。
  • 图像生成器可以充当GUI环境模拟器: AutoGUIWorld无需安装软件即可合成交互轨迹,微调后OSWorld平均任务得分从33.0%升至40.8%,但状态转移、动作落点与质量过滤仍是落地关键。
  • 4Director把导演意图变成可执行的3D几何约束。 系统复用一次重建的规范网格并逐帧执行刚体变换,提升跨视角一致性;非刚性变化仍由生成模型补全。

重点关注

01 训练优化 单次更准,重复采样却可能少解出题

后训练模型单次作答更准,但给足推理预算后,基础模型反而可能解出更多任务。研究覆盖4个模型家族的14组基础版与后训练版模型,在3个Agent基准上检查了42个案例:后训练会让任务趋向「稳定解出」或「始终解不出」,在提高pass@1和一致性的同时以解法覆盖率为代价;Sharpening Tax在多数设置中出现。给足测试时预算后,基础模型的pass@K往往超过后训练版本。论文用Sharpening Tax衡量后训练造成的测试时扩展能力损失,并称少量rollout就能估算;具体稳定性仍需要看全文确认。作者还提出按任务难度自适应温度的PTGS采样器,在两个Agent环境的强化学习训练中,相比固定温度同时改善了单次成功率和重复采样覆盖率。对Agent团队来说,训练方案不能只按pass@1选优,而应结合真实部署预算检查pass@K:如果线上允许多次尝试,保留稀有解法可能比让模型更稳定更重要。

评估Agent后训练时同时检查pass@1与部署预算对应的pass@K用Sharpening Tax判断训练是否牺牲了测试时扩展能力固定采样温度未必合适,可关注按任务难度自适应的采样策略

02 Agent 图像生成器无需安装软件也能教Agent操作电脑

图像生成器开始承担一种更有意思的职责:不只是画界面,而是充当软件环境的视觉模拟器。AutoGUIWorld先生成初始界面,再由规划器给出原子操作及预期变化,让图像生成器逐步改写截图,由此合成带动作落点和状态转移的训练轨迹,无需实际安装对应软件。摘要报告称,用这些数据微调Qwen3.5-35B-A3B后,OSWorld平均任务得分从33.0%升至40.8%,ScienceBoard任务成功率则从14.0%升至32.2%,说明合成经验能够迁移到真实任务。真正决定这条路线能否落地的,不是截图看起来多逼真,而是每一步状态转移是否可信、动作落点是否准确校准,以及是否实施转移级质量过滤。对训练GUI Agent的团队来说,图像生成器正在变成可扩展的环境基础设施,但还不能把生成出来的交互轨迹默认当成真实世界。

可用图像生成器在无需安装或运行对应软件环境的情况下扩展训练环境覆盖评估合成轨迹时应优先检查状态转移和动作落点,而非只看画面质量真实任务上的明显提升证明方向值得投入,但质量过滤必须作为核心工程能力

03 视频生成 一次建模、逐帧执行:视频模型有了怎样的控制契约?

4Director先从输入图像中把每个物体重建为一次性的规范网格,再由用户为每一帧指定刚体变换,相当于把导演意图写成可执行的3D几何约束。由于未被观察到的物体结构不必在每帧重新生成,视角变化时的形状一致性更容易维持,也避开了2D轨迹难以表达深度和旋转的问题。系统把受控场景渲染成深度视频,再由Motion Adapter补全外观、光照和非刚性动态;训练则依赖含20,774段标注视频的RealCOD-Rigid数据集。论文摘要称其在画质、镜头和物体控制上均优于此前方法,但这套明确的控制契约主要覆盖刚体运动,形变等非刚性变化仍交给生成模型推断。对制作工具团队而言,值得验证的不只是成片观感,而是几何约束之外的补全会不会重新引入不可预测性。

一次建模加逐帧刚体变换,让控制从模糊提示升级为可执行的3D约束跨视角一致性来自复用同一物体网格,而非逐帧猜测隐藏结构评估落地价值时,应重点测试形变、遮挡和复杂光照下的控制边界
OSWorld平均任务得分33.0%→40.8%

也值得关注

04
让连续潜变量成为唯一持久状态,并让离散token反向搭脚手架。 模型架构HC-DLM尝试同时修补并行解码的依赖断裂与连续表示的合法性缺口。链接
05
文本嵌入并非越可区分越适合扩散生成。 训练优化软标签蒸馏拉近合理替代词,形成更连通、更容易采样的潜空间。链接
06
长时Agent除了压缩历史,还需要显式维护当前世界、未决要求和停滞状态。 AgentPoS会检查信念一致性,并针对不同卡死模式选择恢复动作。链接
07
Agent脚手架迭代时,训练场景也应随失败模式动态变化。 AgentActiveSaddler的非平稳课程在GAIA2和Terminal-Bench 2.0上分别将测试Pass@1提高4.4和7.5个百分点。链接
08
目录能塞进长上下文,不代表模型就能有效使用。 检索RPTune先学习商品排序与裁剪,再以相对当前上下文的奖励进行后训练。链接
09
程序执行记录和带时间戳的事件,可以检查视频是否真正呈现规则结果。 评测PROWBench将世界模型评测从「看起来合理」推进到「是否忠实执行」。链接
10
长音视频推理不必一次看完全部内容。 多模态OmniSeek主动决定何时看、何时听,并用奖励抑制仅靠单一模态完成任务的捷径。链接
11
Lean代码能编译,不等于证明了正确命题。 代码智能隔离执行、语句比对、假设审计和独立复核共同把成功结果变成可追溯证据。链接
12
混合Transformer与SSM的生产架构可直接沿用μP学习率。 训练优化实验覆盖宽度256至2048、深度4至32及十亿参数规模,经验有效性先于现有理论诊断。链接
13
VideoLLM并非没有学到时间顺序,而是相关表示在中间层达到峰值后逐层消退。 可解释性推理时重新注入时间差异向量,无需训练即可部分挽回时间推理能力。链接
14
由一组稀疏SE(3)轨迹构成的共享表示,可以覆盖物体、人体、相机与机器人动作。 机器人World Motion Models通过不同掩码覆盖预测、补全、控制和跨形态迁移。链接
15
覆盖1,642种Kali工具的评测显示,在无显式工具提示的不受限设置中,没有开放权重模型的精确命令准确率超过42%。 评测KaliBench还提供无需实际运行命令的可验证训练奖励。链接

今日观察

三篇主文揭示了容易被混为一谈的两条产品轴:覆盖率决定系统能触达多少环境状态和有效解法,约束遵循则决定一次输出能否忠实执行意图。AutoGUIWorld用合成环境扩大训练状态覆盖,4Director用显式几何收紧成片的自由度,Sharpening Tax则警告后训练可能在提高单次可靠性的同时缩小解法覆盖。实践中应分别报告状态覆盖率或解法覆盖率与约束遵循率,并明确在哪一阶段扩张可能性、在哪一阶段收紧输出;下一轮评测可先建立两组独立指标,再按训练、采样和生成阶段逐项标注它们的变化。