今日概览
- 后训练提高单次成功率,却可能缩小解法覆盖。 研究覆盖4个模型家族、3个Agent基准的42个案例,Sharpening Tax在多数设置中出现;给足测试时预算后,基础模型的pass@K往往更高。
- 图像生成器可以充当GUI环境模拟器: AutoGUIWorld无需安装软件即可合成交互轨迹,微调后OSWorld平均任务得分从33.0%升至40.8%,但状态转移、动作落点与质量过滤仍是落地关键。
- 4Director把导演意图变成可执行的3D几何约束。 系统复用一次重建的规范网格并逐帧执行刚体变换,提升跨视角一致性;非刚性变化仍由生成模型补全。
重点关注
01 训练优化 单次更准,重复采样却可能少解出题
后训练模型单次作答更准,但给足推理预算后,基础模型反而可能解出更多任务。研究覆盖4个模型家族的14组基础版与后训练版模型,在3个Agent基准上检查了42个案例:后训练会让任务趋向「稳定解出」或「始终解不出」,在提高pass@1和一致性的同时以解法覆盖率为代价;Sharpening Tax在多数设置中出现。给足测试时预算后,基础模型的pass@K往往超过后训练版本。论文用Sharpening Tax衡量后训练造成的测试时扩展能力损失,并称少量rollout就能估算;具体稳定性仍需要看全文确认。作者还提出按任务难度自适应温度的PTGS采样器,在两个Agent环境的强化学习训练中,相比固定温度同时改善了单次成功率和重复采样覆盖率。对Agent团队来说,训练方案不能只按pass@1选优,而应结合真实部署预算检查pass@K:如果线上允许多次尝试,保留稀有解法可能比让模型更稳定更重要。
原文:Sharpening Tax in Post-Training
02 Agent 图像生成器无需安装软件也能教Agent操作电脑
图像生成器开始承担一种更有意思的职责:不只是画界面,而是充当软件环境的视觉模拟器。AutoGUIWorld先生成初始界面,再由规划器给出原子操作及预期变化,让图像生成器逐步改写截图,由此合成带动作落点和状态转移的训练轨迹,无需实际安装对应软件。摘要报告称,用这些数据微调Qwen3.5-35B-A3B后,OSWorld平均任务得分从33.0%升至40.8%,ScienceBoard任务成功率则从14.0%升至32.2%,说明合成经验能够迁移到真实任务。真正决定这条路线能否落地的,不是截图看起来多逼真,而是每一步状态转移是否可信、动作落点是否准确校准,以及是否实施转移级质量过滤。对训练GUI Agent的团队来说,图像生成器正在变成可扩展的环境基础设施,但还不能把生成出来的交互轨迹默认当成真实世界。
原文:AutoGUIWorld: Image Generators as Visual World Models for GUI Agent
03 视频生成 一次建模、逐帧执行:视频模型有了怎样的控制契约?
4Director先从输入图像中把每个物体重建为一次性的规范网格,再由用户为每一帧指定刚体变换,相当于把导演意图写成可执行的3D几何约束。由于未被观察到的物体结构不必在每帧重新生成,视角变化时的形状一致性更容易维持,也避开了2D轨迹难以表达深度和旋转的问题。系统把受控场景渲染成深度视频,再由Motion Adapter补全外观、光照和非刚性动态;训练则依赖含20,774段标注视频的RealCOD-Rigid数据集。论文摘要称其在画质、镜头和物体控制上均优于此前方法,但这套明确的控制契约主要覆盖刚体运动,形变等非刚性变化仍交给生成模型推断。对制作工具团队而言,值得验证的不只是成片观感,而是几何约束之外的补全会不会重新引入不可预测性。
原文:4Director: Controlling Video World Models with Rigid 3D Geometry

也值得关注
今日观察
三篇主文揭示了容易被混为一谈的两条产品轴:覆盖率决定系统能触达多少环境状态和有效解法,约束遵循则决定一次输出能否忠实执行意图。AutoGUIWorld用合成环境扩大训练状态覆盖,4Director用显式几何收紧成片的自由度,Sharpening Tax则警告后训练可能在提高单次可靠性的同时缩小解法覆盖。实践中应分别报告状态覆盖率或解法覆盖率与约束遵循率,并明确在哪一阶段扩张可能性、在哪一阶段收紧输出;下一轮评测可先建立两组独立指标,再按训练、采样和生成阶段逐项标注它们的变化。