Agent总分58.1%,全测仅2.8%

今日概览

  • 混合Agent会复刻界面,却仍不会可靠交付:RecreationWorld把探索、编码、运行和视觉验收连成闭环;领先模型总体得分达58.1%,但仅2.8%的任务通过全部程序测试。
  • 现成代码可以反向生成强化学习任务,CodeMidas从3185个开源仓库构造5545个可执行验证任务,绕开了训练数据对issue和commit的依赖。
  • 翻译推理的收益取决于语言、领域与模型。推理长度和质量并非单调相关,团队需要判断实际增益能否覆盖额外延迟与算力成本。
  • 机器遗忘必须连同中间轨迹一起审计:最终答案合规不代表推理过程没有泄露,安全退出也不能直接证明目标知识已从参数中移除。
  • 技能图比线性长指令更适合表达流程依赖,GraphSkillEvo通过显式组织步骤和分支减少冗余,在两种模型上的平均准确率分别提高4.01%和1.76%。

重点关注

01 Agent写代码之后,还要亲眼验收成果

真实的数字工作往往在界面探索、代码实现、运行调试和视觉验收之间反复切换,RecreationWorld把这些环节放进了同一个任务闭环。Agent拿到一个正在运行的参考应用后,没有规定好的操作流程,必须自己摸清行为、重建软件,再通过界面检查成品是否真的可用。参考应用同时充当「答案机器」,让隐藏测试能够根据实际运行结果给出奖励,比只检查代码或截图更接近真实交付。这个框架覆盖Ubuntu、macOS、Windows、Android和Web,并用统一工具链提供原生界面控制与编码能力,让混合型计算机操作Agent能在五个平台的统一环境中被系统训练和比较。用这些轨迹训练后,模型在5个分布外的编程与混合操作基准上都有提升,也更愿意主动检查渲染结果,说明学到的不只是复刻任务的固定套路。与此同时,新基准RecreationBench的250个任务揭示了明显落差:领先模型GPT-6 Astra总体得分达到58.1%,但只有2.8%的任务通过全部程序测试,Agent更擅长复制静态界面,还远未掌握复杂交互和计算逻辑。对做Coding Agent或桌面自动化的团队来说,真正值得关注的不只是「能不能生成」,而是训练和评测能否把探索、实现与可执行验收连成一体。

混合型Agent应在界面操作、编码和验收之间自主切换,而不是串联几个孤立模块运行中的参考应用可以提供可验证奖励,让视觉相似与行为正确被同时衡量58.1%的总体得分与2.8%的全测试通过率表明,Agent对静态界面的复刻相对更可靠,但复杂交互和计算逻辑仍是主要瓶颈

02 代码智能 不依赖issue和commit,从已实现行为反推规格与验证器

训练Coding Agent最缺的不是代码,而是有可靠答案、能自动验收的任务。CodeMidas把已经实现的功能当作答案,先由Agent探索其行为并反推出任务规格,再通过运行原始代码构造测试,最后用执行检查和多轮解题筛掉不可靠样本。这样不再依赖issue和commit,也生成了来自3185个开源仓库、覆盖23种语言的5545个训练任务。用这些任务强化训练后,模型在五项基准上均有提升,其中整程序构建提升17%,代码修复提升11.7%,终端任务提升8.5%。对训练Coding Agent的团队来说,真正值得关注的是这套不依赖issue和commit的供给机制:Agent从已实现行为反推规格,并用原始程序的执行结果构造验证器,让既有功能转化为可验证的强化学习任务。

没有issue和commit,已实现功能也能反推出训练任务原始代码的执行结果可以为测试与验证器提供可靠依据拥有大量代码仓库的团队可把内部功能转化为可扩展的强化学习任务来源

03 推理 翻译不是想得越久越准确

给机器翻译加上推理轨迹,并不一定稳定提高质量。这项研究发现,推理效果取决于具体模型、推理所用语言和任务领域,而推理长度与翻译质量呈非单调关系:太短可能不够,继续拉长也未必更好。作者用分层元总结方法归纳出理解与规划、翻译与起草、润色与验证等常见结构,同时观察到不同领域存在差异。对做翻译产品的团队来说,更合理的策略不是统一开启长推理,而是按模型和场景测试推理模式的实际增益;部署团队还需另行衡量由更长推理带来的延迟与算力开销。

不要把推理长度当作可直接拉满的质量旋钮应分别验证模型、语言和领域组合,避免用单一结论覆盖全部场景只有增益能覆盖额外延迟与算力时,推理才值得启用

04 安全对齐 模型说「不知道」,就真的忘了吗?

机器遗忘若只检查最终答案,很可能漏掉已经出现在中间推理轨迹里的受保护事实或危险思路。GUARD不再单纯压制目标内容,而是把原本会泄露的信息改造成连贯的安全退出过程:先生成不泄露的推理,再给出稳定的拒答,并将这种行为蒸馏进模型参数。它还提出NFRS指标,检查遗忘后的输出是否结构稳定、表达流畅,以及是否用未经支持的内容替代被遗忘事实。摘要称,该方法在隐私与有害意图测试中降低了两类蒸馏推理模型的泄露,同时保留推理能力。不过,输出看起来更自然、更安全,只能证明行为抑制做得更好;目标知识是否真正从参数中移除,仍需看全文中的攻击测试和机制证据。

评估模型遗忘时应同时审计中间推理与最终答案安全拒答还要检查幻觉替代和重复等副作用GUARD证明了联合治理推理与答案的价值,但不能据此认定知识已被彻底删除

05 Agent 技能越写越长,Agent反而更不会做事?

不少技能优化方法都在反复润色自然语言指令,但问题可能不只是措辞不够好:一旦任务包含分支和前后依赖,线性说明很容易冗长,也难以明确下一步该做什么。GraphSkillEvo把技能改写成流程图,节点描述执行步骤,连线表示不同上下文下的转移,让工作流本身成为可检查、可调整的对象。在此基础上,它用多个候选方案进行变异和组合,尝试保留有效步骤并扩大搜索范围,而不只是让模型对同一份提示词反复自我修改。在5个Agent基准上,它相对SkillOpt将GPT-5.4-nano和GPT-5.4的平均准确率分别提高4.01%和1.76%。更大的提升出现在小模型上,但是否说明结构化技能能稳定弥补模型能力差距,还需要看全文中的分任务结果;现阶段更实用的启示,是把复杂技能当作可维护的工作流,而不是越写越长的说明书。

多分支任务应优先显式表达步骤依赖,而非继续堆叠提示词图结构让技能的冗余、缺口和错误跳转更容易被定位小模型可能更受益于明确流程,但需要按任务验证收益是否稳定
Agent总分58.1%,全测仅2.8%

也值得关注

06
MintAct把UI定位、跨端导航与视觉工具调用统一进同一模型族 多模态重点观察通用视觉Agent能否减少分场景系统拼装。链接
07
PrismAlign用多视角VLM与表格逻辑先验共同约束OCR 多模态它试图分别处理结构错误与单元格语义幻觉。链接
08
CompAdapt正面处理复合运动的物理一致性 视频生成关键在于约束复杂动作时能否继续保持生成适应性。链接
09
PointLAM为点式3D检测结合局部注意力与Mamba 模型架构目标是在保留点云几何精度的同时缓解计算瓶颈。链接
10
潜在语音表示可以先定位与查询相关的转录片段 检索复用ASR编码器有望为长音频下游处理提供更轻量的前置筛选。链接
11
OmniVBench为混杂的参考视频控制方式补建统一评测 评测它纳入更广的参考类型与组合场景,以覆盖现有基准的缺口。链接
12
Cube-Splat把360度画面分解为固定方向立方体视图 机器人通过保持优化一致性,拓展Gaussian Splatting SLAM对全景相机的适配。链接
13
数字角色扮演开始从复述记忆转向建模情境化行为 Agent这一方向也需要重新审视社交媒体数字人格的真实性边界。链接

今日观察

翻译分析与机器遗忘从两个方向表明,中间推理轨迹已不能只被视为服务最终答案的临时脚手架。任务效用上,它是否改善结果取决于模型、语言和领域,部分场景甚至可能因额外推理而退化;成本上,即使质量略有提升,也要判断收益能否抵消延迟与算力;信息安全上,最终答案合规并不意味着轨迹没有提前暴露受保护事实或危险思路。这不是「思维链有害」的笼统结论,而是要求团队分别衡量效用、成本与泄露风险。具体行动是为每个语言与业务领域建立轨迹级评测集,同时记录质量增益、推理开销和敏感信息暴露率,并将其设为模型上线门槛。