今日概览
- 混合Agent会复刻界面,却仍不会可靠交付:RecreationWorld把探索、编码、运行和视觉验收连成闭环;领先模型总体得分达58.1%,但仅2.8%的任务通过全部程序测试。
- 现成代码可以反向生成强化学习任务,CodeMidas从3185个开源仓库构造5545个可执行验证任务,绕开了训练数据对issue和commit的依赖。
- 翻译推理的收益取决于语言、领域与模型。推理长度和质量并非单调相关,团队需要判断实际增益能否覆盖额外延迟与算力成本。
- 机器遗忘必须连同中间轨迹一起审计:最终答案合规不代表推理过程没有泄露,安全退出也不能直接证明目标知识已从参数中移除。
- 技能图比线性长指令更适合表达流程依赖,GraphSkillEvo通过显式组织步骤和分支减少冗余,在两种模型上的平均准确率分别提高4.01%和1.76%。
重点关注
01 Agent写代码之后,还要亲眼验收成果
真实的数字工作往往在界面探索、代码实现、运行调试和视觉验收之间反复切换,RecreationWorld把这些环节放进了同一个任务闭环。Agent拿到一个正在运行的参考应用后,没有规定好的操作流程,必须自己摸清行为、重建软件,再通过界面检查成品是否真的可用。参考应用同时充当「答案机器」,让隐藏测试能够根据实际运行结果给出奖励,比只检查代码或截图更接近真实交付。这个框架覆盖Ubuntu、macOS、Windows、Android和Web,并用统一工具链提供原生界面控制与编码能力,让混合型计算机操作Agent能在五个平台的统一环境中被系统训练和比较。用这些轨迹训练后,模型在5个分布外的编程与混合操作基准上都有提升,也更愿意主动检查渲染结果,说明学到的不只是复刻任务的固定套路。与此同时,新基准RecreationBench的250个任务揭示了明显落差:领先模型GPT-6 Astra总体得分达到58.1%,但只有2.8%的任务通过全部程序测试,Agent更擅长复制静态界面,还远未掌握复杂交互和计算逻辑。对做Coding Agent或桌面自动化的团队来说,真正值得关注的不只是「能不能生成」,而是训练和评测能否把探索、实现与可执行验收连成一体。
原文:RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents
02 代码智能 不依赖issue和commit,从已实现行为反推规格与验证器
训练Coding Agent最缺的不是代码,而是有可靠答案、能自动验收的任务。CodeMidas把已经实现的功能当作答案,先由Agent探索其行为并反推出任务规格,再通过运行原始代码构造测试,最后用执行检查和多轮解题筛掉不可靠样本。这样不再依赖issue和commit,也生成了来自3185个开源仓库、覆盖23种语言的5545个训练任务。用这些任务强化训练后,模型在五项基准上均有提升,其中整程序构建提升17%,代码修复提升11.7%,终端任务提升8.5%。对训练Coding Agent的团队来说,真正值得关注的是这套不依赖issue和commit的供给机制:Agent从已实现行为反推规格,并用原始程序的执行结果构造验证器,让既有功能转化为可验证的强化学习任务。
原文:CodeMidas: Scaling Agentic Coding RL Environments from Code Itself
03 推理 翻译不是想得越久越准确
给机器翻译加上推理轨迹,并不一定稳定提高质量。这项研究发现,推理效果取决于具体模型、推理所用语言和任务领域,而推理长度与翻译质量呈非单调关系:太短可能不够,继续拉长也未必更好。作者用分层元总结方法归纳出理解与规划、翻译与起草、润色与验证等常见结构,同时观察到不同领域存在差异。对做翻译产品的团队来说,更合理的策略不是统一开启长推理,而是按模型和场景测试推理模式的实际增益;部署团队还需另行衡量由更长推理带来的延迟与算力开销。
原文:When Does Reasoning Help in Machine Translation? A Hierarchical Analysis of LRM Reasoning Traces
04 安全对齐 模型说「不知道」,就真的忘了吗?
机器遗忘若只检查最终答案,很可能漏掉已经出现在中间推理轨迹里的受保护事实或危险思路。GUARD不再单纯压制目标内容,而是把原本会泄露的信息改造成连贯的安全退出过程:先生成不泄露的推理,再给出稳定的拒答,并将这种行为蒸馏进模型参数。它还提出NFRS指标,检查遗忘后的输出是否结构稳定、表达流畅,以及是否用未经支持的内容替代被遗忘事实。摘要称,该方法在隐私与有害意图测试中降低了两类蒸馏推理模型的泄露,同时保留推理能力。不过,输出看起来更自然、更安全,只能证明行为抑制做得更好;目标知识是否真正从参数中移除,仍需看全文中的攻击测试和机制证据。
原文:GUARD: Natural Forgetting in Large Reasoning Models via Guided Answer-Reasoning Distillation
05 Agent 技能越写越长,Agent反而更不会做事?
不少技能优化方法都在反复润色自然语言指令,但问题可能不只是措辞不够好:一旦任务包含分支和前后依赖,线性说明很容易冗长,也难以明确下一步该做什么。GraphSkillEvo把技能改写成流程图,节点描述执行步骤,连线表示不同上下文下的转移,让工作流本身成为可检查、可调整的对象。在此基础上,它用多个候选方案进行变异和组合,尝试保留有效步骤并扩大搜索范围,而不只是让模型对同一份提示词反复自我修改。在5个Agent基准上,它相对SkillOpt将GPT-5.4-nano和GPT-5.4的平均准确率分别提高4.01%和1.76%。更大的提升出现在小模型上,但是否说明结构化技能能稳定弥补模型能力差距,还需要看全文中的分任务结果;现阶段更实用的启示,是把复杂技能当作可维护的工作流,而不是越写越长的说明书。
原文:GraphSkillEvo: Evolutionary Optimization of Graph-Structured Agent Skills

也值得关注
今日观察
翻译分析与机器遗忘从两个方向表明,中间推理轨迹已不能只被视为服务最终答案的临时脚手架。任务效用上,它是否改善结果取决于模型、语言和领域,部分场景甚至可能因额外推理而退化;成本上,即使质量略有提升,也要判断收益能否抵消延迟与算力;信息安全上,最终答案合规并不意味着轨迹没有提前暴露受保护事实或危险思路。这不是「思维链有害」的笼统结论,而是要求团队分别衡量效用、成本与泄露风险。具体行动是为每个语言与业务领域建立轨迹级评测集,同时记录质量增益、推理开销和敏感信息暴露率,并将其设为模型上线门槛。