今日概览
- Agent能力开始以持续交付衡量:Apodex 1.1将状态保持、失败恢复、多Agent协作和结果验证纳入完整工作轨迹。
- 复杂检索会放大语音识别错误,实体图与多轮改写使F1跌幅扩大36%–67%,错误实体是主要退化来源。
- 环境侧正则化释放策略探索预算。ERPO用Query-KL约束查询分布,让PPO、GRPO能分别调节训练稳定性与回答探索。
- 少量全局注意力头即可承担长期记忆:ReWorld以局部头维持实时控制,并用固定KV缓存和地标库保存长期空间状态。
重点关注
01 Agent 真正能干活的Agent,开始用「持续交付」来定义
「工作能力」(working capability)把Agent的目标从答对一次,改写为持续、可验证地推进真实任务:它不仅要调用文件、搜索和代码工具,还要记住状态、从失败中恢复,最终交付可检查的结果。Apodex 1.1的关键思路是同时扩展两件事——一边增加多样且可验证的执行环境,一边训练Agent拆解长程任务、并行委派、整合异步结果并动态重规划。共享执行框架和AgentOS则负责保留任务状态与操作来源,让多Agent协作不只是「多开几个对话」,而是一条能够追踪和复核的工作链。摘要称其在金融、科研、数学、编程和搜索等复杂任务上进入领先梯队,同时35B参数的Mini版本仍保留较强能力,为本地部署提供了一个值得关注的尺寸。真正有意思的不是模型又多拿了多少分,而是训练对象开始从最终答案转向完整工作轨迹:哪里失败、如何修正、由谁完成、交付是否通过验证,都成为能力的一部分。不过这些机制能否在长时间运行中稳定控制错误传播、协调成本和验证质量,仍需结合全文实验确认;评估Agent产品时,也该开始检查它能否持续交付,而不只看一次性得分。
原文:Apodex 1.1: Scaling Agentic Intelligence for Complex Work
02 检索 检索链路越聪明,语音RAG反而越容易错?
直觉上,实体图和多轮改写应该能修正语音查询里的小偏差,但实验显示,它们可能把一次「听错」扩散成更自洽的错误。相比朴素的稠密检索,两者结合后,从干净文本到最高词错率口音的F1跌幅扩大了36%–67%,这一现象出现在全部三个多跳问答基准上。症结主要不是检索量不足,而是实体被自动语音识别(ASR)弄错:在2WikiMultiHopQA中,这类问题占性能退化案例的87%–96%,简单的表面文本修补也未能填平差距。更复杂的方案仍有更高的绝对F1,但这不等于更强的抗错能力。由于口音来自神经语音合成,真实用户场景还需进一步验证;做语音产品的团队更该测量整条链路如何放大错误,而不只是盯着召回率。
原文:Better Retrieval, Worse Robustness: How Multi-hop RAG Amplifies Upstream ASR Errors
03 训练优化 把稳定约束移到环境侧,释放策略探索预算
Policy-KL把模型输出拴在参考策略附近,既控制训练漂移,也直接压缩了回答侧的探索空间。ERPO把这两项职责拆开:用Query-KL约束训练过程中查询分布的偏移,并以参考分布生成的静态权重,让更新更偏向典型查询。由于这项正则化的梯度只经过查询概率,不直接干预回答分布,PPO、GRPO等流程可以分别调节「环境稳定性」和「策略探索强度」,而且无需增加前向计算。摘要报告称,该方法在6个数学推理基准上取得更高准确率,并在高温采样和长周期训练下表现得更稳定。这个思路可能改变后训练的调参逻辑,但目前证据集中在数学任务,跨领域是否仍能稳住查询分布、又不引入新的偏差,还需要更多验证。
原文:Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
04 视频生成 少数注意力头承担长记忆
交互式世界模型的实时响应与长期一致性,未必需要靠无限扩张上下文来解决。ReWorld把注意力头分工:大多数局部头只关注近期画面,维持动作控制速度;少量全局头回看完整历史,负责保存空间记忆,并通过随机路由避免能力固化在特定头上。推理时,历史被压进固定大小的KV缓存(注意力计算所需的中间状态),再从按相机位置索引的地标库中取回附近场景,因此内存开销不会随游玩时间持续增长。摘要报告称,在64秒、384个潜变量的往返测试中,仅保留12个数据块仍能重建起点画面,同时四步采样可实时输出704×1280视频。对做交互视频、游戏生成或具身模拟的团队来说,真正值得关注的不是更长窗口,而是把短期控制与长期记忆拆成不同的计算职责。
原文:ReWorld: An Interactive World Model with Long-Horizon Memory

也值得关注
今日观察
Apodex把真实工作能力定义为持续且可验证的推进,Prime Agent把历史、记忆和技能跨轨迹保存,ReWorld则把短期控制与长期记忆分配给不同注意力通道。三者共同说明,长程系统真正稀缺的资源是状态的生命周期管理:哪些内容进入当前工作窗口,哪些信息需要持久化,失败后从哪个状态恢复,以及如何证明最终状态仍满足目标。延长任务步数无法单独回答这些问题,评测应拆成状态漂移、恢复点质量、旧信息召回和交付验证四类,并分别记录失败位置与恢复成本。下一轮测试可先为每类设计一个可重复用例,再将四项结果并列纳入发布门槛。