语音RAG的F1跌幅扩大67%

今日概览

  • Agent能力开始以持续交付衡量:Apodex 1.1将状态保持、失败恢复、多Agent协作和结果验证纳入完整工作轨迹。
  • 复杂检索会放大语音识别错误,实体图与多轮改写使F1跌幅扩大36%–67%,错误实体是主要退化来源。
  • 环境侧正则化释放策略探索预算。ERPO用Query-KL约束查询分布,让PPO、GRPO能分别调节训练稳定性与回答探索。
  • 少量全局注意力头即可承担长期记忆:ReWorld以局部头维持实时控制,并用固定KV缓存和地标库保存长期空间状态。

重点关注

01 Agent 真正能干活的Agent,开始用「持续交付」来定义

「工作能力」(working capability)把Agent的目标从答对一次,改写为持续、可验证地推进真实任务:它不仅要调用文件、搜索和代码工具,还要记住状态、从失败中恢复,最终交付可检查的结果。Apodex 1.1的关键思路是同时扩展两件事——一边增加多样且可验证的执行环境,一边训练Agent拆解长程任务、并行委派、整合异步结果并动态重规划。共享执行框架和AgentOS则负责保留任务状态与操作来源,让多Agent协作不只是「多开几个对话」,而是一条能够追踪和复核的工作链。摘要称其在金融、科研、数学、编程和搜索等复杂任务上进入领先梯队,同时35B参数的Mini版本仍保留较强能力,为本地部署提供了一个值得关注的尺寸。真正有意思的不是模型又多拿了多少分,而是训练对象开始从最终答案转向完整工作轨迹:哪里失败、如何修正、由谁完成、交付是否通过验证,都成为能力的一部分。不过这些机制能否在长时间运行中稳定控制错误传播、协调成本和验证质量,仍需结合全文实验确认;评估Agent产品时,也该开始检查它能否持续交付,而不只看一次性得分。

评估Agent时应同时检查状态保持、失败恢复和交付验证,不能只测最终答案多Agent系统的核心工程资产是可追踪的共享状态与协调机制,而非Agent数量本地部署团队可关注35B级模型,但仍需用自己的长流程任务验证稳定性与成本

02 检索 检索链路越聪明,语音RAG反而越容易错?

直觉上,实体图和多轮改写应该能修正语音查询里的小偏差,但实验显示,它们可能把一次「听错」扩散成更自洽的错误。相比朴素的稠密检索,两者结合后,从干净文本到最高词错率口音的F1跌幅扩大了36%–67%,这一现象出现在全部三个多跳问答基准上。症结主要不是检索量不足,而是实体被自动语音识别(ASR)弄错:在2WikiMultiHopQA中,这类问题占性能退化案例的87%–96%,简单的表面文本修补也未能填平差距。更复杂的方案仍有更高的绝对F1,但这不等于更强的抗错能力。由于口音来自神经语音合成,真实用户场景还需进一步验证;做语音产品的团队更该测量整条链路如何放大错误,而不只是盯着召回率。

评估语音RAG时应同时报告干净文本与不同识别误差下的性能差距加入实体图或多跳改写前,要专门测试错误实体会不会沿检索链路扩散更高的绝对准确率不代表更稳健,真实口音和噪声环境仍需单独验证

03 训练优化 把稳定约束移到环境侧,释放策略探索预算

Policy-KL把模型输出拴在参考策略附近,既控制训练漂移,也直接压缩了回答侧的探索空间。ERPO把这两项职责拆开:用Query-KL约束训练过程中查询分布的偏移,并以参考分布生成的静态权重,让更新更偏向典型查询。由于这项正则化的梯度只经过查询概率,不直接干预回答分布,PPO、GRPO等流程可以分别调节「环境稳定性」和「策略探索强度」,而且无需增加前向计算。摘要报告称,该方法在6个数学推理基准上取得更高准确率,并在高温采样和长周期训练下表现得更稳定。这个思路可能改变后训练的调参逻辑,但目前证据集中在数学任务,跨领域是否仍能稳住查询分布、又不引入新的偏差,还需要更多验证。

调PPO或GRPO时,可尝试把漂移控制与回答侧探索拆成两个独立旋钮高温采样或长周期训练场景更值得关注输入侧正则化数学基准上的稳定性尚不能直接外推到代码、工具调用等任务

04 视频生成 少数注意力头承担长记忆

交互式世界模型的实时响应与长期一致性,未必需要靠无限扩张上下文来解决。ReWorld把注意力头分工:大多数局部头只关注近期画面,维持动作控制速度;少量全局头回看完整历史,负责保存空间记忆,并通过随机路由避免能力固化在特定头上。推理时,历史被压进固定大小的KV缓存(注意力计算所需的中间状态),再从按相机位置索引的地标库中取回附近场景,因此内存开销不会随游玩时间持续增长。摘要报告称,在64秒、384个潜变量的往返测试中,仅保留12个数据块仍能重建起点画面,同时四步采样可实时输出704×1280视频。对做交互视频、游戏生成或具身模拟的团队来说,真正值得关注的不是更长窗口,而是把短期控制与长期记忆拆成不同的计算职责。

长期一致性不一定需要所有注意力头扫描完整历史固定缓存加位置地标库,让长时间交互的内存成本保持可控评估世界模型时,应同时检查动作响应、重访一致性与实时生成质量
语音RAG的F1跌幅扩大67%

也值得关注

05
持久化REPL、历史、记忆与技能,让长程Agent的改进对象从一次轨迹扩展到可累积的执行系统。 AgentPrime Agent提出开源RLM执行框架。链接
06
RAG索引扩容后总准确率可能不变,但同一问题的答案已悄然翻转,线上审计需要跟踪逐样本答案churn。 检索研究聚焦语料变化引发的答案波动。链接
07
长音频KV缓存不该一次淘汰终身丢弃,解码阶段按需恢复历史位置可能比静态压缩更稳健。 推理加速WnW为语音LLM引入可恢复的缓存机制。链接
08
把程序规则拆到步骤级评测,检验模型能否可靠执行外部给定的可复用规则,而不只是复述事实知识。 推理新基准关注规则执行过程中的具体失误。链接
09
偏好优化越成功,静态数学题集提供的有效信号反而越少;诊断后动态生成样本可把数据预算投向当前能力边界。 训练优化DIAG面向数学偏好蒸馏的数据效率问题。链接
10
让状态空间模型沿运动轨迹而非固定扫描顺序建模,为轻量视频插帧补上动态路径感知。 视频生成方法以线性复杂度捕获帧间长程依赖。链接
11
用熵信号指导裁剪并约束注意力,尝试在轻量VLM中保住跨裁剪边界的完整目标。 多模态ENCORE针对固定分块破坏目标完整性的问题。链接
12
多Agent辩论的瓶颈可能不是参与者数量,而是主持者能否识别冗余讨论、控制预算并及时停止。 AgentMeta-Moderator为辩论流程加入元认知调度。链接
13
东南亚文化视频基准把「知道含义、看得出来、找得到时刻」拆开,暴露文化推理与视觉定位之间的能力断层。 评测基准分别评估文化知识、视觉识别与时刻定位。链接
14
追踪LoRA微调时相关性注意模式在网络中的出现位置,为排序适配器的诊断和裁剪提供内部证据。 可解释性研究分析任务相关行为在网络中的形成过程。链接
15
把自我反思转成训练期信用分配信号,探索如何让稀疏终局奖励指导长程推理中的具体决策。 推理SRPO将反思机制用于长程推理后训练。链接

今日观察

Apodex把真实工作能力定义为持续且可验证的推进,Prime Agent把历史、记忆和技能跨轨迹保存,ReWorld则把短期控制与长期记忆分配给不同注意力通道。三者共同说明,长程系统真正稀缺的资源是状态的生命周期管理:哪些内容进入当前工作窗口,哪些信息需要持久化,失败后从哪个状态恢复,以及如何证明最终状态仍满足目标。延长任务步数无法单独回答这些问题,评测应拆成状态漂移、恢复点质量、旧信息召回和交付验证四类,并分别记录失败位置与恢复成本。下一轮测试可先为每类设计一个可重复用例,再将四项结果并列纳入发布门槛。