控制协议达100%,循环层省18%计算

今日概览

  • 控制流与提示词分离,让协议有效性达到100%:多Agent系统可持续优化内容,同时保护路由、格式和终止信号不被意外改写。
  • 语言正在成为视频世界的控制层,H3-World仅训练0.199%的参数,便实现角色动作、镜头运动与时间区间的联合控制。
  • 无人机飞进目标范围仍可能任务失败。DroneCATS表明,终止判断、协议遵循和多视角决策同样决定自主系统是否可靠。
  • 会扮演学生不等于准确模拟学生:StudentSim将行为保真度与指导响应度分开评估,揭示角色感和能力校准之间的差距。
  • 计算匹配后,循环层仍节省6.8%—18.0%的训练计算量,SMELT为共享中间层与稀疏专家提供了更公平的验证依据。

重点关注

01 Agent提示词越优化,系统反而越容易崩?

优化器只是想让Agent写得更好,却可能顺手改掉消息路由、输出格式或终止信号,让依赖这些约定的整条流水线直接失效。这篇工作的关键不是发明另一种提示词搜索算法,而是把多Agent提示词重新视为程序:执行协议变成带类型、可验证的控制对象,真正需要优化的自然语言则留在数据流中。具体来说,优化器接触的是生成任务内容的数据流;路由目标、字段结构和终止条件则被封装为程序对象,在进入执行环节前接受类型与有效性校验。这样不仅能防止某个字段被改坏,也把「内容是否变好」和「接口能否继续执行」拆成两个独立的验收维度:前者可以持续搜索,后者不再随候选提示词漂移。由此,内容可以持续迭代,代码依赖的接口却不会随着提示词变化。在合成推理、协作式评论生成和保险评级流程中,这套分层设计最终都实现了100%的协议有效性,同时持续改善任务表现。现有证据首先覆盖这三类工作流;对于运行时新增分支、动态模型选择、工具异常和跨服务状态恢复等生产边界,摘要并未给出验证。落地时可以把任务指标与协议有效性并列检查,并为路由、格式和终止信号分别设置校验项;这是依据论文机制推导的工程检查方法,而非摘要已经测试的额外结论。对正在搭建多Agent系统的团队来说,值得立刻采用的思路是:先把控制契约从提示词里剥离,再谈自动优化。

不要让提示词优化器接触路由、格式和终止信号等执行契约用带类型、可验证的程序对象承载控制流,可显著降低优化导致的系统故障评估Agent优化方案时,应同时检查任务效果与协议有效性

02 视频生成:会听指令的视频生成器,正在变成世界运行时

视频生成器不再只负责吐出一段成片,它开始像游戏引擎一样,在运行过程中接受控制。H3-World把角色动作和镜头运动组合成结构化语言指令,再与对应时段的视频隐变量对齐;其时间注意力路由会限制每条指令的生效区间,减少前后动作互相「串台」。更有意思的是,它没有另造一套动作模块,而是直接复用33B视频模型预训练得到的语义表示,仅用8000条游戏样本、1万步LoRA训练和0.199%的可训练参数完成适配。语言因此可能成为视频生成器的通用控制层,让一次性内容工具转向可交互的世界运行时。先别把它等同于可靠的物理模拟:能按指令操纵角色与镜头,只证明控制接口正在成熟,物体交互、长期一致性和因果规律仍需看全文及更多测试确认。

做交互视频的团队可以优先验证语言控制层,而非从零开发专用动作模块时间对齐是从「听懂指令」跨到连续可控体验的关键工程环节评估这类系统时要把角色与镜头可控性同物理可靠性分开

03 机器人:无人机飞得对,却可能败在一句「我到了」

把通用多模态大模型直接放进无人机控制回路,考验的不只是看懂画面,而是感知、决策与连续行动能否真正闭环。DroneCATS允许替换不同模型,并用接近目标、跟踪、视野外搜索和多机指挥四类任务测试其自主行动能力,全程无需微调或函数调用接口。摘要披露了一个值得警惕的现象:小型开源模型有时比前沿模型更容易飞进成功范围,却会因过早宣布抵达或始终不结束任务而失败;到了多机任务,它们还可能无视不同视角,机械复制同一坐标。这说明空间感知尚可并不等于系统可靠,持续遵守行动协议、正确判断终止时机同样决定成败。对机器人团队来说,这类统一基准更适合用来划定模型的自主权限和人工接管条件,而不是仅凭排行榜或演示效果选型。

评估无人机智能体时,应把终止判断和协议遵循纳入核心指标小模型能完成导航不代表具备端侧自主部署条件统一可替换模型的基准可用于确定自主权限与人工接管边界

04 评测:会演学生,不等于真的像学生

一个模型把「学生腔」演得惟妙惟肖,反而可能制造教育实验里最危险的假象:它会顺着辅导解释,却未必按特定学生的能力边界犯错、纠正和进步。StudentSim没有继续堆角色提示,而是先汇总多名学生的数据训练,再用个人数据专门化,并分别评估「回答是否像本人」和「接受指导后是否合理更新」。摘要显示,在国际象棋任务中,它的行为保真度和指导响应度分别达到0.51和0.91,对比GPT-5.4的0.23和0.72、Maia2的0.45和0.27,说明角色感、能力校准与学习反应确实不是一回事。更有意思的是,以这个模拟器作为奖励模型训练出的棋类导师,获得了专家更高的准确性、指导质量和个性化评价,初步证明更可信的「代理学生」可能改善真实教学策略。只是评测目前覆盖60名学生和三个领域,产品团队在用它替代真人实验前,仍需看全文确认跨人群泛化、长期学习轨迹以及模拟偏差是否会被强化学习进一步放大。

评估学生模拟器时,先测能力与错误分布是否校准,别被流畅的角色扮演迷惑把行为保真度和指导响应度拆开看,避免选出「像学生但不会学」或「会更新但不像本人」的模型模拟学生适合先筛选教学策略,但现阶段不应直接替代真人验证

05 模型架构:循环层变强,究竟是架构优势还是偷偷多算了?

循环层让同一组参数反复处理信息,但过去不少实验固定的是模型大小,额外计算量带来的收益很难与架构本身分开。SMELT同时对齐了每个token的计算量、非嵌入参数规模和KV缓存,只让中间一半层运行两次,并结合稀疏专家来控制预算。在四个规模、最高540亿参数的实验中,它在计算最优曲线上节省了6.8%—18.0%的训练计算量,优势在代码任务、长样本和更多上下文示例下尤其明显。作者还观察到,第二次经过共享层时,注意力会减少对固定位置的过度集中,转向与内容更相关的token,不过这是否构成普遍机制仍需看全文和更多模型验证。对训练大模型的团队而言,这项工作的价值不是宣告循环层取代标准Transformer,而是提供了一套预算公平、可以复现实测的架构配方。

评估循环层时应同时匹配计算量、参数规模和KV缓存共享中间层两次可在计算最优训练中节省6.8%—18.0%的FLOPs代码、长文本和多示例提示是最值得优先验证的应用场景
控制协议达100%,循环层省18%计算

也值得关注

06
与其检索互不相连的帧、字幕和摘要,不如把跨模态证据预先绑定成可直接用于生成与归因的事件记忆。 多模态EM²Mem以事件为中心组织长视频的多模态记忆。链接
07
统一理解与生成不代表两种目标天然互助,这项受控研究从表征、任务到系统层面拆解协同与容量竞争。 多模态研究聚焦原生统一多模态模型中的协同条件与资源冲突。链接
08
一次防护测试成功不等于部署更安全,真正该估算的是会持续适应的攻击者最终还能获得多少有害帮助。 安全对齐论文重新审视拒绝率、攻击成功率等静态防护指标。链接
09
让编码Agent跨越多天持续规划、实现和测试,关键变量从单次任务成功率转向改进循环能否长期积累而不退化。 代码智能Harness-of-Harness研究持续改进驱动的多日自主软件开发。链接
10
SAR到光学图像转换不应把潜空间编解码器当作固定前提,跨模态信息的往返保真度本身就是核心设计变量。 图像生成ReFlowSET通过表征对齐改进SAR到EO图像转换。链接
11
长期Agent若要更换模型、框架和服务器仍保持连续性,就需要把身份、记忆与代码从当前运行时中解耦。 Agent论文提出独立于运行时的持久化Agent边界。链接
12
文化微调可能提高平均对齐分,却把文化内部真实存在的差异压平,评估需要同时衡量契合度与多样性。 安全对齐研究分析文化对齐与内部多样性之间的权衡。链接
13
短剧生成不能只评最后一段视频,脚本、分镜、关键帧到镜头合成的误差如何逐级传播才更贴近生产。 视频生成DramaChain Bench覆盖短剧生成的完整生产链路。链接

今日观察

H3-World把结构化的角色与镜头指令对齐到对应时段,并通过时间注意力路由限制每条指令的生效区间;DroneCATS则暴露了无人机控制回路中的协议遵循与终止判断故障;控制—数据流分离进一步提供了带类型、可验证的控制对象,用来保护路由和格式接口免受提示词漂移。三项工作分别从时间控制、行动闭环和执行协议层面说明,自然语言一旦进入执行回路,就不能继续被当作任意改写的无结构文本。这样既能保留自然语言的表达弹性,也能限制错误指令的影响范围。据此可进一步推导的工程建议是:团队分别建立动作权限清单、协议校验器和失败回退路径,并在上线前用异常输入逐项验证这些边界。