今日概览
- 控制流与提示词分离,让协议有效性达到100%:多Agent系统可持续优化内容,同时保护路由、格式和终止信号不被意外改写。
- 语言正在成为视频世界的控制层,H3-World仅训练0.199%的参数,便实现角色动作、镜头运动与时间区间的联合控制。
- 无人机飞进目标范围仍可能任务失败。DroneCATS表明,终止判断、协议遵循和多视角决策同样决定自主系统是否可靠。
- 会扮演学生不等于准确模拟学生:StudentSim将行为保真度与指导响应度分开评估,揭示角色感和能力校准之间的差距。
- 计算匹配后,循环层仍节省6.8%—18.0%的训练计算量,SMELT为共享中间层与稀疏专家提供了更公平的验证依据。
重点关注
01 Agent提示词越优化,系统反而越容易崩?
优化器只是想让Agent写得更好,却可能顺手改掉消息路由、输出格式或终止信号,让依赖这些约定的整条流水线直接失效。这篇工作的关键不是发明另一种提示词搜索算法,而是把多Agent提示词重新视为程序:执行协议变成带类型、可验证的控制对象,真正需要优化的自然语言则留在数据流中。具体来说,优化器接触的是生成任务内容的数据流;路由目标、字段结构和终止条件则被封装为程序对象,在进入执行环节前接受类型与有效性校验。这样不仅能防止某个字段被改坏,也把「内容是否变好」和「接口能否继续执行」拆成两个独立的验收维度:前者可以持续搜索,后者不再随候选提示词漂移。由此,内容可以持续迭代,代码依赖的接口却不会随着提示词变化。在合成推理、协作式评论生成和保险评级流程中,这套分层设计最终都实现了100%的协议有效性,同时持续改善任务表现。现有证据首先覆盖这三类工作流;对于运行时新增分支、动态模型选择、工具异常和跨服务状态恢复等生产边界,摘要并未给出验证。落地时可以把任务指标与协议有效性并列检查,并为路由、格式和终止信号分别设置校验项;这是依据论文机制推导的工程检查方法,而非摘要已经测试的额外结论。对正在搭建多Agent系统的团队来说,值得立刻采用的思路是:先把控制契约从提示词里剥离,再谈自动优化。
原文:Control-Data Flow Separation: Stable Prompt Optimization in Multi-Agent LLMs
02 视频生成:会听指令的视频生成器,正在变成世界运行时
视频生成器不再只负责吐出一段成片,它开始像游戏引擎一样,在运行过程中接受控制。H3-World把角色动作和镜头运动组合成结构化语言指令,再与对应时段的视频隐变量对齐;其时间注意力路由会限制每条指令的生效区间,减少前后动作互相「串台」。更有意思的是,它没有另造一套动作模块,而是直接复用33B视频模型预训练得到的语义表示,仅用8000条游戏样本、1万步LoRA训练和0.199%的可训练参数完成适配。语言因此可能成为视频生成器的通用控制层,让一次性内容工具转向可交互的世界运行时。先别把它等同于可靠的物理模拟:能按指令操纵角色与镜头,只证明控制接口正在成熟,物体交互、长期一致性和因果规律仍需看全文及更多测试确认。
原文:H3-World: Turning Language Understanding into World Control
03 机器人:无人机飞得对,却可能败在一句「我到了」
把通用多模态大模型直接放进无人机控制回路,考验的不只是看懂画面,而是感知、决策与连续行动能否真正闭环。DroneCATS允许替换不同模型,并用接近目标、跟踪、视野外搜索和多机指挥四类任务测试其自主行动能力,全程无需微调或函数调用接口。摘要披露了一个值得警惕的现象:小型开源模型有时比前沿模型更容易飞进成功范围,却会因过早宣布抵达或始终不结束任务而失败;到了多机任务,它们还可能无视不同视角,机械复制同一坐标。这说明空间感知尚可并不等于系统可靠,持续遵守行动协议、正确判断终止时机同样决定成败。对机器人团队来说,这类统一基准更适合用来划定模型的自主权限和人工接管条件,而不是仅凭排行榜或演示效果选型。
04 评测:会演学生,不等于真的像学生
一个模型把「学生腔」演得惟妙惟肖,反而可能制造教育实验里最危险的假象:它会顺着辅导解释,却未必按特定学生的能力边界犯错、纠正和进步。StudentSim没有继续堆角色提示,而是先汇总多名学生的数据训练,再用个人数据专门化,并分别评估「回答是否像本人」和「接受指导后是否合理更新」。摘要显示,在国际象棋任务中,它的行为保真度和指导响应度分别达到0.51和0.91,对比GPT-5.4的0.23和0.72、Maia2的0.45和0.27,说明角色感、能力校准与学习反应确实不是一回事。更有意思的是,以这个模拟器作为奖励模型训练出的棋类导师,获得了专家更高的准确性、指导质量和个性化评价,初步证明更可信的「代理学生」可能改善真实教学策略。只是评测目前覆盖60名学生和三个领域,产品团队在用它替代真人实验前,仍需看全文确认跨人群泛化、长期学习轨迹以及模拟偏差是否会被强化学习进一步放大。
原文:StudentSim: Training LLM-based Student Simulators
05 模型架构:循环层变强,究竟是架构优势还是偷偷多算了?
循环层让同一组参数反复处理信息,但过去不少实验固定的是模型大小,额外计算量带来的收益很难与架构本身分开。SMELT同时对齐了每个token的计算量、非嵌入参数规模和KV缓存,只让中间一半层运行两次,并结合稀疏专家来控制预算。在四个规模、最高540亿参数的实验中,它在计算最优曲线上节省了6.8%—18.0%的训练计算量,优势在代码任务、长样本和更多上下文示例下尤其明显。作者还观察到,第二次经过共享层时,注意力会减少对固定位置的过度集中,转向与内容更相关的token,不过这是否构成普遍机制仍需看全文和更多模型验证。对训练大模型的团队而言,这项工作的价值不是宣告循环层取代标准Transformer,而是提供了一套预算公平、可以复现实测的架构配方。
原文:SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

也值得关注
今日观察
H3-World把结构化的角色与镜头指令对齐到对应时段,并通过时间注意力路由限制每条指令的生效区间;DroneCATS则暴露了无人机控制回路中的协议遵循与终止判断故障;控制—数据流分离进一步提供了带类型、可验证的控制对象,用来保护路由和格式接口免受提示词漂移。三项工作分别从时间控制、行动闭环和执行协议层面说明,自然语言一旦进入执行回路,就不能继续被当作任意改写的无结构文本。这样既能保留自然语言的表达弹性,也能限制错误指令的影响范围。据此可进一步推导的工程建议是:团队分别建立动作权限清单、协议校验器和失败回退路径,并在上线前用异常输入逐项验证这些边界。