VideoCoCo将VBench提至77.88

今日概览

  • 可执行代码成为视频生成控制面:VideoCoCo让Blender程序负责物理与时序推演,再由生成引擎完成视觉写实,将VBench-2.0得分从52.18提升至77.88。
  • 视觉工具调用需要衡量净收益,Beacon学习判断何时调用工具以及调用后能否改善答案,以减少简单任务中的错误、延迟和额外成本。
  • 多人编辑的高语义分可能掩盖结构错误。MPIE-Bench中常规视觉语言模型评分普遍超过0.95,但解剖与互动指标最高仅为0.65和0.72。

重点关注

01 视频生成 让可执行代码接管镜头里的时间

VideoCoCo把视频的时序控制交给可执行的Blender代码:编码智能体先把场景、物体运动和时间演化写成程序,再由模拟引擎运行出确定性的时空草稿。生成式视频引擎随后负责把草稿变成逼真画面,于是「过程怎么发生」和「画面怎么呈现」被拆给两个引擎处理。这个设计真正有意思的地方,是程序成为了视频生成的控制面——物理约束不再只是藏在提示词里的期待,而是可以检查、修改和重复执行的中间产物。根据摘要,VideoCoCo把OmniWeaving基线在PhyGenBench上的得分从0.475提升到0.558,在VBench-2.0上从52.18提升到77.88,并在两个基准的平均分上取得最佳结果。团队还构建了包含3000组「草稿—指令—目标视频」的VideoCoCo-3K,用来让视频编辑器适应模拟草稿。不过,代码能覆盖哪些复杂物理现象、生成效果多大程度依赖Blender脚本质量,以及方法能否处理难以显式编程的自然运动,都需要看全文和更多场景验证。对视频生成团队而言,这条路线值得关注:与其继续要求单个模型从一句文本里猜完整世界,不如先把可控、可审计的动态过程做成稳定接口。

可执行程序可以把视频中的物理与时序约束变成可检查、可修改的控制层双引擎分工让过程推演与视觉写实各自优化,适合需要稳定镜头运动的产品采用这一路线前应重点评估脚本生成的可靠性,以及目标场景是否能被程序充分描述

02 多模态 会用工具还不够,关键是这次调用值不值

视觉推理Agent的下一步,不是继续堆叠工具,而是先判断调用能否带来净收益。Beacon从两个维度重新审视工具使用:模型是否只在必要时调用工具,以及调用后是否真的改善答案。作者的分析发现,现有模型往往缺少这种适应性——工具在难题上带来的收益,会被它在简单题上引入的错误抵消。Beacon通过强化学习,让模型按任务需要决定是否调用工具,并重点提升其处理真正困难问题的能力。相比单看工具调用率,这套框架更贴近部署时对延迟、成本和无效操作的权衡,但具体收益幅度仍需看全文与各基准结果确认。

评估视觉Agent时应关注工具调用的净收益,而非调用次数简单任务上的误调用可能抵消难题收益部署团队可用「是否必要、是否改善结果」同时约束成本与质量

03 评测 互动得分超过0.95,人体结构最高仅0.65

多人图像编辑出现了一个反直觉现象:视觉语言模型认为拥抱、背负等互动几乎完全正确,人类却能一眼看到肢体融合、凭空多出的手脚和身体穿插。MPIE-Bench收集了2500组样本,覆盖405个场景和14类互动,并用多人网格重建分别检查身体是否完整、接触几何是否符合指令。测试10个编辑模型时,常规视觉语言模型评分普遍超过0.95,但更贴近物理结构的解剖与互动指标最高只有0.65和0.72,而且没有一个模型能同时做好两项。五人评审也显示,这两项新指标比零样本视觉语言模型更接近人类判断——对准备把多人编辑用于产品的团队来说,语义对了已不够,身体是否真的「站得住」才是下一道门槛。

多人编辑不能只看互动语义,解剖完整性和接触几何应成为独立验收项视觉语言模型评分超过0.95仍可能掩盖明显的人体结构错误选型时应分别比较解剖与互动表现,单一综合高分不足以证明产品可用

也值得关注

04
69亿参数、3000亿token的参数化长期记忆,目标是让记忆容量独立扩容 模型架构Memory Decoder关注检索成本失控时的替代路径。链接
05
视频描述还要把短语准确绑定到多个参考图像 多模态RefCaptioner为跨素材视频理解补充细粒度溯源能力。链接
06
角色扮演评测开始模拟具体用户,而非续写固定历史 评测这让同一个Agent面对不同人的体验差异进入评估范围。链接
07
演示视频及其影子可以承载跨动作类型的统一动态表示 视频生成ShadowDancer尝试为世界模型提供逐帧精确控制接口。链接
08
开放词汇地球观测不能只扩充类别表 AI for ScienceOVEarth-Bench还覆盖否定表达、指代表达和推理式查询。链接
09
Qwen-UI-Agent在同一路线图中整合跨平台GUI、CLI协同和长程任务 Agent真正的观察重点是其在真实设备上的端到端可靠性。链接
10
不同特征子空间未必应该以同一分布读取层间历史 模型架构多头残差允许模型按子空间选择不同深度的信息。链接
11
MoE共同路由的专家未必依靠几何互补取胜 可解释性这项工作区分路由一致性、候选质量与上下文各自的作用。链接

今日观察

VideoCoCo把视频演化交给可执行代码,Beacon学习何时启用视觉工具,ShadowDancer用演示及其影子承载逐帧动作,Qwen-UI-Agent则在GUI与CLI之间分配执行路径。四项工作的共同点不在于增加了多少工具或模态,而在于把执行路径的选择权变成系统设计的一部分:何时调用、调用什么、中间状态是什么,以及结果不可靠时如何回退,都需要明确且可检查。外围能力越多,缺少控制面带来的代价就越明显——无效调用会增加延迟和成本,隐式状态会削弱可调试性,错误路径则可能让端到端行为变得不可预测。实践中,每新增一项工具或模态,都应同步写出调用条件、可观测中间状态、成功判据和失败回退,并将它们纳入测试用例。