今日概览
- 可执行代码成为视频生成控制面:VideoCoCo让Blender程序负责物理与时序推演,再由生成引擎完成视觉写实,将VBench-2.0得分从52.18提升至77.88。
- 视觉工具调用需要衡量净收益,Beacon学习判断何时调用工具以及调用后能否改善答案,以减少简单任务中的错误、延迟和额外成本。
- 多人编辑的高语义分可能掩盖结构错误。MPIE-Bench中常规视觉语言模型评分普遍超过0.95,但解剖与互动指标最高仅为0.65和0.72。
重点关注
01 视频生成 让可执行代码接管镜头里的时间
VideoCoCo把视频的时序控制交给可执行的Blender代码:编码智能体先把场景、物体运动和时间演化写成程序,再由模拟引擎运行出确定性的时空草稿。生成式视频引擎随后负责把草稿变成逼真画面,于是「过程怎么发生」和「画面怎么呈现」被拆给两个引擎处理。这个设计真正有意思的地方,是程序成为了视频生成的控制面——物理约束不再只是藏在提示词里的期待,而是可以检查、修改和重复执行的中间产物。根据摘要,VideoCoCo把OmniWeaving基线在PhyGenBench上的得分从0.475提升到0.558,在VBench-2.0上从52.18提升到77.88,并在两个基准的平均分上取得最佳结果。团队还构建了包含3000组「草稿—指令—目标视频」的VideoCoCo-3K,用来让视频编辑器适应模拟草稿。不过,代码能覆盖哪些复杂物理现象、生成效果多大程度依赖Blender脚本质量,以及方法能否处理难以显式编程的自然运动,都需要看全文和更多场景验证。对视频生成团队而言,这条路线值得关注:与其继续要求单个模型从一句文本里猜完整世界,不如先把可控、可审计的动态过程做成稳定接口。
原文:VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
02 多模态 会用工具还不够,关键是这次调用值不值
视觉推理Agent的下一步,不是继续堆叠工具,而是先判断调用能否带来净收益。Beacon从两个维度重新审视工具使用:模型是否只在必要时调用工具,以及调用后是否真的改善答案。作者的分析发现,现有模型往往缺少这种适应性——工具在难题上带来的收益,会被它在简单题上引入的错误抵消。Beacon通过强化学习,让模型按任务需要决定是否调用工具,并重点提升其处理真正困难问题的能力。相比单看工具调用率,这套框架更贴近部署时对延迟、成本和无效操作的权衡,但具体收益幅度仍需看全文与各基准结果确认。
原文:Beacon: Knowing When and How to Perform Agentic Visual Reasoning
03 评测 互动得分超过0.95,人体结构最高仅0.65
多人图像编辑出现了一个反直觉现象:视觉语言模型认为拥抱、背负等互动几乎完全正确,人类却能一眼看到肢体融合、凭空多出的手脚和身体穿插。MPIE-Bench收集了2500组样本,覆盖405个场景和14类互动,并用多人网格重建分别检查身体是否完整、接触几何是否符合指令。测试10个编辑模型时,常规视觉语言模型评分普遍超过0.95,但更贴近物理结构的解剖与互动指标最高只有0.65和0.72,而且没有一个模型能同时做好两项。五人评审也显示,这两项新指标比零样本视觉语言模型更接近人类判断——对准备把多人编辑用于产品的团队来说,语义对了已不够,身体是否真的「站得住」才是下一道门槛。
原文:MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing
也值得关注
今日观察
VideoCoCo把视频演化交给可执行代码,Beacon学习何时启用视觉工具,ShadowDancer用演示及其影子承载逐帧动作,Qwen-UI-Agent则在GUI与CLI之间分配执行路径。四项工作的共同点不在于增加了多少工具或模态,而在于把执行路径的选择权变成系统设计的一部分:何时调用、调用什么、中间状态是什么,以及结果不可靠时如何回退,都需要明确且可检查。外围能力越多,缺少控制面带来的代价就越明显——无效调用会增加延迟和成本,隐式状态会削弱可调试性,错误路径则可能让端到端行为变得不可预测。实践中,每新增一项工具或模态,都应同步写出调用条件、可观测中间状态、成功判据和失败回退,并将它们纳入测试用例。