VLM数小时控机器人,世界状态准确率98%

今日概览

  • 语义动作接口释放现成VLM的机器人控制能力,闭源模型可直接零样本控制,小型开源模型只需数个GPU小时微调,并能通过确定性适配跨本体复用。
  • 反向蒸馏绕开教师能力上限:学生在自身分布上探索,仅放大获得验证器支持的教师调整方向,以更少更新完成模型升级和多教师整合。
  • 线性注意力开始显式估计旧记忆的可信度。 Kalman Delta Networks用卡尔曼增益调节写入,在750M和1.3B参数实验中改善困惑度与下游准确率。
  • 程序状态为交互式世界补上可检查的逻辑内核;规则演化与视频渲染分离后,CombatStateBench计数准确率达到94%、状态准确率达到98%。

重点关注

01 机器人 机器人控制的瓶颈,可能不在模型而在接口

把通用视觉语言模型接上机器人,不一定要再训练一个庞大的端到端系统。Show-Harness设计了一层紧凑的语义动作接口:模型负责选择细粒度动作,适配不同本体的解释器再把它们确定性地转换为本地控制指令。这个分工既保留了模型的决策能力,也把执行差异隔离在接口之后,让同一套模型更容易跨任务、机器人和环境复用。按摘要披露的结果,闭源前沿模型可以直接用于零样本控制,小型开源模型则只需数个GPU小时微调即可部署,并优于论文选取的智能体和视觉—语言—动作基线。团队还用GUI操控界面复用了同一语义空间,使人类和智能体无需专用遥操作硬件也能收集演示。具体任务难度、硬件覆盖范围和安全边界仍需看全文确认,但对机器人团队而言,这条路线最有吸引力的地方已经很明确:先把接口做对,可能比继续堆模型容量更快释放现成VLM的能力。

评估机器人方案时,应把语义动作接口与模型能力分开考察多本体部署可优先采用「统一决策、确定性适配」的工程架构小团队可以先验证现成VLM加轻量微调,不必默认承担端到端预训练成本

02 训练优化 把教师当方向而非答案,蒸馏就没有能力天花板?

传统蒸馏让学生逼近教师的输出,教师因此既是向导,也是能力上限。OPRD换了个思路:让学生在自己的分布上探索,再判断教师相对其基准策略会往哪个方向调整,只放大其中得到验证器支持的学习信号。这样,教师提供的是加速方向,而不是要求学生复制答案,因此不会改变学生自身优化的终点。实验中,无论是模型代际迁移还是多教师整合,OPRD都用更少的学生更新取得了比现有强化学习和蒸馏方法更高的表现。对需要持续升级模型的团队来说,这意味着昂贵的完整后训练或许能被更可复用的增量过程替代。

蒸馏时应把弱教师视为优化方向,而非学生必须逼近的目标教师建议只有获得验证器支持才被放大,可降低错误能力边界被继承的风险做模型代际升级或多领域整合时,值得评估OPRD能否减少重复后训练成本

03 模型架构 线性注意力该覆盖哪段旧记忆,不能只看当前输入

线性注意力用固定大小的状态换取恒定内存解码,但每次写入都必须提前决定覆盖强度,而常见的Delta更新并不会记录旧记忆究竟有多可信。Kalman Delta Networks把关联记忆改写成线性高斯状态空间模型,同时维护记忆及其不确定性,再用卡尔曼增益根据累积证据和当前观测可靠性调整写入。完整计算需要代价高昂的动态协方差递推,因此作者又提出对角和各向同性两种近似,其中后者每个注意力头只增加一个不确定性标量,并可继续使用并行扫描。摘要称,这些变体在750M和1.3B参数的受控预训练中,困惑度和下游平均准确率均优于当前先进的线性注意力模型,但具体提升幅度仍需看全文确认。对长上下文架构团队而言,这项工作的价值不只是扩大记忆,而是提供一种更有依据的遗忘与覆盖机制。

评估线性注意力时,应同时关注记忆容量和写入置信度各向同性近似可能是在不确定性感知与并行效率之间更实用的折中是否值得替换现有Delta更新,仍要结合具体增幅和额外计算成本判断

04 视频生成 让视频模型少管一点,世界反而更真实吗?

没想到,让交互式世界长期守规则的办法,可能是把「世界运行」从视频模型手里拿走。这个框架先将自然语言指令翻译成可执行程序,由轻量引擎维护角色状态、交互规则,以及画面之外的实体和不可见属性;视频模型只负责把明确的世界状态渲染成画面。状态再通过带属性的3D定向包围盒和相机轨迹,被编译成像素对齐的时空控制信号,从而把可检查、可修改的逻辑内核接到生成模型上。摘要报告其在CombatStateBench上达到94%的计数准确率和98%的状态准确率,明显超过现有交互式视频世界模型,不过具体对手、交互时长和视觉质量仍需看全文确认。对游戏和模拟产品而言,这条路线的价值不只是画面更连贯,而是规则错误终于可以在程序层定位和修正。

长期一致性未必该继续押注模型的隐式记忆显式状态引擎让规则、实体和画面外信息都可检查可修改评估此类系统时应把规则正确性与视觉质量分开看
VLM数小时控机器人,世界状态准确率98%

也值得关注

05
参数化生成打底,Agent迭代修正布局。 机器人SceneMosaic探索如何同时兼顾仿真场景生成的速度、多样性与可用性。链接
06
为视觉生成系统划定「Agent化」边界。 图像生成这份分类地图覆盖规划、工具调用、中间结果检查与返工等能力。链接
07
视频预训练数据配方被拆成可执行的五阶段开放流程。 视频生成VidaForge让数据选择对模型能力的影响可以单独复现和比较。链接
08
法线估计误差可能源于VAE压缩与边缘重建。 图像生成几何生成团队可据此先审计表示瓶颈,再调整扩散主干。链接
09
空间网格让多个镜头进入同一次联合建模。 视频生成这种后训练结构旨在兼顾镜头内运动与跨镜头叙事一致性。链接
10
草稿模型可随长上下文RL rollout在线共同训练。 推理加速方案同时处理上下文并行与流水线并行带来的系统障碍。链接
11
低比特注意力继续清理softmax的剩余延迟。 推理加速EFQ-Softmax将高精度指数计算和中间概率块移出关键路径。链接
12
长期助手不仅要记住用户,还要把记忆用于正确建议。 评测PRAGMA评估系统能否检索跨对话证据,并将其正确用于当前个性化指导。链接
13
结果级标签缺少保留多条成功分支的监督。 训练优化DDO通过状态对齐的分支集合与相对目标,提升成功策略覆盖度。链接
14
跨设备状态传递进入GUI Agent评测。 AgentJarvisGUI加入动态任务组合,以暴露单设备基准难以发现的协同故障。链接

今日观察

Show-Harness、Programmable World Model和Kalman Delta Networks正在把模型外围的中间表示提升为核心设计对象:离散语义动作隔开决策意图与本体控制,程序状态隔开规则演化与画面生成,显式置信度则让关联记忆知道旧内容是否值得覆盖。共同信号是,系统能否长期稳定控制并在出错后有效纠正,越来越取决于模型边界处有没有可记录、可检查、可约束的状态;如果动作、记忆或世界规则始终只隐含在向量或像素中,错误便更难定位,历史决策也难以回放和修正。团队本周可列出当前系统中的动作、记忆与世界状态,标记仍仅隐含存在的部分,并优先为一个高故障成本环节补上可记录、校验和回放的显式表示。