TurboVLA以0.9GB显存跑到32Hz

今日概览

  • TurboVLA在消费级显卡上实现实时控制,通过重构视觉、语言与动作的计算路径,以0.2B参数达到32Hz、0.9GB显存和97.7%的LIBERO平均成功率。
  • HumanCLAW将决策错误与执行失误拆账:9个先进模型均未通过1,218个长程任务,最好成功率仅16.8%,身体状态追踪成为突出短板。
  • OmegaUse-OfficeVal把经济价值纳入办公Agent评测。100项长流程任务显示,前沿模型虽比人工更快、更便宜,但交付质量仍明显落后。

重点关注

01 机器人|32Hz、不到1GB显存,VLA开始够得着实时部署了

在RTX4090上以32Hz运行、推理显存仅0.9GB,意味着高频机器人控制不必再默认依赖昂贵的服务器级硬件。TurboVLA没有继续压缩大语言模型,而是绕开传统的「视觉→语言模型→动作」路径:视觉与指令分别编码,通过轻量的双向交互融合,再由紧凑解码器直接预测连续动作片段。这个改动把模型缩至0.2B参数,单次推理延迟降到31.2毫秒,同时在LIBERO基准上取得97.7%的平均成功率,达到或超过更大的VLA策略。真正有意思的不是又一个速度纪录,而是它重新打开了架构选择:如果机器人只需要理解任务并及时行动,每次决策都经过大语言模型的表征空间或许并非必需。对机器人团队来说,这可能让更高频的闭环控制进入工作站甚至边缘设备的可行范围。不过,仅凭摘要还无法判断直接映射面对复杂指令、陌生场景和跨任务泛化时是否会付出代价,这需要看全文及更多真实机器人测试。

实时VLA可以通过重构计算路径实现,不必只盯着压缩大语言模型0.9GB显存和31.2毫秒延迟让消费级部署更接近可行评估这类轻量架构时,应重点验证复杂指令与分布外场景的泛化能力

02 评测|机器人摔倒了,究竟该怪大脑还是身体?

具身任务失败时,一个常见误判是:模型选对了路线,机器人却因失衡摔倒,最终仍被记成「决策失败」。HumanCLAW把这两笔账拆开,让视觉语言模型每次只下达一个原子技能指令,再由系统将其转成不到一秒的全身运动,并尽量排除平衡、扰动和电机误差。这样留下的主要是模型的动作判断能力:它是否知道身体在哪里、有没有到达目标、是否撞上障碍。结果并不乐观——9个先进模型都未通过包含1,218个长程任务的评测,最好成功率仅16.8%,而识别目标反倒不是主要瓶颈。对具身团队而言,这套框架更适合作为故障归因工具:先确认问题出在「想错了」还是「做坏了」,再决定该投入模型训练还是运动控制。

具身评测应将高层决策与低层执行拆账,避免优化错模块当前模型的短板更像身体状态追踪,而非目标识别排查导航与交互失败时,可优先审计到达判断、碰撞感知和自身位置估计

03 Agent|任务做得便宜,不等于值得部署

把人力时间、任务价格和模型调用成本放进同一套评测后,办公Agent的部署决策就从「完成率够不够高」变成了「交付质量是否配得上成本」。OmegaUse-OfficeVal收录100个源自从业者需求的长流程办公任务,人工平均需要2.32小时完成,并为每项任务配上人力耗时和价格代理指标,以便直接比较人工成本与模型推理成本。评测还用细粒度评分规则构建代码验证器,试图让复杂交付物的质量判断更稳定。结果显示,前沿模型虽然比人工更快、更便宜,但交付质量仍明显未达到人类水平,因此低调用成本暂时不能直接换算成可观的自动化回报。考虑到样本只有100项,这更适合作为一套新的评测坐标系,而不是办公自动化投资回报率的最终结论。

评估办公Agent时应把质量、人力时间和推理成本放进同一张账更快更便宜不代表已经能够替代人工交付可用这套经济评测框架筛选部署场景,但不宜据其样本规模外推整体回报率

也值得关注

04
扩散图像水印真正难落地的环节可能不是嵌入,而是失真后仍能快速、稳定地完成反演 安全对齐FARI用一步反演同时瞄准速度与鲁棒性。链接
05
模型答对空间判断不代表它真的看了图 多模态Visual Credit Audit量化图像相对无图上下文究竟贡献了多少决策证据。链接
06
开放式案例比封闭题目更接近AI自动研究的真实考验 Agent两项案例提供早期实证,也暴露出研究成果难以标准化评价的问题。链接
07
StructureGS把关节结构显式纳入高斯泼溅优化 AI for Science它试图避免几何、外观和运动参数纠缠,让可动对象重建更适合后续物理交互。链接
08
序列推荐未必只该读取LLM最后一层表示 检索IMFuse按实例融合多层语义,以适配不同物品与行为上下文所需的抽象层级。链接

今日观察

TurboVLA、HumanCLAW与OmegaUse-OfficeVal共同指向一套更接近部署现场的系统观:平均任务成功率正在失去单独决策的资格。机器人策略需要同时报告控制频率和显存,具身评测需要区分高层判断与低层执行,办公Agent还要把长流程成本折算成经济价值。实践团队可以把评估表直接拆成三列:「能力结果」记录成功率、质量和任务覆盖;「资源成本」记录延迟、显存、调用费用和人力时间;「失败归因」区分模型判断、控制执行与工具链故障。这样才能看清一次模型升级究竟创造了净收益,还是仅将开销或故障转移到系统的另一个环节。下一轮评测前,先为每个部署任务建立这张三列表格,并要求所有升级实验逐列报告变化。