今日概览
- TurboVLA在消费级显卡上实现实时控制,通过重构视觉、语言与动作的计算路径,以0.2B参数达到32Hz、0.9GB显存和97.7%的LIBERO平均成功率。
- HumanCLAW将决策错误与执行失误拆账:9个先进模型均未通过1,218个长程任务,最好成功率仅16.8%,身体状态追踪成为突出短板。
- OmegaUse-OfficeVal把经济价值纳入办公Agent评测。100项长流程任务显示,前沿模型虽比人工更快、更便宜,但交付质量仍明显落后。
重点关注
01 机器人|32Hz、不到1GB显存,VLA开始够得着实时部署了
在RTX4090上以32Hz运行、推理显存仅0.9GB,意味着高频机器人控制不必再默认依赖昂贵的服务器级硬件。TurboVLA没有继续压缩大语言模型,而是绕开传统的「视觉→语言模型→动作」路径:视觉与指令分别编码,通过轻量的双向交互融合,再由紧凑解码器直接预测连续动作片段。这个改动把模型缩至0.2B参数,单次推理延迟降到31.2毫秒,同时在LIBERO基准上取得97.7%的平均成功率,达到或超过更大的VLA策略。真正有意思的不是又一个速度纪录,而是它重新打开了架构选择:如果机器人只需要理解任务并及时行动,每次决策都经过大语言模型的表征空间或许并非必需。对机器人团队来说,这可能让更高频的闭环控制进入工作站甚至边缘设备的可行范围。不过,仅凭摘要还无法判断直接映射面对复杂指令、陌生场景和跨任务泛化时是否会付出代价,这需要看全文及更多真实机器人测试。
原文:TurboVLA: Real-Time Vision-Language-Action Model at 32Hz on an RTX4090 with <1GB VRAM
02 评测|机器人摔倒了,究竟该怪大脑还是身体?
具身任务失败时,一个常见误判是:模型选对了路线,机器人却因失衡摔倒,最终仍被记成「决策失败」。HumanCLAW把这两笔账拆开,让视觉语言模型每次只下达一个原子技能指令,再由系统将其转成不到一秒的全身运动,并尽量排除平衡、扰动和电机误差。这样留下的主要是模型的动作判断能力:它是否知道身体在哪里、有没有到达目标、是否撞上障碍。结果并不乐观——9个先进模型都未通过包含1,218个长程任务的评测,最好成功率仅16.8%,而识别目标反倒不是主要瓶颈。对具身团队而言,这套框架更适合作为故障归因工具:先确认问题出在「想错了」还是「做坏了」,再决定该投入模型训练还是运动控制。
原文:HumanCLAW: Can Vision-Language Models Act Through a Body?
03 Agent|任务做得便宜,不等于值得部署
把人力时间、任务价格和模型调用成本放进同一套评测后,办公Agent的部署决策就从「完成率够不够高」变成了「交付质量是否配得上成本」。OmegaUse-OfficeVal收录100个源自从业者需求的长流程办公任务,人工平均需要2.32小时完成,并为每项任务配上人力耗时和价格代理指标,以便直接比较人工成本与模型推理成本。评测还用细粒度评分规则构建代码验证器,试图让复杂交付物的质量判断更稳定。结果显示,前沿模型虽然比人工更快、更便宜,但交付质量仍明显未达到人类水平,因此低调用成本暂时不能直接换算成可观的自动化回报。考虑到样本只有100项,这更适合作为一套新的评测坐标系,而不是办公自动化投资回报率的最终结论。
也值得关注
今日观察
TurboVLA、HumanCLAW与OmegaUse-OfficeVal共同指向一套更接近部署现场的系统观:平均任务成功率正在失去单独决策的资格。机器人策略需要同时报告控制频率和显存,具身评测需要区分高层判断与低层执行,办公Agent还要把长流程成本折算成经济价值。实践团队可以把评估表直接拆成三列:「能力结果」记录成功率、质量和任务覆盖;「资源成本」记录延迟、显存、调用费用和人力时间;「失败归因」区分模型判断、控制执行与工具链故障。这样才能看清一次模型升级究竟创造了净收益,还是仅将开销或故障转移到系统的另一个环节。下一轮评测前,先为每个部署任务建立这张三列表格,并要求所有升级实验逐列报告变化。