128个token保住94.7%性能

今日概览

  • 3DZip把场景压至128个token仍保留94.7%性能,通过特征多样性与空间约束减少三维场景冗余,并将推理速度提升至1.92倍。
  • 临床多模态评测必须识别「静默失败」:逐样本、逐模态分析显示,模态缺失不仅降低准确率,还可能让错误预测显得更加可靠。
  • 频繁重规划会让恢复机制成为瓶颈。BRACE与E-RECAP按决策价值分配预算、裁剪上下文,单次重规划token数减少62%至92%。

重点关注

01 推理加速 数千个空间token,正在拖住3D模型

一个三维场景投影后会迅速膨胀出数千个空间token,计算和显存压力甚至可能比模型规模更先卡住部署。二维视觉语言模型常按语义相关性或注意力筛选token,但三维问答还依赖物体之间的距离、方位和几何关系,直接照搬容易把空间线索一并删掉;只合并位置相近的token也不够,因为不同物体的token数量仍可能严重失衡。3DZip用三步处理这个问题:先通过粗粒度体素化去掉点级重复,再用行列式点过程从特征空间中挑选差异足够大的锚点,最后在空间约束下合并其余token,让压缩后的表示既覆盖多样物体,又尽量保持几何连贯。这个组合很巧妙,因为它没有把「重要性」简单等同于注意力分数,而是同时考虑特征多样性与三维结构。从摘要披露的三个3D问答基准看,输入压到128个token后仍保留原模型94.7%的性能,同时将推理速度提升到1.92倍。对准备把三维视觉语言能力放进机器人、空间计算或数字孪生系统的团队来说,这意味着优化重点可以从单纯缩小模型,前移到压缩场景表示本身。不过,这些收益在更复杂场景、不同模型架构和真实硬件上的稳定性仍需看全文与更多测试确认。

部署3D视觉语言模型时,应优先检查场景token数量,而不只盯着参数规模二维模型的注意力筛选不能直接照搬,压缩策略必须显式保护空间关系128个token保留94.7%性能并实现1.92倍加速,值得作为三维问答系统的效率基线。

02 评测 准确率下降不可怕,模型错得很自信才麻烦

静默失败的部署风险在于:超声等模态缺失后,模型不仅可能答错,还可能远离决策边界,让现有监控误以为结果可靠。这套框架不只计算删掉某个模态后损失多少准确率,而是逐样本区分可被监控捕捉的「响亮失败」和不易察觉的「静默失败」,再用模态互补矩阵追溯错误来自哪里。相比常规消融实验只给出总体均值、SHAP等事后归因解释单次预测,它补上了「哪个模态缺失导致了哪些错误,以及这些错误能否触发人工接管」这笔评测盲账。作者先用人为植入的依赖关系验证框架能找回主导模态和互补组合;在245例配对MIMIC-IV测试样本中,去掉超声后错误接近翻倍。这个结果更适合作为监控设计的起点,而非临床性能定论——配对队列本身较窄,报警阈值与接管策略仍需在更大、更贴近真实缺失模式的数据上验证。

上线多模态系统时,除准确率降幅外还应单独统计静默失败率用逐样本、逐模态分析确定哪些缺失场景必须触发人工接管小规模配对结果可用于发现监控盲区,但不足以直接设定临床报警阈值。

03 Agent 越会纠错的具身Agent,为什么反而越容易卡住?

具身Agent频繁重规划,本是为了纠正执行漂移和协作意外,但恢复机制本身可能先变成实时瓶颈。每次调用LLM重规划都要处理不断累积的文本上下文,多Agent场景还会跨Agent叠加,让平均延迟看不出的长尾最终拖过实时期限。BRACE把重规划改造成预算控制:先判断是否需要重规划,再选择模式,并为单次调用分配token和延迟目标;E-RECAP则逐层剪掉低价值上下文,保留关键的头尾信息。在三个具身平台上,这套组合将单次重规划的token数减少62%至92%,而在更难的RoboFactory任务中,其他对照方案全部失败时仍取得80%成功率。对做实时Agent的团队来说,关键不再是让Agent随时重新思考,而是决定何时值得思考、允许思考多久。

不要把频繁重规划默认视为更稳健,应把它纳入在线资源预算多Agent系统需重点监控上下文累积带来的长尾延迟,而不只是平均延迟评估恢复策略时,应同时检查任务成功率和实时期限违规情况。
128个token保住94.7%性能

也值得关注

04
世界模型不只要预测未来,还要在与动作生成一致、能够表达空间变化的几何感知策略空间中预测未来。 机器人SG-WAM探索几何感知策略空间中的自引导世界建模。链接
05
异构机器人无需集中汇总数据也能协同训练深度估计,但平台之间的硬件与数据差异成为联邦学习必须正面处理的问题。 机器人FeDepth面向机器人异构条件设计联邦深度估计方案。链接
06
在未知链接函数的单指标模型中,只查询部分响应坐标也可能完成一般损失下的回归。 训练优化论文从主动采样视角推进相关理论。链接
07
随机化候选搜索试图保留序贯特征选择的质量优势,同时绕开每一步遍历全部特征的计算障碍。 训练优化该方法面向超高维数据中的特征选择。链接

今日观察

3DZip与预算化重规划共同暴露了token生命周期中的隐性成本:输入持续生成却缺乏退出机制时,token就会从能力载体变成运行负债。3DZip处理三维场景中重复、失衡的空间token,BRACE与E-RECAP处理具身执行期间不断累积的文本上下文,两者都要求系统回答三个问题——token为何产生、保留多久、何时淘汰。统一截断会同时删除高价值信息,等到上下文溢出再补救又会放大延迟与内存压力,因此预算应依据几何覆盖或决策价值动态分配。工程团队可以立即为不同来源的token建立账本,逐类记录边际收益、延迟和内存占用,并设置可观测的保留与淘汰阈值。