今日概览
- 3DZip把场景压至128个token仍保留94.7%性能,通过特征多样性与空间约束减少三维场景冗余,并将推理速度提升至1.92倍。
- 临床多模态评测必须识别「静默失败」:逐样本、逐模态分析显示,模态缺失不仅降低准确率,还可能让错误预测显得更加可靠。
- 频繁重规划会让恢复机制成为瓶颈。BRACE与E-RECAP按决策价值分配预算、裁剪上下文,单次重规划token数减少62%至92%。
重点关注
01 推理加速 数千个空间token,正在拖住3D模型
一个三维场景投影后会迅速膨胀出数千个空间token,计算和显存压力甚至可能比模型规模更先卡住部署。二维视觉语言模型常按语义相关性或注意力筛选token,但三维问答还依赖物体之间的距离、方位和几何关系,直接照搬容易把空间线索一并删掉;只合并位置相近的token也不够,因为不同物体的token数量仍可能严重失衡。3DZip用三步处理这个问题:先通过粗粒度体素化去掉点级重复,再用行列式点过程从特征空间中挑选差异足够大的锚点,最后在空间约束下合并其余token,让压缩后的表示既覆盖多样物体,又尽量保持几何连贯。这个组合很巧妙,因为它没有把「重要性」简单等同于注意力分数,而是同时考虑特征多样性与三维结构。从摘要披露的三个3D问答基准看,输入压到128个token后仍保留原模型94.7%的性能,同时将推理速度提升到1.92倍。对准备把三维视觉语言能力放进机器人、空间计算或数字孪生系统的团队来说,这意味着优化重点可以从单纯缩小模型,前移到压缩场景表示本身。不过,这些收益在更复杂场景、不同模型架构和真实硬件上的稳定性仍需看全文与更多测试确认。
原文:3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering
02 评测 准确率下降不可怕,模型错得很自信才麻烦
静默失败的部署风险在于:超声等模态缺失后,模型不仅可能答错,还可能远离决策边界,让现有监控误以为结果可靠。这套框架不只计算删掉某个模态后损失多少准确率,而是逐样本区分可被监控捕捉的「响亮失败」和不易察觉的「静默失败」,再用模态互补矩阵追溯错误来自哪里。相比常规消融实验只给出总体均值、SHAP等事后归因解释单次预测,它补上了「哪个模态缺失导致了哪些错误,以及这些错误能否触发人工接管」这笔评测盲账。作者先用人为植入的依赖关系验证框架能找回主导模态和互补组合;在245例配对MIMIC-IV测试样本中,去掉超声后错误接近翻倍。这个结果更适合作为监控设计的起点,而非临床性能定论——配对队列本身较窄,报警阈值与接管策略仍需在更大、更贴近真实缺失模式的数据上验证。
原文:Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI
03 Agent 越会纠错的具身Agent,为什么反而越容易卡住?
具身Agent频繁重规划,本是为了纠正执行漂移和协作意外,但恢复机制本身可能先变成实时瓶颈。每次调用LLM重规划都要处理不断累积的文本上下文,多Agent场景还会跨Agent叠加,让平均延迟看不出的长尾最终拖过实时期限。BRACE把重规划改造成预算控制:先判断是否需要重规划,再选择模式,并为单次调用分配token和延迟目标;E-RECAP则逐层剪掉低价值上下文,保留关键的头尾信息。在三个具身平台上,这套组合将单次重规划的token数减少62%至92%,而在更难的RoboFactory任务中,其他对照方案全部失败时仍取得80%成功率。对做实时Agent的团队来说,关键不再是让Agent随时重新思考,而是决定何时值得思考、允许思考多久。
原文:When Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied Agents

也值得关注
今日观察
3DZip与预算化重规划共同暴露了token生命周期中的隐性成本:输入持续生成却缺乏退出机制时,token就会从能力载体变成运行负债。3DZip处理三维场景中重复、失衡的空间token,BRACE与E-RECAP处理具身执行期间不断累积的文本上下文,两者都要求系统回答三个问题——token为何产生、保留多久、何时淘汰。统一截断会同时删除高价值信息,等到上下文溢出再补救又会放大延迟与内存压力,因此预算应依据几何覆盖或决策价值动态分配。工程团队可以立即为不同来源的token建立账本,逐类记录边际收益、延迟和内存占用,并设置可观测的保留与淘汰阈值。