因子化推断达85.5%,裁剪耗时降至2.5毫秒

今日概览

  • 相似度不能直接执行组合逻辑:因子化推断将概念检测与约束执行拆开,在FACTOR-Bench上达到85.5%,无需重训底座。
  • 端侧延迟不能漏算视觉编码器,UltraViT依据真实设备延迟优化架构,速度达到现有编码器方案的近1.7倍。
  • 视觉token裁剪还要消除结构性冗余。单次前向选择将512个token的选择耗时从112.4毫秒降至2.5毫秒,同时尽量保留互补信息。

重点关注

01 多模态|相似度一碰到「有伞且无人」就失灵了

双编码器明明能识别「伞」和「人」,搜索「有伞且无人」时却可能把两者都出现的图片排在前面。论文摘要给出的解释很反直觉:问题未必出在视觉表征,而是相似度接口把概念证据近似平均汇总,最终表现得像只认词、不认「且」「非」等操作符。即使文本向量中存在这些逻辑信号,它们也可能太弱或方向错位,无法真正改变排序,因此微调编码器未必能解决接口层的瓶颈。作者提出因子化推断,把「识别图片里有什么」和「执行查询约束」拆开,并用无需训练的LCSE从冻结模型提取概念分数,再在外部执行逻辑。摘要数据显示,它在FACTOR-Bench上达到85.5%,高于最佳微调基线的73.2%;用于SigLIP 2时达到90.7%,还把NegBench COCO多选题准确率从27.2%提升到65.2%,同时维持原有检索表现。不过这些结果有多大程度依赖预定义概念、约束解析和特定基准,仍需看全文确认。对检索系统团队来说,更值得尝试的方向可能不是继续重训底座,而是在相似度之上补一层可执行的约束系统。

相似度适合衡量相关性,但不能直接充当组合逻辑接口面对否定与合取查询,可优先尝试把概念检测和约束执行拆开无需重训底座的外部评分编辑效果亮眼,但泛化能力仍需更多真实查询验证

02 推理加速|端侧多模态的延迟账,可能一直少算了一项

压缩语言模型、减少视觉token,未必能解决整条推理链路的瓶颈,因为视觉编码器本身也可能是延迟大户。UltraViT把真实设备上的延迟纳入架构设计,用金字塔结构组合不同的空间信息处理方式,并通过两阶段生成式预训练补足轻量编码器的语义能力。摘要称,它在端侧速度上达到现有编码器方案的近1.7倍,同时保持了面向大视觉语言模型所需的表征质量。这个数字是否适用于不同芯片、输入分辨率和运行时,还需要看全文的测试设置确认。对部署团队更实际的启示是:优化前先重新测量从图像输入到文本输出的完整链路,不要默认编码阶段只是固定开销。

端侧多模态的性能分析应把视觉编码器单独拆出来测量架构搜索和选型应参考目标设备的真实延迟,而不只看计算量近1.7倍的速度优势值得关注,但仍需结合具体硬件和端到端测试判断

03 推理加速|少算容易,怎样避免删掉互补信息?

高分辨率MLLM会产生数千个视觉token,裁剪虽能降低后续计算量,但迭代挑选本身也可能成为延迟来源。这项工作不只按重要性删掉低分token,而是把指令相关性、视觉显著性和token间的结构性冗余一起纳入评分,尽量保留彼此互补的信息。其核心是用单次前向选择替代逐步构造子集:先抑制重复的表征方向,再让高分token并行压制相似的低分候选。在Qwen2.5-VL的512个token设置下,摘要报告选择耗时从112.4毫秒降至2.5毫秒,同时在激进压缩下保持有竞争力的效果。对实际部署而言,这类工作值得关注的不是理论计算量又少了多少,而是裁剪开销能否足够低,并在具体硬件和任务上兑现端到端加速。

评估视觉token裁剪时应同时看选择开销与端到端延迟结构性去重比单纯重要性排序更有机会保留互补视觉信息摘要中的110毫秒级节省很亮眼,但跨模型、硬件和高分辨率场景的收益仍需看全文确认

也值得关注

04
生成回放可能利用合成数据与真实数据的域差异走捷径,这项工作试图直接拆掉捷径,而非继续提高生成质量。 训练优化方法面向免训练的生成回放式类别增量学习。链接
05
把单步训练的预训练去噪器用于迭代重建并不会自动稳定,contractive anchoring为免重训复用补上收敛护栏。 AI for Science适用于PnP和RED等模型驱动的图像重建算法。链接
06
图像重建既需要强去噪能力,也需要全局Lipschitz保证,可训练非扩张去噪器试图调和效果与可证明收敛。 AI for Science工作聚焦带Lipschitz控制的收缩式图像重建。链接

今日观察

UltraViT与Structured Redundancy Modeling分别优化了视觉输入链路的前后两段:前者降低视觉编码器的设备侧延迟,后者压缩编码完成后送入语言模型的视觉token。两者放在一起看,「每张图用了多少token」并不足以代表多模态系统的真实效率;编码器变快后,语言模型处理视觉token的成本可能成为新瓶颈,而token大幅减少后,编码阶段的固定开销又可能占据更高比例。部署团队应为目标硬件建立分段基准,分别记录视觉编码器耗时、token生成规模、语言模型处理耗时和端到端延迟,再依据占比最高的一段决定下一轮优化。