今日概览
- 相似度不能直接执行组合逻辑:因子化推断将概念检测与约束执行拆开,在FACTOR-Bench上达到85.5%,无需重训底座。
- 端侧延迟不能漏算视觉编码器,UltraViT依据真实设备延迟优化架构,速度达到现有编码器方案的近1.7倍。
- 视觉token裁剪还要消除结构性冗余。单次前向选择将512个token的选择耗时从112.4毫秒降至2.5毫秒,同时尽量保留互补信息。
重点关注
01 多模态|相似度一碰到「有伞且无人」就失灵了
双编码器明明能识别「伞」和「人」,搜索「有伞且无人」时却可能把两者都出现的图片排在前面。论文摘要给出的解释很反直觉:问题未必出在视觉表征,而是相似度接口把概念证据近似平均汇总,最终表现得像只认词、不认「且」「非」等操作符。即使文本向量中存在这些逻辑信号,它们也可能太弱或方向错位,无法真正改变排序,因此微调编码器未必能解决接口层的瓶颈。作者提出因子化推断,把「识别图片里有什么」和「执行查询约束」拆开,并用无需训练的LCSE从冻结模型提取概念分数,再在外部执行逻辑。摘要数据显示,它在FACTOR-Bench上达到85.5%,高于最佳微调基线的73.2%;用于SigLIP 2时达到90.7%,还把NegBench COCO多选题准确率从27.2%提升到65.2%,同时维持原有检索表现。不过这些结果有多大程度依赖预定义概念、约束解析和特定基准,仍需看全文确认。对检索系统团队来说,更值得尝试的方向可能不是继续重训底座,而是在相似度之上补一层可执行的约束系统。
原文:Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models
02 推理加速|端侧多模态的延迟账,可能一直少算了一项
压缩语言模型、减少视觉token,未必能解决整条推理链路的瓶颈,因为视觉编码器本身也可能是延迟大户。UltraViT把真实设备上的延迟纳入架构设计,用金字塔结构组合不同的空间信息处理方式,并通过两阶段生成式预训练补足轻量编码器的语义能力。摘要称,它在端侧速度上达到现有编码器方案的近1.7倍,同时保持了面向大视觉语言模型所需的表征质量。这个数字是否适用于不同芯片、输入分辨率和运行时,还需要看全文的测试设置确认。对部署团队更实际的启示是:优化前先重新测量从图像输入到文本输出的完整链路,不要默认编码阶段只是固定开销。
原文:UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
03 推理加速|少算容易,怎样避免删掉互补信息?
高分辨率MLLM会产生数千个视觉token,裁剪虽能降低后续计算量,但迭代挑选本身也可能成为延迟来源。这项工作不只按重要性删掉低分token,而是把指令相关性、视觉显著性和token间的结构性冗余一起纳入评分,尽量保留彼此互补的信息。其核心是用单次前向选择替代逐步构造子集:先抑制重复的表征方向,再让高分token并行压制相似的低分候选。在Qwen2.5-VL的512个token设置下,摘要报告选择耗时从112.4毫秒降至2.5毫秒,同时在激进压缩下保持有竞争力的效果。对实际部署而言,这类工作值得关注的不是理论计算量又少了多少,而是裁剪开销能否足够低,并在具体硬件和任务上兑现端到端加速。
原文:Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs
也值得关注
今日观察
UltraViT与Structured Redundancy Modeling分别优化了视觉输入链路的前后两段:前者降低视觉编码器的设备侧延迟,后者压缩编码完成后送入语言模型的视觉token。两者放在一起看,「每张图用了多少token」并不足以代表多模态系统的真实效率;编码器变快后,语言模型处理视觉token的成本可能成为新瓶颈,而token大幅减少后,编码阶段的固定开销又可能占据更高比例。部署团队应为目标硬件建立分段基准,分别记录视觉编码器耗时、token生成规模、语言模型处理耗时和端到端延迟,再依据占比最高的一段决定下一轮优化。