Token级路由吞吐提升2.01—64.15倍

今日概览

  • Token级路由先破坏现有批处理假设:TokenRouter将单请求路由逻辑与分模型异步执行分开,在不同路由算法、负载和模型组合下实现2.01—64.15倍解码吞吐提升。
  • Agent能力上限可能先由练习世界决定,AgentGarten用统一接口连接可验证的程序化状态与共享神经渲染器,但「4轮对数百万轮」因学习范式不同,不能直接视为样本效率倍数。
  • 混合模态检索会跌入V形性能低谷。文本表示可能获得天然分数优势,使无关文本比同量无关图片更具破坏性,上线前应按真实模态比例和噪声结构压测。

重点关注

01 推理加速 Token级路由一上生产,批处理为什么失灵?

Token级路由会让同一请求在不同LLM之间切换,原本默认「所有请求由单一模型同步解码」的服务系统因此被打乱:各模型推进速度不同,解码步逐渐错位,请求也更难及时进入批次。TokenRouter把这个问题拆成两层——开发者仍从单个请求的视角描述路由逻辑,运行时则为每个LLM启动独立子服务,并异步分发请求。这样既隔离了模型之间的执行节奏,也避免开发者亲自处理复杂的跨模型调度。每个子服务还使用延迟批处理调度器,等待合适时机凑批,其参数由系统吞吐模型推导,而非完全依赖人工调参。论文摘要报告,在不同路由算法、负载和模型组合下,解码吞吐提升为2.01—64.15倍;跨度如此之大,说明收益高度依赖具体工作负载,不能只拿最高值代表普遍效果。对准备部署Token级路由的团队,更重要的判断是这套架构能否在自身流量下同时守住延迟和服务等级目标,相关细节仍需结合全文与实际压测确认。

Token级路由首先是调度问题,算法收益不会自动转化为服务吞吐将单请求编程接口与分模型异步执行解耦,可降低跨模型路由的实现复杂度2.01—64.15倍的宽幅结果应按具体负载解读,落地前需要同时验证吞吐、延迟与稳定性

02 Agent 能力的上限,可能先卡在练习世界

训练Agent不只缺算法,也缺既可信又逼真的练习场:规则必须前后一致,视觉反馈还得接近真实世界。AgentGarten把这两个问题拆开——模拟器维护可验证的状态与程序化规则,共享神经渲染器则把结构化条件转成实时视觉观察,让新世界可以通过代码持续增加并提高难度。Agent在其中交互后,会把经验整理成可继承、可迭代的行动手册,从而让后续学习复用已有积累。论文报告只需4轮便取得显著学习效果,而传统强化学习基线需要数百万轮,但两者采用的学习范式不同,不能直接解读为样本效率提升了几十万倍。更值得关注的是这套环境基础设施能否跨世界稳定扩展;如果成立,Agent团队下一阶段的瓶颈可能不是模型本身,而是有没有足够好的训练世界。

评估Agent训练方案时,应把练习环境的真实性与规则一致性纳入核心指标模拟逻辑与视觉生成解耦,有望降低扩展新任务世界的成本「4轮对数百万轮」只能视为方向性证据,真正优势仍需同范式、同预算比较

03 检索 多模态检索最怕的,竟然是文字太多?

把语义对应的图片逐步替换成文本,检索性能并不会平滑变化,而是在图文混合时跌入明显的V形低谷。更反直觉的是,同等数量的无关文本比无关图片破坏更大:系统会给文本表示更高的相似度,让错误文字压过真正相关的图片。Trident把同一文档构造成文本、图片和图文融合三种等价正视图,再通过多正例对比学习同时训练相关性判断与视图间的分数平衡;摘要称,这种方法在CLIP和视觉语言模型架构上都降低了对模态配比及文本干扰项的敏感度。对准备上线多模态搜索的团队,关键不是分别测好纯文本和纯图片,而是按真实语料的模态比例与噪声结构压测——具体改善幅度仍需看全文确认。

纯文本和纯图片测试都优秀,不代表混合语料下可靠文本干扰项可能天然获得分数优势,压测时应单独增加训练中把文本、图片和图文融合视图设为等价正例,可用于校正模态偏好
Token级路由吞吐提升2.01—64.15倍

也值得关注

04
不微调导航模型,也能检验跨任务、跨场景泛化 机器人SuperNav让通用多模态模型负责理解与决策,并把运动执行交给专用工具。链接
05
直接在图上放置空间标记和短注释,解决「到底改哪一个」 图像生成VibeEdit用二维画布指令定位多个相似对象中的编辑目标。链接
06
海报生成从线性提示词转向空间编排 图像生成Compo用语义、身份、文字和像素四类绑定显式表达二维构图意图。链接
07
58种推理式视觉编辑方案中,最强系统准确率也只有56.6% 评测RISEBench++覆盖六类推理维度和1000个人工标注测试案例。链接
08
循环Transformer不是迭代越多越好 模型架构InfiLoop用面向循环的残差保留可靠中间状态,在Sudoku-Extreme上超过两万有效步后仍能继续改善。链接
09
用自然文本校准剪枝,会错配真正的解码激活 推理加速SparseDecoding针对生成阶段校准并优化SpMV内核,在A100上实现最高1.48倍端到端解码加速。链接
10
压缩一半视觉token仍保留99.5%性能 多模态V-CoLA面向线性注意力重新设计token筛选与合并,并将预填充提速1.86—6.15倍。链接
11
视觉注意力沉降会随网络层次改变 多模态首尾层反复关注固定区域,中间层才随问题变化,为减少幻觉提供了分层干预入口。链接
12
关闭「思考模式」不等于停止显式推理 评测开放式问题尤其容易暴露难以压制的思考惯性,以及回答简洁度与准确率之间的权衡。链接
13
RAG上下文不是训练数据泄露的天然缓解措施 安全对齐它会压低部分临界记忆暴露,也可能让原本无法提取的样本变得可提取。链接
14
只有197个域内蛋白样本,也能借助离域数据改善生成 AI for ScienceRefineMix在选定离散扩散时刻利用离域数据,以改善泛化且不偏置采样分布。链接
15
部署时更换相机数量和姿态,不必显式重建三维场景 机器人VersaCamVLA把任意相机集合压成固定大小的场景token,再注入预训练VLA策略。链接

今日观察

今天值得带回工程流程的检查项是「混合之后再测一次」。TokenRouter表明,多模型细粒度交替会破坏单模型同步解码和批处理假设;混合模态语料会让原本在纯文本、纯图片测试中正常的检索器跌入性能低谷;AgentGarten则必须通过统一接口协调程序化状态与神经视觉。组件各自通过基准,不代表组合后仍然成立。上线评测应主动覆盖真实的模型切换频率、语料模态比例和跨后端状态交接,而不是只测纯净的单组件路径;下一轮发布前,把这三类混合场景及其吞吐、延迟、准确率和状态一致性指标加入验收清单。