27B全参微调压至推理级显存

今日概览

  • 27B模型全参微调可压至推理级显存,Agentic ESOpt绕过反向传播和长轨迹逐步归因,WebArena-Lite提升6.69%,但完整轨迹的采样成本仍需等算力核对。
  • 扩散训练的计算最优点约为每参数200个图像token:Abra在三个数量级的计算预算中得到可预测曲线,为模型规模、数据量和训练时长提供配置依据。
  • 稀疏专家让视觉编码器扩容不必激活全部参数;MoE-ViE以76%的延迟匹配体量大1.7倍的编码器,实际收益仍取决于路由、算子和硬件。
  • 市场需求导出的Agent任务暴露了交付断点。StartupBench中最强模型也只能完整完成约30%的任务,局部进展尚不能转化为可靠交付。

重点关注

01 训练优化 不做反向传播,大模型Agent也能全参数微调?

把27B模型的全参数微调压到推理级显存,这条路线确实有意思。Agentic ESOpt不依赖强化学习的反向传播,而是扰动模型参数、运行完整任务,再根据整条轨迹的奖励加权更新参数。这样一来,它不必把稀疏奖励拆解到长轨迹中的每一步,也绕开了保存梯度和优化器状态带来的显存压力。更灵活的是,这种黑盒反馈还能与提示词、技能和测试时计算共同演化,让参数与上下文在同一套流程中优化。摘要数据显示,在WebArena-Lite上,全参数优化Qwen-3.5-27B比无技能基线提升6.69%;在自动设计测试时启发式策略的实验中,36组设置有28组优于对应基线。不过,推理级显存不等于低总计算成本:大量参数扰动都要跑完整轨迹,采样与推理开销可能相当可观,仍需看全文中的等算力对比。对训练Agent的团队来说,真正值得关注的不是「ES取代RL」,而是当任务变长、模型变大时,是否该把无反向传播的参数搜索纳入训练工具箱。

长轨迹奖励难以逐步归因时,可用整条轨迹评价参数扰动推理级显存让大模型全参数优化更可行,但不能据此判断总成本更低评估这条路线时,应重点核对采样量、墙钟时间和等算力下的任务收益

02 图像生成 预算有限时,该堆参数还是堆数据?

图像生成团队做预算时,终于有了一套比「模型越大越好」更具体的参照。Abra用同一系列流匹配Transformer,在10^19至10^22FLOPs的三个数量级内做受控实验,发现训练损失、生成质量乃至最佳引导参数都呈现可预测曲线。最值得关注的结论是:计算最优点约为每个参数搭配200个图像token,是语言模型Chinchilla配方的10倍;而且扩散模型对过度训练更耐受,因此预算有限时,多投数据通常比盲目扩大模型更稳妥。这让团队有机会在正式训练前估算模型规模、数据量和训练时长,而不是靠昂贵试错配置资源。不过这些规律来自一个受控模型家族,能否迁移到不同架构、数据质量和高分辨率任务,还需要看全文及后续复现。

规划训练预算时优先验证数据量,而非默认扩大参数规模可用小规模受控实验外推训练曲线,减少大训练的配置试错「每参数200个图像token」是有价值的起点,但不应直接当作所有架构的通用配方

03 多模态 视觉编码器扩容,不必让每张图都付全价

视觉编码器的参数容量可以继续增长,但每次推理未必需要激活全部计算。MoE-ViE把稀疏专家引入CLIP式视觉编码器,并通过更细粒度的专家结构、无辅助损失的负载均衡和专用算子,试图避免专家利用不均与延迟反增。摘要将帧级蒸馏与冻结机制用于扩展视频能力并保留图像知识,但未交代具体部署链路。对多模态团队而言,这说明视觉侧也可能用稀疏扩容换取更好的容量—计算曲线,但真实吞吐、路由稳定性以及不同硬件上的收益仍需看全文和实际部署验证。

评估视觉MoE时应同时看总容量、激活参数和端到端延迟视频扩展中的蒸馏值得作为保留图像能力的训练方案考察专用算子可能决定稀疏专家的理论优势能否兑现为部署收益

04 评测 基准高分,未必换得真实需求中的完整交付

多数Agent基准由研究者先设想「什么能力有用」,StartupBench则从已有用户采用的AI产品及其工作流中反推任务,把评测对象拉回到已经出现实际需求的专业场景。它考察的不是孤立步骤,而是带完整交付物的端到端流程,并用细粒度评分标准捕捉复杂要求。摘要指出,复杂指令遵循和领域知识是主要障碍。在统一测试框架下,即使最强模型也只能完整完成约30%的任务,虽然许多失败案例已经取得了不少局部进展——这说明「会做大部分步骤」和「可靠交付」仍是两回事。各类失败原因的具体占比仍需看全文确认。对做Agent产品或评测的团队来说,更有价值的指标应是市场需求导出的任务完成率,而不是继续累积与真实交付脱节的局部高分;同时也不能把「市场验证」直接等同于商业成功或生产可用。

用用户已有需求反推评测任务,比研究者自行选题更能检验能力迁移评估Agent时应区分局部进展与完整交付,约30%的完成率显示两者差距仍大团队可补充端到端交付测试,但不应把市场来源当成生产可靠性的充分证明
27B全参微调压至推理级显存

也值得关注

05
把评测目标从复现已知知识推向提出并验证新知识 评测ASI-Bench尝试覆盖未知探索与可验证成果,但「超级智能」的命名仍应与实际任务难度分开审视。链接
06
通用图像生成的数据工程开始围绕能力共同演化 图像生成能力中心的数据设计不再孤立优化各任务语料,而是关注训练过程中不同能力的协同与干扰。链接
07
越狱攻击应在相同目标模型调用预算下比较 安全对齐Fair ASR重新控制黑盒攻击预算后,现有攻击方法的成功率与排行榜顺序可能改变。链接
08
差分隐私噪声不必平均破坏所有梯度方向 训练优化谱梯度正交化利用视觉梯度的低秩结构,从加噪梯度中恢复方向信号,但收益仅适用于中高信噪比条件。链接
09
去噪方差估计可降低ViT结构化剪枝的精度代价 推理加速方法进一步加入最优脑偏差补偿,为计算受限的边缘部署提供更直接的压缩路径。链接
10
手术技能评估开始识别组织张力而非只看器械运动 AI for Science视频模型由显式动作扩展到影响操作质量的隐性物理状态,有望补充依赖人工复核的评估流程。链接
11
可学习的分解特征缓存减少扩散采样中的重复计算 推理加速LinCa试图在复用中间特征的同时控制直接缓存产生的累积误差。链接
12
Agent与可执行3D程序表示可以联合设计 AgentaDSL用结构化控制和可编辑表示缓解自然语言生成3D内容时链路脆弱、修改困难的问题。链接
13
动态分辨率生成不必统一放大所有token 推理加速AViTS自适应选择需要细化的时空区域,把切换分辨率后的算力集中到更有价值的更新上。链接
14
语言学谜题要求模型先归纳未知规则再推理 推理IOL-AI Challenge把规则发现能力带到数学与代码之外,减少预先给定形式系统带来的便利。链接
15
即插即用的交通元素感知可检验自动驾驶是否利用静态规则 机器人通过补入交通灯与路牌信息,该方法直接测试端到端驾驶决策对交通规则的真实敏感度。链接

今日观察

Abra、能力中心的数据设计、LinCa与AViTS把生成模型的「规模化」拆成了三本不同的账。第一本是训练账:增加算力后,损失与生成质量是否沿可预测曲线改善,参数量、数据量和训练时长怎样组合才接近计算最优。第二本是数据账:不同能力的数据配比是否带来协同增长,还是让一种能力的提升以另一种能力退化为代价。第三本是采样账:单个样本的推理计算究竟花在了哪些特征和token上,缓存与动态选择节省的计算是否足以抵消误差和控制开销。

这三本账不能由一个最终质量分数代替。训练端获得的收益,可能被数据失衡造成的能力干扰抵消,也可能在多步采样、特征重复计算和无差别token更新中被重新花掉。工程团队应分别维护训练收益曲线、能力干扰矩阵和单样本推理成本表,再把三者放到同一扩容决策中联合审查。下一轮扩容立项前,先用同一批候选配置填完这三张表,只批准在训练收益、能力平衡和推理成本三项约束下仍有净收益的方案。