今日概览
- 27B模型全参微调可压至推理级显存,Agentic ESOpt绕过反向传播和长轨迹逐步归因,WebArena-Lite提升6.69%,但完整轨迹的采样成本仍需等算力核对。
- 扩散训练的计算最优点约为每参数200个图像token:Abra在三个数量级的计算预算中得到可预测曲线,为模型规模、数据量和训练时长提供配置依据。
- 稀疏专家让视觉编码器扩容不必激活全部参数;MoE-ViE以76%的延迟匹配体量大1.7倍的编码器,实际收益仍取决于路由、算子和硬件。
- 市场需求导出的Agent任务暴露了交付断点。StartupBench中最强模型也只能完整完成约30%的任务,局部进展尚不能转化为可靠交付。
重点关注
01 训练优化 不做反向传播,大模型Agent也能全参数微调?
把27B模型的全参数微调压到推理级显存,这条路线确实有意思。Agentic ESOpt不依赖强化学习的反向传播,而是扰动模型参数、运行完整任务,再根据整条轨迹的奖励加权更新参数。这样一来,它不必把稀疏奖励拆解到长轨迹中的每一步,也绕开了保存梯度和优化器状态带来的显存压力。更灵活的是,这种黑盒反馈还能与提示词、技能和测试时计算共同演化,让参数与上下文在同一套流程中优化。摘要数据显示,在WebArena-Lite上,全参数优化Qwen-3.5-27B比无技能基线提升6.69%;在自动设计测试时启发式策略的实验中,36组设置有28组优于对应基线。不过,推理级显存不等于低总计算成本:大量参数扰动都要跑完整轨迹,采样与推理开销可能相当可观,仍需看全文中的等算力对比。对训练Agent的团队来说,真正值得关注的不是「ES取代RL」,而是当任务变长、模型变大时,是否该把无反向传播的参数搜索纳入训练工具箱。
原文:Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements
02 图像生成 预算有限时,该堆参数还是堆数据?
图像生成团队做预算时,终于有了一套比「模型越大越好」更具体的参照。Abra用同一系列流匹配Transformer,在10^19至10^22FLOPs的三个数量级内做受控实验,发现训练损失、生成质量乃至最佳引导参数都呈现可预测曲线。最值得关注的结论是:计算最优点约为每个参数搭配200个图像token,是语言模型Chinchilla配方的10倍;而且扩散模型对过度训练更耐受,因此预算有限时,多投数据通常比盲目扩大模型更稳妥。这让团队有机会在正式训练前估算模型规模、数据量和训练时长,而不是靠昂贵试错配置资源。不过这些规律来自一个受控模型家族,能否迁移到不同架构、数据质量和高分辨率任务,还需要看全文及后续复现。
原文:Abra: Scaling Diffusion Image Training
03 多模态 视觉编码器扩容,不必让每张图都付全价
视觉编码器的参数容量可以继续增长,但每次推理未必需要激活全部计算。MoE-ViE把稀疏专家引入CLIP式视觉编码器,并通过更细粒度的专家结构、无辅助损失的负载均衡和专用算子,试图避免专家利用不均与延迟反增。摘要将帧级蒸馏与冻结机制用于扩展视频能力并保留图像知识,但未交代具体部署链路。对多模态团队而言,这说明视觉侧也可能用稀疏扩容换取更好的容量—计算曲线,但真实吞吐、路由稳定性以及不同硬件上的收益仍需看全文和实际部署验证。
原文:MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding
04 评测 基准高分,未必换得真实需求中的完整交付
多数Agent基准由研究者先设想「什么能力有用」,StartupBench则从已有用户采用的AI产品及其工作流中反推任务,把评测对象拉回到已经出现实际需求的专业场景。它考察的不是孤立步骤,而是带完整交付物的端到端流程,并用细粒度评分标准捕捉复杂要求。摘要指出,复杂指令遵循和领域知识是主要障碍。在统一测试框架下,即使最强模型也只能完整完成约30%的任务,虽然许多失败案例已经取得了不少局部进展——这说明「会做大部分步骤」和「可靠交付」仍是两回事。各类失败原因的具体占比仍需看全文确认。对做Agent产品或评测的团队来说,更有价值的指标应是市场需求导出的任务完成率,而不是继续累积与真实交付脱节的局部高分;同时也不能把「市场验证」直接等同于商业成功或生产可用。
原文:StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

也值得关注
今日观察
Abra、能力中心的数据设计、LinCa与AViTS把生成模型的「规模化」拆成了三本不同的账。第一本是训练账:增加算力后,损失与生成质量是否沿可预测曲线改善,参数量、数据量和训练时长怎样组合才接近计算最优。第二本是数据账:不同能力的数据配比是否带来协同增长,还是让一种能力的提升以另一种能力退化为代价。第三本是采样账:单个样本的推理计算究竟花在了哪些特征和token上,缓存与动态选择节省的计算是否足以抵消误差和控制开销。
这三本账不能由一个最终质量分数代替。训练端获得的收益,可能被数据失衡造成的能力干扰抵消,也可能在多步采样、特征重复计算和无差别token更新中被重新花掉。工程团队应分别维护训练收益曲线、能力干扰矩阵和单样本推理成本表,再把三者放到同一扩容决策中联合审查。下一轮扩容立项前,先用同一批候选配置填完这三张表,只批准在训练收益、能力平衡和推理成本三项约束下仍有净收益的方案。