全流程FP8强化学习中的负优势token梯度丢失

今日概览

  • 论文所测的全流程FP8强化学习管线关键风险是负反馈失效:量化噪声让负优势token越过裁剪边界并丢失梯度;Calibrated Clipping在GRPO、DAPO和8B至32B模型中消除了摘要所报的熵值飙升。
  • OmniEdu按四类能力组织近7万条样本,并在4B、9B和27B模型上同时改善课程理解、解题和辅导基准,但尚不能代表真实课堂效果。
  • UltraTex把2K纹理生成的冗余分开处理。 删除背景token、稀疏前景交互并适配VAE解码后,其数据集常见样本相对特定基线训练提速20.6至91.1倍、端到端推理提速22.3至74.6倍。

重点关注

01 训练优化 全流程FP8强化学习中,模型为何可能忘记惩罚坏答案?

论文所测的全流程FP8强化学习管线失控的原因,可能不是通常所说的「精度不够」,而是一部分错误答案悄悄逃过了惩罚。论文发现,多次叠加的量化噪声会扭曲重要性比率——这个比率决定新旧策略差异是否仍在可信范围内,并让负优势token更容易越过裁剪边界、梯度被错误归零。于是,模型生成乱码等异常输出时,本应发挥作用的纠错信号反而消失;这些输出不断积累,最终表现为训练中途熵值突然飙升。作者提出动态的Calibrated Clipping,让FP8裁剪边界对齐BF16分布的下界分位数,并相应调整上界。摘要称,这一方法在GRPO和DAPO、8B至32B模型及多种FP8缩放粒度下都消除了熵值飙升,性能恢复到接近BF16基线。对训练团队而言,真正值得加入监控的不只是最终分数,还包括负优势token是否持续获得梯度,否则加速后的训练管线可能已经失去惩罚坏行为的能力。

论文所测的全流程FP8强化学习管线的风险可能集中在纠错信号失效,而非平均意义上的精度下降评估量化训练时应同时监控熵值、异常输出和负优势token梯度动态校准裁剪可作为全流程FP8强化学习的稳定化方案,但具体开销仍需看全文确认

02 训练优化 能力均衡监督同时改善三类教育基准

OmniEdu把教育模型的监督数据组织为学科能力、课程定位、诊断推理和教学行动四类能力。它把超过100种来源整理为四类能力:学科能力、课程定位、诊断推理,以及教学行动与脚手架支持,再通过语义审查、质量评分和多样性筛选构建近7万条训练样本。这样的能力均衡训练在4B、9B和27B三个模型规模上,都同时改善了课程理解、K-12解题和教学辅导基准,说明「会做题」与「会引导」可以由同一套数据工程协同培养。对训练教育模型的团队来说,下一步值得优化的可能不是数据总量,而是每类监督信号是否覆盖了完整教学链路。需要保留的是,这些证据主要来自标准化基准,离真实课堂中的长期学习效果、错误干预和学生差异仍有距离。

教育训练数据应按能力链路组织,而不只是按来源或题型混合能力均衡的整体训练同时改善了解题与辅导基准,但摘要未提供各类监督数据的独立贡献基准提升可验证训练方向,但不能直接视为真实教学成效

03 图像生成 先删背景token,再限制前景交互

2K多视图纹理生成的统一序列超过21.2万个token,其中的计算冗余主要来自背景token和稀疏的前景交互。UltraTex把冗余拆成两类:背景token可以直接删除,前景内部的交互则较为稀疏,因此分别用背景token丢弃和块稀疏注意力减少计算。为了避免只处理前景导致重建瑕疵,它又改造了VAE解码环节,让解码器明确感知前景区域。摘要报告称,在其数据集的常见样本上,训练较基线加速20.6至91.1倍,端到端推理加速22.3至74.6倍,但这些数字不能直接外推到所有模型、资产和生产环境。对做高分辨率生成系统的团队,更值得借鉴的是这套工程思路:先定位不同来源的冗余,再分别改造注意力和解码链路。

优化长序列前,先区分可删除的信息与必须保留但可稀疏计算的交互只裁掉背景不够,解码链路也要同步适配才能控制伪影数十倍加速来自特定基线和数据内样本,生产选型前仍需用自身资产复测
全流程FP8强化学习中的负优势token梯度丢失

也值得关注

04
把求解器验证过的建模经验沉淀为分层技能库,让运筹建模Agent不必在每道题上重复犯同类错误 AgentOptiSkill分别保存问题级建模框架和局部防错经验,候选技能通过验证后才会被纳入。链接
05
推荐模型扩容不必反复从头训练,参数继承可同时支持稠密模型增长和向稀疏专家模型转换 模型架构Inherit4Rec覆盖Dense-to-Dense扩容与Dense-to-Sparse转换,并在两类推荐数据上优于所评估的继承基线。链接
06
预测误差变大未必说明模型退化,机制可控的压力测试能区分环境变得不可预测与模型偏离条件均值 评测该方法把期望平方误差变化拆成环境风险和预测器与条件均值的距离,并用预设对照检查归因。链接
07
Python的特殊地位更像是与英语描述对齐得好,而不是在所有编程语言迁移中都充当通用枢纽 代码智能三个代码模型的结果显示,代码间几何结构不存在统一中心,不同迁移方向偏好的中间语言也不同。链接
08
以取代基引起的局部性质变化为训练单位,补上分子模型对细粒度结构—性质关系理解不足的一环 AI for ScienceMolSC包含18.1万条取代基层级训练样本,另以1541条在骨架、取代基和分子层面均不重叠的样本进行评测。链接

今日观察

UltraTex与全流程FP8强化学习共同提示,系统加速的核心不是统一压缩更多计算,而是区分可安全删除的冗余与必须保护的控制信号。UltraTex删除背景token、限制前景交互,同时让VAE解码器感知前景区域;FP8研究则发现,重要性比率一旦被量化噪声扭曲,负优势token便可能失去梯度,使训练原有的惩罚机制直接失效。两者都说明,最终速度和任务分数不足以单独证明改造安全,稀疏化、低精度与解码链路中的关键中间量同样需要验收。

落地时,为每次性能改造建立逐段验收表:稀疏化记录保留token比例与伪影率,FP8记录重要性比率分位数、负优势token梯度与熵值,解码改造单独进行前景重建对照;任一纠错信号出现异常,就停止扩大部署。