今日概览
- 论文所测的全流程FP8强化学习管线关键风险是负反馈失效:量化噪声让负优势token越过裁剪边界并丢失梯度;Calibrated Clipping在GRPO、DAPO和8B至32B模型中消除了摘要所报的熵值飙升。
- OmniEdu按四类能力组织近7万条样本,并在4B、9B和27B模型上同时改善课程理解、解题和辅导基准,但尚不能代表真实课堂效果。
- UltraTex把2K纹理生成的冗余分开处理。 删除背景token、稀疏前景交互并适配VAE解码后,其数据集常见样本相对特定基线训练提速20.6至91.1倍、端到端推理提速22.3至74.6倍。
重点关注
01 训练优化 全流程FP8强化学习中,模型为何可能忘记惩罚坏答案?
论文所测的全流程FP8强化学习管线失控的原因,可能不是通常所说的「精度不够」,而是一部分错误答案悄悄逃过了惩罚。论文发现,多次叠加的量化噪声会扭曲重要性比率——这个比率决定新旧策略差异是否仍在可信范围内,并让负优势token更容易越过裁剪边界、梯度被错误归零。于是,模型生成乱码等异常输出时,本应发挥作用的纠错信号反而消失;这些输出不断积累,最终表现为训练中途熵值突然飙升。作者提出动态的Calibrated Clipping,让FP8裁剪边界对齐BF16分布的下界分位数,并相应调整上界。摘要称,这一方法在GRPO和DAPO、8B至32B模型及多种FP8缩放粒度下都消除了熵值飙升,性能恢复到接近BF16基线。对训练团队而言,真正值得加入监控的不只是最终分数,还包括负优势token是否持续获得梯度,否则加速后的训练管线可能已经失去惩罚坏行为的能力。
原文:Towards Full Pipeline FP8 Reinforcement Learning for LLMs
02 训练优化 能力均衡监督同时改善三类教育基准
OmniEdu把教育模型的监督数据组织为学科能力、课程定位、诊断推理和教学行动四类能力。它把超过100种来源整理为四类能力:学科能力、课程定位、诊断推理,以及教学行动与脚手架支持,再通过语义审查、质量评分和多样性筛选构建近7万条训练样本。这样的能力均衡训练在4B、9B和27B三个模型规模上,都同时改善了课程理解、K-12解题和教学辅导基准,说明「会做题」与「会引导」可以由同一套数据工程协同培养。对训练教育模型的团队来说,下一步值得优化的可能不是数据总量,而是每类监督信号是否覆盖了完整教学链路。需要保留的是,这些证据主要来自标准化基准,离真实课堂中的长期学习效果、错误干预和学生差异仍有距离。
原文:OmniEdu: Open Foundation Models for Learning and Teaching
03 图像生成 先删背景token,再限制前景交互
2K多视图纹理生成的统一序列超过21.2万个token,其中的计算冗余主要来自背景token和稀疏的前景交互。UltraTex把冗余拆成两类:背景token可以直接删除,前景内部的交互则较为稀疏,因此分别用背景token丢弃和块稀疏注意力减少计算。为了避免只处理前景导致重建瑕疵,它又改造了VAE解码环节,让解码器明确感知前景区域。摘要报告称,在其数据集的常见样本上,训练较基线加速20.6至91.1倍,端到端推理加速22.3至74.6倍,但这些数字不能直接外推到所有模型、资产和生产环境。对做高分辨率生成系统的团队,更值得借鉴的是这套工程思路:先定位不同来源的冗余,再分别改造注意力和解码链路。
原文:UltraTex: Unleashing 2K Multi-View Diffusion for 3D Texturing

也值得关注
今日观察
UltraTex与全流程FP8强化学习共同提示,系统加速的核心不是统一压缩更多计算,而是区分可安全删除的冗余与必须保护的控制信号。UltraTex删除背景token、限制前景交互,同时让VAE解码器感知前景区域;FP8研究则发现,重要性比率一旦被量化噪声扭曲,负优势token便可能失去梯度,使训练原有的惩罚机制直接失效。两者都说明,最终速度和任务分数不足以单独证明改造安全,稀疏化、低精度与解码链路中的关键中间量同样需要验收。
落地时,为每次性能改造建立逐段验收表:稀疏化记录保留token比例与伪影率,FP8记录重要性比率分位数、负优势token梯度与熵值,解码改造单独进行前景重建对照;任一纠错信号出现异常,就停止扩大部署。