万亿MoE后训练跑上华为昇腾

今日概览

  • 万亿参数MoE的全参数后训练,第一次端到端跑在华为昇腾而非GPU上——真正的交付物是一套非CUDA工程手册(压显存、藏通信、修算子);34%的算力利用率不算惊艳,信号却清楚:离开GPU的前沿训练正从「能跑」走向「生产可用」。
  • 长视频越拉越走样,缺的是一段能被训练的「记忆」:SGF用两趟训练,把一直被当成只读的KV cache变成可训练信号,5秒窗口就能外推到几分钟,主体一致和时间稳定这些最先崩的维度都更稳。
  • nDCG衡量单篇相关性,决定RAG上限的却是整个集合。12个主流reranker在集合级覆盖率最高不到45%,跨文档协调是共同短板;配套的Rubric4Setwise免训练,用更少的文档换来更好的下游生成。
  • 知识注入第一次有了可预测的scaling law,hypernetwork生成固定LoRA把事实烧进权重,沿深度、宽度、模型大小三个轴都呈幂律,OOD问答上的scaling比LoRA和全量微调更陡。

重点关注

01 训练优化 万亿参数MoE的全参数后训练,这次端到端跑在华为昇腾上

这份报告的看点,是有人在非英伟达硬件上把万亿参数级混合专家(MoE)模型的全参数后训练端到端跑成了——用的是华为昇腾NPU集群。这类训练本身就是系统工程难题:显存压不住、通信和计算重叠不起来、底层算子(kernel)吃不满算力,而成熟工具链几乎默认你在英伟达GPU加CUDA上干活。SLAI T-Rex给出的是一套分层优化手册,从并行策略、计算通信编排一直做到底层算子。最终34.22%的模型算力利用率(MFU)、相比开源基线配方2.93倍的提升——绝对值算不上惊艳,但在非GPU硬件上把它做上去、还保持训练稳定,才是这里真正值得记下的一笔。

报告后半段更像是佐证:团队用DeepSeek-V4-Flash搭了一条面向运筹优化(Operations Research)的领域数据管线,靠求解器验证过的合成优化文档做继续预训练和监督微调,最终这个专用模型的零样本一次通过率(Pass@1)拿到71.81%,比GPT-5.4-Mini还高出近4个百分点。但它的作用是证明这条非CUDA链路真能端到端产出一个可用模型,而不是文章主角——主角始终是那套系统工程。对担心被英伟达锁定、或不得不在受限算力里搭训练栈的团队,这份手册的参考价值高于任何单一指标;它传递的趋势是,离开GPU的前沿规模训练正从「能跑」走向「在生产里跑成」。别忘了这是技术报告,落点在工程实践和生态信号,不是一项新能力。

真正的交付物不是又一个万亿模型,而是一套非CUDA工程手册——在华为昇腾上给万亿参数MoE做全参数后训练时如何压显存、藏通信、修算子,受限算力或想规避英伟达锁定的团队值得存档34%的算力利用率、2.93倍于开源基线的提升绝对值不惊艳,但该当成「离开GPU的前沿训练正从能跑走向生产可用」的生态信号来读,而非性能纪录顺手做出的运筹优化专用模型(71.81%、压过GPT-5.4-Mini)是整条链路端到端走通的佐证,不是重点。

02 视频生成 长视频越拉越走样,缺的是一段能被训练的「记忆」

自回归视频最近这条主线叫Self Forcing——让模型在自己生成的历史上继续训练,而不是喂真实视频,从而缩小「训练时看真值、推理时看自己生成」的落差。但它留了个尾巴:早期帧写进KV cache之后就被当成冻住的只读状态,后面帧的训练信号没法反过来教前面「这段记忆到底该怎么写」。这篇的SGF用两趟训练补上这个缺口——第一趟按推理的方式跑一遍、记录中间状态,第二趟并行地把梯度接回去,让后续帧的loss去优化早期内容如何编码进缓存。它刻意不对整条串行生成做反向传播(那样几乎没法训),落点也不是又一套新架构,而是把长期被当成只读的cache变成一等的可训练信号。效果上仅用5秒训练窗口就能外推到几分钟,主体一致、背景布局和时间稳定性都比Self Forcing更稳,而这几项恰好是长视频最先崩的地方。

真正的增量是把KV cache变成可训练的「记忆写入」通路,不是新架构,理论上能叠在现有Self Forcing流程上用5秒窗口外推到几分钟,省的是长视频的训练成本,比单看质量数字更实在主体一致、时间稳定这些最先漂移的维度有改善,但目前只有作者自己的长程实验,等模型放出后值得在自己数据上验证。

03 检索 nDCG衡量单篇相关性,决定RAG上限的却是整个集合

检索评测长期有个盲区:nDCG把每篇文档单独打分再加权求和,从不追问文档彼此之间的关系。可当读检索结果的从人变成LLM和agent,决定生成质量上限的恰恰是模型拿到的整个集合——冗余、冲突、互补,nDCG一概看不见。这篇先做了个集合级评测基准SetwiseEvalKit(三层九维、约2.8万条rubric),用它测12个主流reranker,结果最好的覆盖率也不到45%,跨文档协调这类维度普遍偏弱。配套的Rubric4Setwise免训练,把rubric评分标准直接转成集合选择信号,用更少的文档和检索轮数拿到更好的下游生成。对搭RAG的团队,判断很直接:你的检索器nDCG可以很漂亮,递给模型的仍可能是个糟糕的集合。

nDCG只衡量单篇相关性,天花板其实在集合质量,检索器分数好看不代表喂给模型的集合好12个主流reranker在集合级覆盖率最高不到45%,跨文档协调是共同短板,选型别只盯单篇排序指标Rubric4Setwise免训练、有开源实现,把评测rubric直接转成选择信号,做RAG检索的可以拿来试

04 模型架构 把知识烧进模型权重,到底值不值?这次有scaling law能算

给模型注入事实这件事,第一次有了可预测的scaling law。这篇训练一个hypernetwork(超网络,专门用来生成别的网络的权重)去产出一个固定的LoRA adapter,把一批事实注入目标模型;因为「注入能力」和模型本身的通用能力被拆开,作者得以干净地测量注入效果如何随规模变化。结论是:沿着hypernetwork的深度、宽度和目标模型大小三个轴,注入效果都沿幂律平滑变化;而且在分布外(OOD,训练时没直接见过的问法)问答上,它的scaling指数比LoRA微调和全量微调都更陡。对从业者来说,真正有用的不是某个绝对分数,而是这条曲线——它让你在自己的数据和模型规模上,提前估算把知识烧进权重到底划不划算。当然这些只是摘要层面的结论,曲线的具体形状和外推边界还得看全文。

hypernetwork生成固定LoRA、把「事实注入」和「模型通用能力」解耦,这既是它区别于直接微调的地方,也是能干净测scaling的前提三个规模轴都呈可预测幂律,意味着小规模跑实验就能外推大规模该不该投,少走盲试OOD泛化上它的scaling比LoRA和全量微调更陡——规模越大越占优,但到底划不划算仍要在你自己的语料上实测。

也值得关注

05
给「操作文档」的agent做的可确定性验证基准 Agent把文档操作拆成原子维度和递增的工作流复杂度,好用来定位agent到底在哪一层出错。链接
06
给视觉语言推理造的可验证、可复现训练环境 多模态用场景语法加可执行任务程序,把「看」和「算答案」分开,让奖励可自动核验。链接
07
让latent reasoning不再只靠模仿、能往上scale 推理连续向量承载中间计算,这篇用surrogate policy把它接进强化学习的test-time scaling。链接
08
答对物理题不等于真懂物理 可解释性在开源gemma里把材料科学机制的表示读出来,还能反过来steer模型的工程行为。链接
09
给前馈式3D高斯泼溅补回场景自适应的容量分配 图像生成用自适应token扩展,把逐场景优化才有的densify能力搬进前馈管线。链接
10
无关甚至虚假的上下文会把视觉语言模型带偏 安全对齐给这种「上下文牵引」做了一套分类学探针,把牵引类型拆开来测。链接
11
用Arma3游戏引擎造同步的多视角RGB-热成像数据 多模态绕开真实空中数据集视角受限、标注贵的老问题。链接
12
让激活解释逐条可验证 可解释性基于重建的解释对单条虚假声明天然不敏感,改用可解码性监督来堵这个洞。链接

今日观察

今天有两篇论文正好押在同一个问题的两端——知识到底该放在哪。《Beyond Relevance-Centric Retrieval》押「留在外面」:不动模型,转而治理它推理时读到的那个文档集合;Hypernetwork知识注入押「烧进权重」:训一个hypernetwork生成LoRA,把事实直接写进参数。

值得记下的不是「知识很重要」这种废话,而是这两条相反的路其实标出了一条可操作的取舍轴:一个事实越易变、越少被反复查,就越该留在外部,靠检索和集合治理随时替换;越稳定、越高频被查,把它烧进权重才有机会把注入的一次性成本摊薄。两端各有各的账,谁也没有全面胜出。

所以别急着站队。做架构选择时,先把你要灌进去的知识按「变更频率×查询频率」分个类:高频又稳定的那部分,是注入的候选;易变又低频的那部分,继续留给检索——很可能同一个系统里两条路各管一段,而不是二选一。