今日概览
- 万亿参数MoE的全参数后训练,第一次端到端跑在华为昇腾而非GPU上——真正的交付物是一套非CUDA工程手册(压显存、藏通信、修算子);34%的算力利用率不算惊艳,信号却清楚:离开GPU的前沿训练正从「能跑」走向「生产可用」。
- 长视频越拉越走样,缺的是一段能被训练的「记忆」:SGF用两趟训练,把一直被当成只读的KV cache变成可训练信号,5秒窗口就能外推到几分钟,主体一致和时间稳定这些最先崩的维度都更稳。
- nDCG衡量单篇相关性,决定RAG上限的却是整个集合。12个主流reranker在集合级覆盖率最高不到45%,跨文档协调是共同短板;配套的Rubric4Setwise免训练,用更少的文档换来更好的下游生成。
- 知识注入第一次有了可预测的scaling law,hypernetwork生成固定LoRA把事实烧进权重,沿深度、宽度、模型大小三个轴都呈幂律,OOD问答上的scaling比LoRA和全量微调更陡。
重点关注
01 训练优化 万亿参数MoE的全参数后训练,这次端到端跑在华为昇腾上
这份报告的看点,是有人在非英伟达硬件上把万亿参数级混合专家(MoE)模型的全参数后训练端到端跑成了——用的是华为昇腾NPU集群。这类训练本身就是系统工程难题:显存压不住、通信和计算重叠不起来、底层算子(kernel)吃不满算力,而成熟工具链几乎默认你在英伟达GPU加CUDA上干活。SLAI T-Rex给出的是一套分层优化手册,从并行策略、计算通信编排一直做到底层算子。最终34.22%的模型算力利用率(MFU)、相比开源基线配方2.93倍的提升——绝对值算不上惊艳,但在非GPU硬件上把它做上去、还保持训练稳定,才是这里真正值得记下的一笔。
报告后半段更像是佐证:团队用DeepSeek-V4-Flash搭了一条面向运筹优化(Operations Research)的领域数据管线,靠求解器验证过的合成优化文档做继续预训练和监督微调,最终这个专用模型的零样本一次通过率(Pass@1)拿到71.81%,比GPT-5.4-Mini还高出近4个百分点。但它的作用是证明这条非CUDA链路真能端到端产出一个可用模型,而不是文章主角——主角始终是那套系统工程。对担心被英伟达锁定、或不得不在受限算力里搭训练栈的团队,这份手册的参考价值高于任何单一指标;它传递的趋势是,离开GPU的前沿规模训练正从「能跑」走向「在生产里跑成」。别忘了这是技术报告,落点在工程实践和生态信号,不是一项新能力。
原文:SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
02 视频生成 长视频越拉越走样,缺的是一段能被训练的「记忆」
自回归视频最近这条主线叫Self Forcing——让模型在自己生成的历史上继续训练,而不是喂真实视频,从而缩小「训练时看真值、推理时看自己生成」的落差。但它留了个尾巴:早期帧写进KV cache之后就被当成冻住的只读状态,后面帧的训练信号没法反过来教前面「这段记忆到底该怎么写」。这篇的SGF用两趟训练补上这个缺口——第一趟按推理的方式跑一遍、记录中间状态,第二趟并行地把梯度接回去,让后续帧的loss去优化早期内容如何编码进缓存。它刻意不对整条串行生成做反向传播(那样几乎没法训),落点也不是又一套新架构,而是把长期被当成只读的cache变成一等的可训练信号。效果上仅用5秒训练窗口就能外推到几分钟,主体一致、背景布局和时间稳定性都比Self Forcing更稳,而这几项恰好是长视频最先崩的地方。
原文:Self Gradient Forcing: Native Long Video Extrapolation
03 检索 nDCG衡量单篇相关性,决定RAG上限的却是整个集合
检索评测长期有个盲区:nDCG把每篇文档单独打分再加权求和,从不追问文档彼此之间的关系。可当读检索结果的从人变成LLM和agent,决定生成质量上限的恰恰是模型拿到的整个集合——冗余、冲突、互补,nDCG一概看不见。这篇先做了个集合级评测基准SetwiseEvalKit(三层九维、约2.8万条rubric),用它测12个主流reranker,结果最好的覆盖率也不到45%,跨文档协调这类维度普遍偏弱。配套的Rubric4Setwise免训练,把rubric评分标准直接转成集合选择信号,用更少的文档和检索轮数拿到更好的下游生成。对搭RAG的团队,判断很直接:你的检索器nDCG可以很漂亮,递给模型的仍可能是个糟糕的集合。
原文:Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking
04 模型架构 把知识烧进模型权重,到底值不值?这次有scaling law能算
给模型注入事实这件事,第一次有了可预测的scaling law。这篇训练一个hypernetwork(超网络,专门用来生成别的网络的权重)去产出一个固定的LoRA adapter,把一批事实注入目标模型;因为「注入能力」和模型本身的通用能力被拆开,作者得以干净地测量注入效果如何随规模变化。结论是:沿着hypernetwork的深度、宽度和目标模型大小三个轴,注入效果都沿幂律平滑变化;而且在分布外(OOD,训练时没直接见过的问法)问答上,它的scaling指数比LoRA微调和全量微调都更陡。对从业者来说,真正有用的不是某个绝对分数,而是这条曲线——它让你在自己的数据和模型规模上,提前估算把知识烧进权重到底划不划算。当然这些只是摘要层面的结论,曲线的具体形状和外推边界还得看全文。
原文:Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models
也值得关注
今日观察
今天有两篇论文正好押在同一个问题的两端——知识到底该放在哪。《Beyond Relevance-Centric Retrieval》押「留在外面」:不动模型,转而治理它推理时读到的那个文档集合;Hypernetwork知识注入押「烧进权重」:训一个hypernetwork生成LoRA,把事实直接写进参数。
值得记下的不是「知识很重要」这种废话,而是这两条相反的路其实标出了一条可操作的取舍轴:一个事实越易变、越少被反复查,就越该留在外部,靠检索和集合治理随时替换;越稳定、越高频被查,把它烧进权重才有机会把注入的一次性成本摊薄。两端各有各的账,谁也没有全面胜出。
所以别急着站队。做架构选择时,先把你要灌进去的知识按「变更频率×查询频率」分个类:高频又稳定的那部分,是注入的候选;易变又低频的那部分,继续留给检索——很可能同一个系统里两条路各管一段,而不是二选一。