今日概览
- 效率不是事后蒸馏挤出来的:Mage-Flow把tokenizer和backbone当一对互相迁就的部件协同设计,4B量级、单卡A100、Turbo变体1024²下0.59秒出一张图,把文生图加指令编辑拉进可自托管、可微调的区间。
- 用模型自己的语言下动作指令,Masked Visual Actions把动作写成像素空间里一条部分露出的轨迹,省掉外挂的动作编码器,一个checkpoint既能做前向动力学预测、也能反推机械臂动作。
- 成功和失败的样本不该共用一套监督:H²SD让privileged teacher的角色随轨迹结果切换——对的复用自身推理路径只调credit,错的才引入verifier参考做纠偏蒸馏。
重点关注
01 图像生成 效率不是蒸馏挤出来的,是从接口处一起定的
大多数图像模型的效率优化是事后的:先把大模型训好,再靠蒸馏压出个快的版本。Mage-Flow换了顺序——它把tokenizer和backbone当成一对要互相迁就的部件来设计。轻量的Mage-VAE用一步式扩散做编解码,把latent tokenizer的开销砍掉一个数量级还保住了重建质量;DiT这边用rectified flow(一种把生成路径拉直的训练方式)直接吃原生分辨率,不用先缩放再补回来。两头对齐再加上CUDA kernel融合,端到端训练吞吐提升约2.5倍。对从业者真正的价值不在某个benchmark数字,而在4B这个量级:文生图加指令编辑打包进一个能自己微调、单卡A100就能跑的盘子里,Turbo变体在1024²分辨率下生成一张图0.59秒、编辑1.02秒。需要保留的一点是:摘要只说了和公开模型「competitive」,没给和闭源系统的硬对比,所以「高保真」这个说法先打个折,等全文或实测再下结论。
原文:Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
02 机器人 怎么把「动作」说给一个只看过视频的模型听?
视频模型看了海量画面,学到了世界怎么动、物体接触时怎么响应,但它不懂「机械臂关节转多少度」这种控制指令。常规做法是在模型外面挂一个单独的动作编码器做翻译,Masked Visual Actions换了个思路:把动作直接写成像素空间里一条只露出一部分的轨迹,让控制信号回到模型当初学交互先验时所在的那个视觉空间里。这个设计带来一个附赠的好处——露出机器人自己的运动,模型就当前向动力学模型用,预测场景会怎么变;露出想要的物体运动,同一个模型反过来推出该怎么动机械臂才能实现。整套只用15小时的掩码样本微调,一个checkpoint就能跨场景、跨不同机器人本体工作,下游还能给候选未来排序辅助规划。数字层面(HF热度仅4个upvote,也只放出了相关性而非硬指标)还需要看全文和真机实验确认,但「用模型自己的语言下指令」这个方向本身值得做world model的团队留意。
原文:Masked Visual Actions for Unified World Modeling
03 训练优化 成功和失败的样本,凭什么要用同一套监督方式?
RLVR训练推理模型有个绕不开的粗糙之处:一整条几十步的轨迹跑完,回来的只是一个「对/错」的标量,token级的决策拿不到细粒度反馈。现有的self-distillation(自蒸馏)思路是加一个privileged teacher(掌握额外信息的教师)来补充监督,但通常给它一个从头到尾固定的角色。H²SD的动作不在于换了个更强的teacher,而在于让teacher的角色随轨迹结果切换:对成功的样本,直接拿它自己已经跑对的推理路径当上下文,只重新评估原有token、微调credit分配的力度,不改奖励方向;对失败的样本,才引入verifier确认过的参考提示,用reverse-KL做纠偏蒸馏。价值就落在「角色不固定」这一个自由度上——成功不该被外部理由覆盖,失败才需要外部纠正,这个区分本身是合理的。论文的ablation说增益确实来自这个按结果分流的机制,但具体提升幅度和是否只在特定benchmark上成立,得看全文才能判断。

也值得关注
今日观察
Masked Visual Actions和Appearance Pointers做的事表面毫不相干:一个给视频世界模型下动作指令,一个给图像DiT做区域控制。但它们对「控制信号该写在哪一层」给出了同一个答案——都放弃了继续在文字提示上加码,转而把指令退回到生成模型本来就住着的视觉/空间域里去表达:一个用像素轨迹,一个用区域指针。背后是同一个默认前提被摊开来质疑了:自然语言其实是个有损的控制通道,能描述意图,却传不动「这条边缘往哪走」「这块材质归谁」这种精确的空间信息。如果你在做可控生成,这意味着控制接口的重心正从「更会写prompt」往「在像素/空间层直接指」迁移。具体一点:下次遇到prompt怎么调都够不着的精细控制需求,别急着堆提示词工程,先问一句这个控制信号能不能画在图上、标在区域里,用模型的原生模态喂进去,往往比在文字层继续绕更省力。