KGD提升推荐4%—12%,3D编辑语料达1200万

今日概览

  • KGD把知识更新与任务适配分开,在8个公开基准上较强基线提升4%—12%,并在90天数据流和Shopee线上测试中保持收益。
  • 持久记忆不等于持续改进:PAST-Bench用26个场景、204个任务回合,检验经验是否通过保存、检索和更新真正改善后续行为。
  • Hunyuan3D-Buffalo统一3D理解、生成与编辑。其8700万规模多模态语料包含1200万编辑样本,重点推进几何一致的局部修改与工作流整合。

重点关注

01 训练优化 KGD的知识—几何解耦刷新路径

持续预训练不仅要追上用户行为变化,还要避免新知识在迁移时破坏下游任务已经学好的表示结构。KGD把两者分开管理:可刷新的编码器负责沉淀行为知识,任务模型则通过只读交叉注意力取用这些知识,并单独校准自己的表示几何。训练目标也做了清理——行为多词元预测只保留协同或语义相关的未来商品作为监督,减少把无关会话间的相邻点击误当成依赖关系。摘要报告称,该方法在8个公开基准上比强基线提升4%—12%,并在90天生产数据流中保持优势,而对比方法没有获得增益。Shopee线上A/B测试还显示,首页搜索的人均GMV提升1.75%,广告收入提升1.53%。这些数字说明「知识与任务适配分离」具有工程价值,但模型刷新频率、训练与存储成本,以及各模块的具体贡献仍需看全文确认。

持续预训练系统应把知识更新与下游表示适配分开,避免每次刷新都冲击已有任务行为序列监督需要过滤跨会话伪关联,不能简单把相邻点击都当成依赖评估刷新方案时,应优先观察长期数据流和线上收益,而非只看一次离线提升

02 评测 记得更多,不代表个人Agent会越用越好

持久记忆常被视为个人Agent持续进化的基础,但保存偏好、历史和技能,只能证明它留住了信息。PAST-Bench通过26个场景、204个任务回合,在开启与关闭经验保留的匹配条件下,检验后续行为是否真的改善。更关键的是,它还追踪提升是否来自预期的「保存、检索、更新」路径:在7个基础模型和4种Agent框架中,相似的表面增益背后,证据可能截然不同。研究据此为Hermes加入5项针对性干预,尤其改善了替换过时状态的任务,但效果仍取决于具体能力和模型。对构建长期运行Agent的团队来说,评测重点应从「记住多少」转向「经验是否稳定改变未来行为」。

不要把持久记忆直接等同于自我改进纵向评测应同时检查后续增益及其保存、检索、更新链路选择记忆方案时要按具体能力和模型验证,平均分不足以说明问题

03 多模态 Hunyuan3D-Buffalo:统一3D理解、生成与编辑

做3D资产,生成一个对象只是开始;能否读懂部件、按指令局部修改并保持其余区域稳定,才决定模型能不能进入实际工作流。Hunyuan3D-Buffalo 1.0把3D理解、文生3D、指令编辑和指定部件生成放进同一架构,让理解模块提供语义与空间条件,再由扩散模型完成生成或修改。为补上最稀缺的编辑数据,团队构建了8700万规模的多模态语料,其中包括1200万编辑样本;摘要还称,生成与理解能力都会反过来改善编辑效果。真正值得关注的不是又一个单项榜单领先,而是3D工具开始从彼此割裂的模型走向统一接口。它更像工作流整合的重要进展,距离解决几何质量、复杂指令可靠性和生产级可控性仍有多远,还需要看全文与真实项目验证。

评估3D模型时,应同时检查理解、生成和局部编辑能力几何一致的编辑数据可能成为统一3D模型的关键壁垒现阶段可关注工作流整合价值,不宜把榜单领先等同于3D生成难题已经解决
KGD提升推荐4%—12%,3D编辑语料达1200万

也值得关注

04
把世界模型从物理未来预测扩展为Agent行动前可查询、可控且低成本的交互反馈代理。 AgentQuo Vadis, World Modeling?讨论如何降低真实环境交互的成本、延迟与风险。链接
05
最自信的教师信号也可能只是语言先验或格式模板,蒸馏筛选需要识别与任务输入无关的伪信号。 训练优化该研究提出面向伪信号的On-Policy Distillation方法。链接
06
视频深度研究暴露两种评测幻觉:Agent绕开视觉工具,以及用参数记忆冒充真实检索执行。 多模态Video-DeepResearch面向连续视频流与开放网络探索构建评测。链接
07
MoE扩散语言模型的最优批量、学习率与算力分配不能照搬自回归模型,扩展规律需要重新测量。 模型架构LLaDA MoE v2系统研究MoE扩散语言模型的规模化行为。链接
08
Any-OPD尝试跨越不同VAE潜空间、架构和时间步,把异构教师接入流匹配模型蒸馏。 图像生成其核心是通过表示空间桥接解决师生模型「语言」不一致的问题。链接
09
技能库不断增长未必带来能力演化,动态基准开始检查新技能能否复用、组合并改善后续任务。 评测ContinualSkillBench面向Agent技能持续扩充后的实际能力变化。链接
10
Transformer主体量化后,高精度LM输出头仍可能成为隐藏成本,ARCHead专门压缩这块部署尾巴。 推理加速方法利用激活度量残差校正处理输出头量化。链接
11
统一比较多语言在形态、句法、语义与语用层面的历史变化,可以检验这些层次是否同步演化。 评测ChronoLens提供跨时间、语言和语言学层次的测量视角。链接

今日观察

KGD、PAST-Bench与ContinualSkillBench共同划出了一条适用于长期运行系统的审计边界:存储、刷新或扩充知识只是中间动作,不能直接作为能力增长的证据。真正需要分别验证的是,旧知识能否在表示变化后继续迁移,以及新增知识是否给后续行为带来可归因的增益。前者要求追踪历史能力的保留与复用,后者需要通过匹配对照或消融排除模型本身、检索路径和任务波动等替代解释;与此同时,还要单独记录新知识对既有能力造成的负迁移。下一次模型刷新或技能写入时,应固定一组历史任务和未刷新对照组,并把保留率、复用增益与负迁移率设为上线门槛。