今日概览
- KGD把知识更新与任务适配分开,在8个公开基准上较强基线提升4%—12%,并在90天数据流和Shopee线上测试中保持收益。
- 持久记忆不等于持续改进:PAST-Bench用26个场景、204个任务回合,检验经验是否通过保存、检索和更新真正改善后续行为。
- Hunyuan3D-Buffalo统一3D理解、生成与编辑。其8700万规模多模态语料包含1200万编辑样本,重点推进几何一致的局部修改与工作流整合。
重点关注
01 训练优化 KGD的知识—几何解耦刷新路径
持续预训练不仅要追上用户行为变化,还要避免新知识在迁移时破坏下游任务已经学好的表示结构。KGD把两者分开管理:可刷新的编码器负责沉淀行为知识,任务模型则通过只读交叉注意力取用这些知识,并单独校准自己的表示几何。训练目标也做了清理——行为多词元预测只保留协同或语义相关的未来商品作为监督,减少把无关会话间的相邻点击误当成依赖关系。摘要报告称,该方法在8个公开基准上比强基线提升4%—12%,并在90天生产数据流中保持优势,而对比方法没有获得增益。Shopee线上A/B测试还显示,首页搜索的人均GMV提升1.75%,广告收入提升1.53%。这些数字说明「知识与任务适配分离」具有工程价值,但模型刷新频率、训练与存储成本,以及各模块的具体贡献仍需看全文确认。
原文:Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation
02 评测 记得更多,不代表个人Agent会越用越好
持久记忆常被视为个人Agent持续进化的基础,但保存偏好、历史和技能,只能证明它留住了信息。PAST-Bench通过26个场景、204个任务回合,在开启与关闭经验保留的匹配条件下,检验后续行为是否真的改善。更关键的是,它还追踪提升是否来自预期的「保存、检索、更新」路径:在7个基础模型和4种Agent框架中,相似的表面增益背后,证据可能截然不同。研究据此为Hermes加入5项针对性干预,尤其改善了替换过时状态的任务,但效果仍取决于具体能力和模型。对构建长期运行Agent的团队来说,评测重点应从「记住多少」转向「经验是否稳定改变未来行为」。
原文:PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
03 多模态 Hunyuan3D-Buffalo:统一3D理解、生成与编辑
做3D资产,生成一个对象只是开始;能否读懂部件、按指令局部修改并保持其余区域稳定,才决定模型能不能进入实际工作流。Hunyuan3D-Buffalo 1.0把3D理解、文生3D、指令编辑和指定部件生成放进同一架构,让理解模块提供语义与空间条件,再由扩散模型完成生成或修改。为补上最稀缺的编辑数据,团队构建了8700万规模的多模态语料,其中包括1200万编辑样本;摘要还称,生成与理解能力都会反过来改善编辑效果。真正值得关注的不是又一个单项榜单领先,而是3D工具开始从彼此割裂的模型走向统一接口。它更像工作流整合的重要进展,距离解决几何质量、复杂指令可靠性和生产级可控性仍有多远,还需要看全文与真实项目验证。

也值得关注
今日观察
KGD、PAST-Bench与ContinualSkillBench共同划出了一条适用于长期运行系统的审计边界:存储、刷新或扩充知识只是中间动作,不能直接作为能力增长的证据。真正需要分别验证的是,旧知识能否在表示变化后继续迁移,以及新增知识是否给后续行为带来可归因的增益。前者要求追踪历史能力的保留与复用,后者需要通过匹配对照或消融排除模型本身、检索路径和任务波动等替代解释;与此同时,还要单独记录新知识对既有能力造成的负迁移。下一次模型刷新或技能写入时,应固定一组历史任务和未刷新对照组,并把保留率、复用增益与负迁移率设为上线门槛。