技能熵让Qwen3-4B升至68.4%

今日概览

  • 技能熵让Qwen3-4B得分从34.4%升至68.4%:长链任务的瓶颈不仅是单项技能,还包括技能切换时能否正确传递中间结果。
  • 多模态统一越早启动越有效,受控实验显示延迟融合可能造成「视觉惰性」,训练决策需要从经验配方转向可验证证据。
  • 用户画像中35%—49%的陈述属于过度推断。模型自我监控也可能失灵,个性化产品应将记忆内容与证据来源分开验收。

重点关注

01 推理 模型会做数学也会规划,却可能输在切换那一刻

现有评测容易掩盖一个关键变量:模型单项能力都不错,不代表它能在数学推导、规划等技能之间顺利切换,并把中间结果正确交给下一步。研究者用「技能熵」量化这种切换复杂度,并基于558种技能、9个领域构建跨技能长链评测;测试8个前沿模型和4个开源模型后,任务熵越高,准确率越低。更有意思的是,这个指标不只用于诊断,还能直接变成训练信号:模型每一步既要回答,也要预测自己正在使用什么技能,再依据答案正确性和技能序列的一致性获得奖励。在Qwen3-4B-Instruct上,得分从34.4%升至68.4%;1.7B版本也从14.6%升至40.1%,提升幅度相当醒目。它为跨技能切换难度提供了独立指标,让团队能在最终成功率之外看到技能衔接问题;是否能进一步定位单项能力短板,仍需结合单技能评测验证。对训练Agent或复杂工作流的团队来说,这类独立指标比笼统统计最终成功率更有价值,不过方法能否迁移到更多真实任务仍需看全文和进一步验证。

评估长链任务时应单独检查技能切换,而不只看最终答案技能熵能量化跨技能切换难度,并补充单项技能评测未覆盖的信息将技能序列纳入奖励,可能显著提升小模型在该跨技能长链基准上的得分

02 多模态 多模态预训练,该从「配方玄学」毕业了

统一多模态预训练长期依赖零散配方:数据怎么混、模块怎么共享、视觉何时接入,往往先看结果再解释。这项工作用受控实验拆解训练决策,发现数据复杂度会影响模态之间究竟是协同还是竞争,而共享注意力与归一化、保留模态专属前馈层可能更利于协同。训练次序同样关键:越早统一视觉与语言越有效,延迟融合会出现「视觉惰性」,让模型更多依赖语言先验。作者还声称以5%的计算预算获得较强生成表现,并在13.5B参数的混合专家模型和2T token规模上验证规律。方向值得重视,但摘要没有给出完整基线和任务明细,所谓效率收益与跨场景普适性仍需看全文确认。

设计多模态训练时,应先验证数据条件下是协同还是竞争早期联合训练可能比后期对齐更能迫使模型真正使用视觉5%计算预算的结论有吸引力,但落地前需核对基线与适用任务

03 安全对齐 自称没乱猜的模型,可能猜得更多

个性化系统更隐蔽的风险,不是忘记用户,而是把无证据的猜测悄悄写进用户画像。MirageBench评测12个模型后发现,每个模型都有35%—49%的陈述属于过度推断,且多轮对话中这些属性近似线性累积、很少被修正。更值得警惕的是,模型自称「很少过度推断」并不可靠:自评与外部评测呈负向排名相关,但该结果仅来自12个模型,置信区间也跨过零,暂时更适合作为预警而非定论。模型的自我审查对筛查自身陈述尚有一定作用,却不适合拿来比较不同模型谁更可信。做个性化产品时,「记住了什么」和「有什么证据」应当分开验收,并由外部机制核验推断属性。

用户画像中的推断项必须与明确事实分开存储不要用模型自评作为个性化安全的主要选型指标多轮记忆会累积未经证实的属性,需要持续核验和纠错
技能熵让Qwen3-4B升至68.4%

也值得关注

04
OneDayAgent把目标漂移、状态丢失和上下文溢出纳入同一长时程执行框架 Agent用于检验Agent基础设施能否跨模型后端稳定工作。链接
05
HelloWorld让视频世界中的角色开始面向用户作出社交回应 视频生成交互对象由场景本身扩展到了场景内角色。链接
06
FocusMem将GUI轨迹记忆拆成内容、读取和可信度三个问题 Agent避免由固定潜在记忆块承担全部决策需求。链接
07
ABSeeker从最终答案反向追踪真正有贡献的搜索步骤 检索长链检索训练不再平均奖励正确、冗余与错误动作。链接
08
ToolArtist把推理、外部工具调用和图像生成交给模型统一调度 图像生成探索开放世界图像任务摆脱预设工作流的可能性。链接
09
NOLLI用难度校准的双语谜题定位英韩能力差距 评测可复现题目有助于排除两种语言题目难度不同造成的干扰。链接
10
K-EXAONE 2.0从既有模型增量扩展至750B总参数 模型架构其MoE每个token激活约37B参数,提供了不从零训练的规模升级路线。链接
11
ContextMaster在固定预算内动态路由多镜头创作所需的信息 视频生成同一框架覆盖生成、参考跟随与编辑等连续工作流。链接

今日观察

Skill Entropy、OneDayAgent、FocusMem与ABSeeker指向同一个工程问题:长时程能力的关键不只是容纳更多内容,而是显式管理不同环节之间的边界。技能发生切换时,需要检查中间结果是否被正确传递;任务跨环境执行时,需要持续保存目标与状态;读取压缩记忆时,需要估计内容的可信度;训练搜索策略时,则要区分每一步对最终答案的真实贡献。如果这些边界没有独立记录,同一个失败很容易被笼统归为「推理不足」,真正需要修复的技能接口、状态恢复、记忆读取或奖励分配问题反而不可见。下一轮Agent评测应为技能切换、跨环境状态、记忆可信度和步骤贡献分别建立日志字段与失败指标,再将它们关联到最终成功率。