
资讯
论文《Post-Training Leaves Behavioral Shadows》:单字即可蒸馏出能力
一句话:9 月 24 日 arXiv 论文发现训练后会在无关决策上留下「行为阴影」,并提出仅用教师单个词即可实现能力迁移的主动无任务蒸馏(ATD)。
背景
- 后训练常通过任务特定数据提升能力,但信息可能经无关生成悄悄传递,带来隐式能力与偏好泄漏。
核心要点
- 论文发现语言模型可经任务无关文本传递能力,提出「主动无任务蒸馏(ATD)」。
- ATD 每提示仅用教师一个词,无需目标任务样例、教师 logits 或参数即可迁移能力。
- 主实验(Qwen2.5-1.5B)以 5664 对词在 HumanEval+ 上较匹配对照 +5.34pp。
- 功能性分析显示所学阴影可组合,其强度跟踪教师更新强度。
为什么重要
- 揭示后训练的能力泄漏机制,对模型安全审计与「无意能力转移」的治理具有方法与风险双重意义。
关键事实速记
- 论文:arXiv 2609.29233(2026-09-24)
- 方法:主动无任务蒸馏 ATD
- 数据:每提示仅 1 个教师词
- 增益:HumanEval+ +5.34pp
📂 原文链接:查看原文 →
← 返回资讯列表
AI8899 · 内容仅供学习参考