← 资讯列表
资讯

论文《Post-Training Leaves Behavioral Shadows》:单字即可蒸馏出能力

📅 2026/9/24 08:00:00👁 1 阅读⏱ 约 3 分钟

一句话:9 月 24 日 arXiv 论文发现训练后会在无关决策上留下「行为阴影」,并提出仅用教师单个词即可实现能力迁移的主动无任务蒸馏(ATD)。

背景

  • 后训练常通过任务特定数据提升能力,但信息可能经无关生成悄悄传递,带来隐式能力与偏好泄漏。

核心要点

  • 论文发现语言模型可经任务无关文本传递能力,提出「主动无任务蒸馏(ATD)」。
  • ATD 每提示仅用教师一个词,无需目标任务样例、教师 logits 或参数即可迁移能力。
  • 主实验(Qwen2.5-1.5B)以 5664 对词在 HumanEval+ 上较匹配对照 +5.34pp。
  • 功能性分析显示所学阴影可组合,其强度跟踪教师更新强度。

为什么重要

  • 揭示后训练的能力泄漏机制,对模型安全审计与「无意能力转移」的治理具有方法与风险双重意义。

关键事实速记

  • 论文:arXiv 2609.29233(2026-09-24)
  • 方法:主动无任务蒸馏 ATD
  • 数据:每提示仅 1 个教师词
  • 增益:HumanEval+ +5.34pp

📂 原文链接:查看原文 →

← 返回资讯列表 AI8899 · 内容仅供学习参考