
资讯
论文《Encoded but Not Decoded》:揭示大模型句法的三层鸿沟
一句话:9 月 24 日 arXiv 论文用三层评估框架(行为 / LM-head 读出 / 探针可恢复)揭示大模型「编码了但没解码」的句法鸿沟。
背景
- 行为测试只能判断模型「答没答对」,无法区分是「没编码」还是「编码了但没用出来」,句法能力的真相被低估。
核心要点
- 论文提出三层框架:行为部署、LM-head 读出、探针可恢复,在同条目同二值决策下度量。
- 在三语种、七模型上,探针可恢复 ≥ LM-head 读出 ≥ 行为部署,恢复盈余恒非负。
- 最大鸿沟(0.653)出现在 Qwen3-0.6B Instruct 的问答任务,且集中于主语控制。
- 激活补丁显示鸿沟定位于特定层;指令微调使 LM-head 解码层比探针解码层晚约十层。
为什么重要
- 行为评估低估模型真正编码的内容、探针又高估其部署能力,为可解释性与对齐评测提供更细的判据。
关键事实速记
- 论文:arXiv 2609.29848(2026-09-24)
- 框架:行为 / LM-head / 探针 三层
- 最大鸿沟:0.653(Qwen3-0.6B)
- 发现:编码≠解码,鸿沟定层
📂 原文链接:查看原文 →
← 返回资讯列表
AI8899 · 内容仅供学习参考