← 资讯列表
资讯

论文《Encoded but Not Decoded》:揭示大模型句法的三层鸿沟

📅 2026/9/24 08:00:00👁 1 阅读⏱ 约 3 分钟

一句话:9 月 24 日 arXiv 论文用三层评估框架(行为 / LM-head 读出 / 探针可恢复)揭示大模型「编码了但没解码」的句法鸿沟。

背景

  • 行为测试只能判断模型「答没答对」,无法区分是「没编码」还是「编码了但没用出来」,句法能力的真相被低估。

核心要点

  • 论文提出三层框架:行为部署、LM-head 读出、探针可恢复,在同条目同二值决策下度量。
  • 在三语种、七模型上,探针可恢复 ≥ LM-head 读出 ≥ 行为部署,恢复盈余恒非负。
  • 最大鸿沟(0.653)出现在 Qwen3-0.6B Instruct 的问答任务,且集中于主语控制。
  • 激活补丁显示鸿沟定位于特定层;指令微调使 LM-head 解码层比探针解码层晚约十层。

为什么重要

  • 行为评估低估模型真正编码的内容、探针又高估其部署能力,为可解释性与对齐评测提供更细的判据。

关键事实速记

  • 论文:arXiv 2609.29848(2026-09-24)
  • 框架:行为 / LM-head / 探针 三层
  • 最大鸿沟:0.653(Qwen3-0.6B)
  • 发现:编码≠解码,鸿沟定层

📂 原文链接:查看原文 →

← 返回资讯列表 AI8899 · 内容仅供学习参考