← 资讯列表
资讯

Lightning Weave:用能力组合逼近推理的「准确率-效率」前沿

📅 2026/9/13 08:00:00👁 1 阅读⏱ 约 3 分钟

一句话:9 月 13 日 arXiv 论文《Lightning Weave》提出后训练框架,通过组合多个独立后训练模型「习得的能力」,在单一学生模型中同时提升推理准确率与效率。

背景

  • 高效推理的核心矛盾是准确率与推理成本难以兼得;Lightning Weave 用「能力组合」而非单纯蒸馏,给出新的 Pareto 前沿解法。

核心要点

  • 将每个专家模型的能力表示为「训练前后策略偏移(log-ratio)」。
  • 在共享学生 token 状态对齐并组合这些偏移,无需匹配模型参数。
  • Tilted-Target DOPD 将缓存信号转为稳定学习目标,避免离线组合的目标漂移。
  • 在 Qwen3.5-4B 上:HMMT 2025 从 59.2%→64.0%(少 10.7% token),LiveCodeBench v5 从 41.7%→54.2%(少 9.6% token)。

为什么重要

  • 提供「能力组合」这一高效推理新路径,缓解准确率与推理成本的两难。
  • 离线缓存 + 单次训练的设计,使多教师信号可低成本复用。

关键事实速记

  • 论文:2026-09-13(arXiv 2609.14708)
  • 方法:能力组合 / 策略偏移
  • 收益:+准确率 且 -token
  • 基座:Qwen3.5-4B

📂 原文链接:查看原文 →

← 返回资讯列表 AI8899 · 内容仅供学习参考