
资讯
Lightning Weave:用能力组合逼近推理的「准确率-效率」前沿
一句话:9 月 13 日 arXiv 论文《Lightning Weave》提出后训练框架,通过组合多个独立后训练模型「习得的能力」,在单一学生模型中同时提升推理准确率与效率。
背景
- 高效推理的核心矛盾是准确率与推理成本难以兼得;Lightning Weave 用「能力组合」而非单纯蒸馏,给出新的 Pareto 前沿解法。
核心要点
- 将每个专家模型的能力表示为「训练前后策略偏移(log-ratio)」。
- 在共享学生 token 状态对齐并组合这些偏移,无需匹配模型参数。
- Tilted-Target DOPD 将缓存信号转为稳定学习目标,避免离线组合的目标漂移。
- 在 Qwen3.5-4B 上:HMMT 2025 从 59.2%→64.0%(少 10.7% token),LiveCodeBench v5 从 41.7%→54.2%(少 9.6% token)。
为什么重要
- 提供「能力组合」这一高效推理新路径,缓解准确率与推理成本的两难。
- 离线缓存 + 单次训练的设计,使多教师信号可低成本复用。
关键事实速记
- 论文:2026-09-13(arXiv 2609.14708)
- 方法:能力组合 / 策略偏移
- 收益:+准确率 且 -token
- 基座:Qwen3.5-4B
📂 原文链接:查看原文 →
← 返回资讯列表
AI8899 · 内容仅供学习参考