
|
arXiv / DEV 新作 SMELT:循环半数中间层两次,计算匹配下优于把模型做大
一句话:9 月 1 日,arXiv 论文 SMELT(计算匹配 MoE 循环 Transformer 缩放律)发现:在计算/参数/缓存相等前提下,循环中间半数层两次,可获中个位数到高双位数百分比的推理节省,且随算力预算增大而增大。
背景
2026 年 9 月 1 日提交的 arXiv 论文《SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers》补齐了「循环层(weight tying/looping)」一直缺失的公平对比:它在每 token 算力、非嵌入参数量、缓存大小都与普通模型对齐的条件下,测量 looping 实际带来的收益。结论:最佳配置是只循环中间半数层、且循环两次(而非整栈),实验扩展到 540 亿非嵌入参数,推理节省从中个位数到高双位数百分比,且随预算增大而增大。第二次经过循环块时,MoE 路由器保留核心专家、多样化调用其他专家,残差流写入更大更新——像一次 refinement 而非重复。增益集中在结构化数据、代码、长样本与上下文学习。
核心要点
- SMELT:计算匹配 MoE 循环 Transformer 缩放律
- 最佳:只循环中间半数层、两次
- 公平对齐:每 token 算力/参数/缓存相等
- 节省:中个位数→高双位数百分比
- 增益随算力预算增大而增大
- 增益区:结构化数据/代码/长样本/ICL
为什么重要
在匹配算力下、真实规模上,把推理移入潜在循环(latent loop)确实更优且随投入增大而取胜——这为「 recurrent depth / 循环深度」架构(如 Astra 被报道采用的思路)提供了缩放律支撑,也提示推理成本可借架构而非仅堆参数下降。但循环内部不产生可读 token,带来可监控性成本。
关键事实速记
- 提交:2026-09-01
- 论文:SMELT(arXiv 2609)
- 配置:中间半数层×2
- 规模:54B 非嵌入参数
- 节省:中个位数→高双位数 %
- 注意:潜在循环可监控性成本
← 返回资讯列表
AI8899 · 内容仅供学习参考