← 资讯列表
|

arXiv / DEV 新作 SMELT:循环半数中间层两次,计算匹配下优于把模型做大

📅 2026/9/1 08:00:00👁 1 阅读⏱ 约 4 分钟

一句话:9 月 1 日,arXiv 论文 SMELT(计算匹配 MoE 循环 Transformer 缩放律)发现:在计算/参数/缓存相等前提下,循环中间半数层两次,可获中个位数到高双位数百分比的推理节省,且随算力预算增大而增大。

背景

2026 年 9 月 1 日提交的 arXiv 论文《SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers》补齐了「循环层(weight tying/looping)」一直缺失的公平对比:它在每 token 算力、非嵌入参数量、缓存大小都与普通模型对齐的条件下,测量 looping 实际带来的收益。结论:最佳配置是只循环中间半数层、且循环两次(而非整栈),实验扩展到 540 亿非嵌入参数,推理节省从中个位数到高双位数百分比,且随预算增大而增大。第二次经过循环块时,MoE 路由器保留核心专家、多样化调用其他专家,残差流写入更大更新——像一次 refinement 而非重复。增益集中在结构化数据、代码、长样本与上下文学习。

核心要点

  • SMELT:计算匹配 MoE 循环 Transformer 缩放律
  • 最佳:只循环中间半数层、两次
  • 公平对齐:每 token 算力/参数/缓存相等
  • 节省:中个位数→高双位数百分比
  • 增益随算力预算增大而增大
  • 增益区:结构化数据/代码/长样本/ICL

为什么重要

在匹配算力下、真实规模上,把推理移入潜在循环(latent loop)确实更优且随投入增大而取胜——这为「 recurrent depth / 循环深度」架构(如 Astra 被报道采用的思路)提供了缩放律支撑,也提示推理成本可借架构而非仅堆参数下降。但循环内部不产生可读 token,带来可监控性成本。

关键事实速记

  • 提交:2026-09-01
  • 论文:SMELT(arXiv 2609)
  • 配置:中间半数层×2
  • 规模:54B 非嵌入参数
  • 节省:中个位数→高双位数 %
  • 注意:潜在循环可监控性成本
← 返回资讯列表 AI8899 · 内容仅供学习参考