LoPA 门控让 GPU 推理提速 3.31 倍
新的中期训练方法冲破 FFN 稀疏天花板,无需从头预训练

来自 Meta FAIR 和 Inria 的研究者发表了一种新的 LLM 推理加速方法,突破了此前 FFN 稀疏化方法无法越过的性能天花板。他们的技术 LoPA Gating(低参数门控),借助一种重构的前馈网络参数化、一套叫做模型转铸(model casting)的中期训练配方,以及专用的自定义 CUDA 内核,在 90% FFN 稀疏度下实测取得 3.31× 的墙钟 GPU 加速 —— 相同条件下标准门控为 2.06×。这一结果记录在 arXiv:2609.31975 中,提交于 2026 年 9 月 25 日,它挑战了这样一个假设:Transformer FFN 层里的非结构化激活稀疏性无法被切实利用来获得有意义的 GPU 吞吐量提升。
前馈网络约占大型 Transformer 模型预训练计算量的 50%,使其成为推理期加速的首要目标。对 FFN 激活做稀疏化早有充分研究,但把这种稀疏性变成真实的 GPU 吞吐量,历来停滞不前:标准门控在 90% 稀疏度下的天花板约为 2.06×,而像 TEAL 和 Top-p 这样免训练的方法,在质量相当时 FLOP 加速降到约 1.6×,规模上墙钟 GPU 收益还更落后。据作者的测量,LoPA Gating 是第一个无需从头做完整预训练、就能超过 3× 真实 GPU 加速的中期训练方法。
LoPA Gating 如何重构 FFN 计算
现代 LLM 的 FFN 块遵循一种门控结构:门投影 → 激活 → 逐元素相乘 → 下投影。标准门控让门投影与值投影在计算预算上大致对称。LoPA Gating 引入了一个低秩约束 —— 秩比 α = 1/8 —— 相对于值计算缩小了门分量的参数占用。这次重构改变了激活后输出的统计特征,在同样的名义稀疏度下,产生比标准门控更高的、GPU 硬件上可利用的稀疏性。
关键的约束是:FFN 激活稀疏是非结构化的 —— 哪些神经元为零取决于输入 token,并随位置而变。稠密的 GPU 矩阵运算无法利用这种模式。论文包含自定义的 CUDA 内核,把 FFN 计算路由过与 LoPA 参数化匹配的稀疏线性通路。没有这些内核,理论上的 FLOP 减少不会带来墙钟加速。因此这篇论文同时是一项架构贡献和一项 GPU 内核工程成果 —— 两者在实践中无法分开。
标准门控打不破的竞争天花板
ProSparse 是唯一一个超过 LoPA Casting 实测加速的方法:论文引用 ProSparse 取得高达 4.52× 的 GPU 加速。但 ProSparse 需要用一种新的激活函数从头训练。LoPA Gating 是通过模型转铸施加的 —— 从一个现成的预训练检查点开始的中期训练(论文用的是 Qwen3-30B-A3B)。对负担不起一次完整预训练的团队来说,ProSparse 并不是一个现实的替代。
延伸阅读:本地跑 LLM 比你以为的贵:账单由硬件决定,不是电费
免训练的方法(TEAL、Top-p、Prox)在墙钟 GPU 上最多达到 1.3–2.0×。更早的 ReLU 化方案(Mirzadeh 等人,2024)无法突破 LoPA 所越过的约 3× 的理论天花板。DynamicInfer(ICLR 2026)带来了可比的吞吐提升,但靠的是消费级 GPU 上的卸载,而不是服务器 GPU 的推理加速。
模型转铸,以及 90% 稀疏度下的质量
模型转铸从一个预训练好的稠密模型出发。架构转铸把它的 FFN 块转换成 LoPA Gating 参数化;随后继续预训练诱导出自定义内核所利用的激活后稀疏性。在论文的主要工作点 —— 90% FFN 稀疏度、4 万亿个带学习率衰减的中期训练 token —— LoPA Casting 在验证集上取得 2.153 的负对数似然(NLL)。作者称这与标准门控的质量相当,同时 GPU 吞吐量更高。
论文指出 LoPA Gating 与专家混合架构兼容,这把潜在适用范围延伸到 DeepSeek-V3 和 Mixtral 这类专家层共享类 FFN 结构的前沿 MoE 模型。
论文与生产之间的基础设施鸿沟
这些加速数字由作者自己运行、未经独立复现 —— 对几天前才提交的预印本来说这在意料之中,但仍要标明。包括 vLLM 和 TensorRT-LLM 在内的主流推理引擎都建立在稠密矩阵运算之上;集成 LoPA 的自定义稀疏 CUDA 内核,需要独立于算法结果之外的、不小的工程工作。截至提交,尚未确认有代码仓库。
论文的质量论证建立在 NLL 上,它衡量的是语言建模困惑度,并不直接反映推理准确率或代码生成。高稀疏度可能在保住困惑度的同时,在要求更高的基准上退化。在推理评测被发布并被独立复现之前,「质量得以保持」应当被理解为「语言建模质量得以保持」,而不是一个完整的能力主张。
延伸阅读:Meta FAIR 研究预测:随着算力扩大,字节级蒸馏将胜过 token 模型
LoPA 部署前景接下来看什么
如果 3.31× 的加速在独立复现和社区测试下成立,经济含义将是可观的。服务器 GPU 层面 3 倍的真实吞吐提升,意味着用三分之一的硬件获得大致相同的推理容量 —— 或者说,对那些 GPU 支出是主要运营成本的 API 提供方,单 token 成本按比例下降。
三个里程碑将决定这份潜力能否兑现:一次能让第三方验证 GPU 加速的代码发布;NLL 之外的下游能力基准结果;以及把兼容 LoPA 的稀疏计算集成进至少一个主流推理引擎。第一项 —— 确认的开源发布 —— 仍未宣布。在那之前,LoPA Gating 是一项重要的研究成果,其加速上限在原理上已经确立,但从业者若不从头复现作者的自定义内核工作,还用不上它。