3 层打平 12 层:Gated Recurrent Transformer 用共享权重把参数量砍掉 62%

📅 发布时间:2026/8/30 13:05:31
3 层打平 12 层:Gated Recurrent Transformer 用共享权重把参数量砍掉 62% 3 层打平 12 层Gated Recurrent Transformer 用共享权重把参数量砍掉 62%Hugging Face 每日论文2026-08-27一个只有 3 层的 Transformer精度打平了 12 层的标准版本把模型做大之后参数量省掉 62%峰值解码内存省掉 59%。这不是模型压缩技巧而是一种重新设计让同一个权重块在模型里反复运行多次每一次都换上不同的「心态」。这篇名为 Gated Recurrent Transformer 的论文8 月 27 日出现在 Hugging Face 每日论文榜作者来自德国慕尼黑工业大学TUM、德国开罗大学与 Cerebras Systems。这篇论文想解决的是一个老问题Transformer 的深度和参数量被绑死了。每多加一层网络就要多存一整层的新权重参数量、显存、训练成本一起涨。可如果反过来把所有层共享同一套权重模型的表征多样性又会塌掉质量明显下滑。GRT 给出的答案是中间的核心块共享但每次运行时用一个轻量门让同一套权重在不同轮次里表现得像不同的层。深度和参数量为什么被绑死Transformer 语言模型过去几年能一路变强靠的是同时加宽加深更多层、更多参数、更多算力。在这个范式里深度和参数量是刚性绑定的每多一层就是一组全新的权重。结果是想获得更深、更聪明的模型就要付出等比例的显存和算力硬件预算成了深度的事实天花板。有人想到用权重共享来破局让所有层共用同一组参数层数可以随便加参数量却不变。但直接共享有个隐蔽的毛病。一个序列数据流经第一层、第八层、第十六层时每一层面对的隐藏状态其实已经完全不同第一层在做输入整理第十六层在做抽象提炼。强制用同一套变换去处理这些完全不同的中间状态会让模型的所有层退化成同一个动作研究者称之为表征多样性坍缩直接表现就是质量下降。还有一个更底层的动机来自理论。图灵早就证明一个有限的指令集只要反复迭代就能算出任何可计算的东西。这意味着模型的强大未必来自参数多而可能来自迭代深。近年很火的测试时计算test-time compute正是在消费侧印证这一点让模型在推理时多想几步效果就提升。但现有做法是通过生成更多 token 来实现「多想」非常费推理预算。GRT 想走另一条路在隐藏状态内部反复迭代不额外生成 token也不额外存参数就能让模型「想得更深」。GRT 的共享核心是怎么做到「同一套权重不同表现」的GRT 的架构分成三段。前段叫 prelude是固定深度的几层负责把原始输入整理成合适的表示。后段叫 coda也是固定深度的几层负责把迭代结果输出成最终答案。中间是一整段共享核心只有一个权重块但会被反复迭代 R 次每次迭代都处理上一轮留下的隐藏状态。关键在于这个共享核心不是傻傻地重复同一动作它内部装了一个门控机制思想来自循环神经网络里的门。每次迭代开始一个轻量投影层会读三个东西当前隐藏状态、prelude 的固定输出、以及每一步重新采样的随机噪声然后输出一个逐元素的更新门。这个门决定当前隐藏状态有多少被保留、多少被新的计算覆盖本质上让同一套权重在不同迭代轮次里面对不同输入时展现出不同的行为。还有一个精巧的初始化设计。门在训练初期被初始化成「几乎不改变」的状态让残差流能近乎原样地穿过所有迭代训练因此稳定。随着训练推进门控逐步被学习出来共享块才开始有选择地精炼表示。研究者还配合了训练时的深度采样训练中随机取不同的迭代次数让模型适应「想几步都能答」的弹性推理时就能在精度和速度之间连续调节。这里值得停下来体会一个细节门控看的是「当前隐藏状态」加上「固定 prelude 输出」再加上「每步重采样的噪声」。前两者保证门能根据内容自适应噪声则保证不同迭代轮次不会坍缩到同一个确定性路径这与循环神经网络里噪声的探索作用是同一个思路。正是这个逐元素、逐轮次变化的门让「同一套权重」在每一轮看起来都像一次新的前向计算从而绕开普通深度共享的表征坍缩陷阱。实测3 层打平 12 层九个预算档位全部领先论文的实验从两个约束维度展开一个是算力对齐isoFLOPs一个是参数量对齐isoParams分别回答两个问题同样的算力下精度能不能追平同样的参数下深度能不能换质量算力对齐的结果最直观在相同训练与推理 FLOPs 下一个 3 层的 GRT精度追平了 12 层的 GPT-2 Small 基线。论文把不同规模、不同 token 预算分成九个组合格子GRT 在全部九个格子里都领先 MoR 与 heavy-tail 深度采样这两个深度复用对照组在中大规模上逼近完整稠密模型的精度在中等规模上把 token 预算翻倍后甚至反超稠密模型。参数量对齐的结果回答了另一个问题把省下来的参数换成深度值不值在参数与数据预算完全一致的情况下迭代更深的 GRT 验证损失是 2.76不循环的对照版本是 2.84。损失越低越好这说明在同样的成本下把参数花在「迭代深度」上比花在「更多独立层」上更划算。对比维度标准 Transformer普通深度共享GRT 门控循环每层权重每层独立全部共享共享核心加轻量门表征多样性高但成本高坍缩质量下降通过门控保持分工参数量随深度线性增长大幅减少大幅减少大型号再省 62%峰值解码内存随深度增长减少减少 59%迭代成本无需迭代无需迭代生成延迟增加约 10%最后一个大模型的数字最有冲击力在最大规模的设置下GRT 用 62% 更少的参数、59% 更少的峰值解码内存换来生成时编译延迟仅增加 10%。这个「用延迟换参数」的交换对受显存限制的部署场景几乎是量身定做的。对三类读者最直接。做模型压缩的人GRT 给出了一个不同于剪枝和量化的新维度与其把权重变少不如把权重复用起来用循环深度换参数。做推理部署的人推理时动态调节迭代次数这个自由度意味着同一份权重可以按设备能力伸缩显存吃紧的机器少迭代几轮算力充裕再拉满。做研究的人论文把「普通深度共享为什么坍缩」和「门控怎么绕开坍缩」讲得很清楚是一个可以直接照抄做对照实验的干净设计。意义与局限这篇工作的意义在于把「测试时计算」的范式搬到了架构内部。过去让模型多想几步要靠输出更多 token既费时间又费算力GRT 证明在隐藏状态里迭代共享权重是另一种更省的「多想」方式而且它能换来实打实的精度收益。对做推理部署的人来说它还提供了一个非常实用的交换开关训练好的 GRT 在推理时可以动态调节迭代次数精度与速度之间连续可调这在标准 Transformer 里是不存在的自由度。局限也要说清楚。第一共享核心加门控的架构对训练基础设施有额外要求迭代式前向传播在现有推理框架里不一定能直接加速编译延迟增加 10% 就是代价之一。第二论文的对照实验主要跑在 GPT-2 Small 这一级别的模型上更大规模、更长上下文的场景需要更多验证。第三门控让共享块在不同轮次表现不同这是用训练时的学习换来的训练本身的复杂度和调参成本并不比标准架构低。对研究者来说GRT 是「参数换深度」这条路线上设计最完整的工作之一值得作为对照实验的基准。