header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

循环Transformer新架构:RLT让Token之间「接着算」

动察 Beating AI 快讯,普林斯顿博士生 Yifan Zhang 提出 Recurrent Looped Transformer(RLT),给 Transformer 加了一条会一直往后传的内部状态。


普通 Transformer 生成下一个 Token 时,主要通过 Attention 和 KV 缓存读取前文。RLT 除了看前文,还会把上一个 Token 算完留下的内部状态,直接交给下一个 Token 继续用。


可以把它理解成给模型加了一根「思维接力棒」。第一个 Token 算完,把当前状态传给第二个;第二个更新后再传给第三个。每个 Token 自己跑的网络层数没有变,但这根状态链会随着文本越来越长。论文把它称为「无限时间深度」,指的就是这条计算链没有固定长度上限。


它和最近讨论较多的 Ouro、Astra 类循环架构也不太一样。那类方法主要让同一个 Token 在同一套网络里多跑几轮;RLT 则让不同 Token 之间持续传递内部状态。前者像一道题交卷前多检查几遍,后者更像上一棒跑完,把手里的进度直接交给下一棒。

AI 解读
普林斯顿博士生 Yifan Zhang 提出 RLT,把循环从单 Token 内部挪到 Token 之间:每个 Token 自己的层数不变,但状态链随文本长度无限延伸。这与 Ouro、Astra 那类「同一 Token 多跑几轮」的循环架构形成路线分野,论文称其为「无限时间深度」。

真正的信号藏在推理成本一侧。BlockBeats 此前已连续追踪 KV 缓存压缩:Baseten 的 STILL 从 8 倍迭代到 200 倍,目标都是把长上下文的显存与算力开销压下来。RLT 走的是另一条路,不压缩缓存,而是让状态本身承载跨 Token 的计算,理论上绕开 KV 缓存随长度线性膨胀的瓶颈。谷歌 Transformer 八子已全部出走,架构层面的边际创新正从大厂实验室外溢到博士生与创业团队手中。

需要注意的是,RLT 目前只是论文,没有推理吞吐、训练稳定性或实际部署数据。状态链无限延伸意味着梯度传播路径同步拉长,训练能否收敛仍是未知数。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成