开发者 3 秒速决决策指标
循环 Transformer(Looped Transformers)通过在循环中反复复用单套共享参数块,以极小参数量实现了匹敌深层大模型的计算深度。然而在标准推理中,模型仅仅消费最终循环的隐层表征,中间轮次的所有计算产物全部被直接丢弃。来自德克萨斯大学奥斯汀分校(UT Austin)、普林斯顿等学者团队提出了完全免训练的循环对比解码框架 LoopCD。该框架敏锐捕捉到循环网络天然携带的“自身弱表征与强表征”配对特性,通过将最终循环表征与早期循环表征进行反向对比,在 Logit 空间或隐层表征空间(Zero Overhead)直接引导 Token 优选。在四大多循环模型家族中,LoopCD 将 Ouro-2.6B-Thinking 的 AIME 2024 Pass@1 从 61.88% 强力拉升至 73.33%,在循环轮次直接减半的前提下仍超越全深度未引导基线,前向推理 FLOPs 暴降 22.5% 至 48.2%。
核心要点速览 (Key Takeaways)
- ✓首创循环对比解码 LoopCD,变废为宝利用多循环内部中间状态,完全无需外挂小型参考模型或重新微调
- ✓驱动 Ouro-2.6B-Thinking 在 AIME 2024 竞赛数学 Pass@1 由 61.88% 飙升至 73.33%,HumanEval 提升近 10 个百分点
- ✓循环执行次数直接砍半仍超越全深度未引导基线,前向推理 FLOPs 算力消耗大幅锐减 22.5%~48.2%
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
随着端侧部署与边缘计算需求的爆发,以递归循环执行单层模块为代表的循环 Transformer(Looped Transformers,如 Ouro、Huginn 架构)成为追求极致参数密度与轻量化的核心研究热点。其核心哲学是通过空间换时间——仅维持 1B 到 3B 的极小显存占用,通过循环复用 4 轮、8 轮乃至 16 轮达到等效数百层深层大模型的推理能力。然而在现有的标准自回归解码中,系统存在着触目惊心的算力浪费:模型在第 1 轮到第 N-1 轮生成的所有中间隐层状态被完全丢弃,仅用第 N 轮的最后输出投影到词表生成 Token。如何变废为宝,在完全不引入外部辅助小模型、不进行昂贵二次微调的前提下充分榨取循环中间状态的指导价值,是推理加速与质量增强的关键命题。
架构亮点与底层机制
针对上述算力丢弃痛点,联合研究团队提出了 LoopCD(循环对比解码)框架,开创了循环模型自内生弱监督新范式:
- 内生弱-强表征天然对齐:传统对比解码(Contrastive Decoding)必须在显存中常驻一个独立的小型弱模型(Amateur Model)作为负向参照物,通信与显存开销沉重。而 Looped Transformer 本身在早期循环(如第 2 轮)的计算表征天然就是一个“未充分思考的同源弱表征”,与最终循环(如第 8 轮)形成了完美的零成本强弱对齐对;
- LoopCD-Logits 双路对比:在仅增加单次轻量级投影开销的前提下,将最终循环 Logits 减去早期循环 Logits 的缩放分布,有效剥离模型浅层高频复读幻觉与表层捷径偏置;
- LoopCD-Hidden 隐层零开销注入:更进一步,团队提出了直接在隐层状态(Hidden States)空间沿时间轴计算差分梯度的 LoopCD-Hidden 机制,实现绝对的零额外输出头前向传递开销(Zero Extra Output Passes);
- 循环轮次直接减半:借助对比解码带来的极高信噪比,模型无需跑满全深度即可达到收敛,直接削减推理计算量。
权威 Benchmark 与实测跑分对比
研究团队在涵盖奥数推理、复杂代码编写与通用语言理解的四大循环模型架构上展开了系统性验证:
- AIME 2024 竞赛数学大幅暴涨:在极具挑战的 AIME 2024 高难度竞赛基准上,LoopCD-Logits 驱动的 Ouro-2.6B-Thinking 模型其 Pass@1 成绩从原始全深度基线的 61.88% 飙升至 73.33%,实现了 11.45 个百分点的惊人跨越;
- HumanEval 代码生成大幅提升:在 Huginn 循环代码模型上,采用零输出开销的 LoopCD-Hidden 解码,将 HumanEval Pass@1 从 22.56% 提升至 31.71%;
- 前向算力 FLOPs 暴降高达 48.2%:最核心的工程突破在于——当将循环执行深度直接削减 50%(例如从 8 轮砍至 4 轮)并搭配 LoopCD 时,其综合答题质量依然稳稳超越原本跑满 8 轮的未引导基线,端到端前向推理 FLOPs 直接缩减 22.5% 至 48.2%,显存带宽瓶颈大幅缓解。
开发者实战落地与开箱指南
LoopCD 的核心算法实现极其轻巧优雅,本质上仅是对 Hugging Face Transformers 或 vLLM 的 generate() 解码循环进行数十行逻辑增强。对于正在将循环模型(如 Ouro、RecurrentGemma 变体)部署到端侧芯片、移动设备或高并发微服务器的开发者,无需重新训练任何权重,只需在解码器配置中启用循环状态保留缓存与差分加权算子,即可在零训练成本下直接享受“推理质量提升 + 推理延时砍半”的双重红利。

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察