[论文解读] Fast and Robust Early-Exiting Framework for Autoregressive Language Models with Synchronized Parallel Decoding
该论文提出了快速且鲁棒的早期退出(Fast and Robust Early-Exiting, FREE)框架,用于自回归语言模型,通过浅层-深层模块与同步并行解码,在不降低性能的前提下加速推理。通过用同步解码替代状态复制,并采用贝塔分布混合模型进行自适应置信度阈值估计,FREE 实现了显著的加速效果——相比完整模型最快可提升 1.65 倍,同时在各种任务和模型规模下保持了生成质量。
To tackle the high inference latency exhibited by autoregressive language models, previous studies have proposed an early-exiting framework that allocates adaptive computation paths for each token based on the complexity of generating the subsequent token. However, we observed several shortcomings, including performance degradation caused by a state copying mechanism or numerous exit paths, and sensitivity to exit confidence thresholds. Consequently, we propose a Fast and Robust Early-Exiting (FREE) framework, which incorporates a shallow-deep module and a synchronized parallel decoding. Our framework enables faster inference by synchronizing the decoding process of the current token with previously stacked early-exited tokens. Furthermore, as parallel decoding allows us to observe predictions from both shallow and deep models, we present a novel adaptive threshold estimator that exploits a Beta mixture model to determine suitable confidence thresholds. We empirically demonstrated the superiority of our proposed framework on extensive generation tasks.
研究动机与目标
- 为解决自回归语言模型因顺序自回归解码导致的高推理延迟问题。
- 克服现有早期退出框架中因状态复制和过多退出路径导致的性能下降问题。
- 通过引入自适应阈值估计器,消除对置信度阈值手动调优的需求。
- 实现在多种模型和序列长度下更快、更鲁棒且可扩展的推理。
- 在显著降低计算成本的同时,保持高质量的生成结果。
提出的方法
- 提出浅层-深层模块,将计算拆分为浅层模型(早期层)和深层模型(完整层),实现在两个指定位置的早期退出。
- 采用同步并行解码,将当前词的解码与先前已退出的词对齐,避免依赖近似的关键/值状态。
- 用堆叠的早期退出词的实际注意力计算替代状态复制,减少性能下降并提升准确性。
- 提出基于贝塔分布混合模型(BMM)的自适应阈值估计器,利用浅层与深层模型之间的置信度分数和预测一致性,为每个数据集确定最优阈值。
- 通过并行解码同时生成浅层和深层模型的预测,实现在不增加额外推理成本的前提下可靠估计阈值。
- 使用参数高效微调方法对浅层模型进行微调,以减少训练开销,同时保持性能。

实验结果
研究问题
- RQ1具备同步并行解码的双路径早期退出框架是否能在不造成性能下降的前提下降低推理延迟?
- RQ2在长序列和大模型下,同步解码与状态复制在准确率和速度方面有何差异?
- RQ3基于置信度分数分布的数据驱动自适应阈值估计器是否能消除对手动阈值调优的需求?
- RQ4FREE 框架在多样化自然语言处理任务和不同模型规模下,其生成质量保持程度如何?
- RQ5与完整模型相比,该框架在人类偏好评估指标下的表现如何?
主要发现
- 在 CNN/DailyMail 摘要任务中,FREE 框架相比完整模型实现了最高 1.65 倍的加速,同时保持了与完整模型相当的 ROUGE-L 分数(FREE 为 40.99,完整模型为 41.09)。
- 使用 GPT-3.5-turbo 进行类人类评估显示无显著性能下降:FREE 在四个维度上的得分分别为 [4.68, 3.84, 3.84, 3.72],完整模型为 [4.73, 3.83, 3.87, 3.77]。
- 成对比较中的胜出次数几乎相等(101 vs. 99),表明 FREE 与完整模型在人类偏好上表现相当。
- 基于贝塔分布混合模型的自适应阈值估计器能有效为每个数据集确定最优阈值,从而消除手动调优的需要。
- 同步并行解码在准确性上优于状态复制,尤其在大模型和长序列上,显著减少了性能下降。
- 依赖深层模型修正的优化方法仅带来微小性能增益,却显著增加了延迟,表明其不适合集成到早期退出框架中。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。