[论文解读] AdaVAE: Exploring Adaptive GPT-2s in Variational Auto-Encoders for Language Modeling
AdaVAE 提出了一种参数高效的 VAE 框架,通过自适应适配器将 GPT-2 同时用作编码器和解码器,利用潜在注意力机制实现有效的潜在空间学习。该方法在训练过程中仅激活 14.66% 的参数,即可实现最先进的语言建模性能,并在生成和分类任务中表现出色。
Variational Auto-Encoder (VAE) has become the de-facto learning paradigm in achieving representation learning and generation for natural language at the same time. Nevertheless, existing VAE-based language models either employ elementary RNNs, which is not powerful to handle complex works in the multi-task situation, or fine-tunes two pre-trained language models (PLMs) for any downstream task, which is a huge drain on resources. In this paper, we propose the first VAE framework empowered with adaptive GPT-2s (AdaVAE). Different from existing systems, we unify both the encoder\&decoder of the VAE model using GPT-2s with adaptive parameter-efficient components, and further introduce Latent Attention operation to better construct latent space from transformer models. Experiments from multiple dimensions validate that AdaVAE is competent to effectively organize language in three related tasks (language modeling, representation modeling and guided text generation) even with less than $15\%$ activated parameters in training. Our code is available at \url{https://github.com/ImKeTT/AdaVAE}.
研究动机与目标
- 为解决现有大规模 VAE 在微调完整预训练语言模型(PLM)时计算成本高且参数使用效率低的问题。
- 通过设计一种与 PLM 表示兼容的方法,改进基于 Transformer 的 VAE 中的潜在空间构建,克服 RNN 基潜在融合技术的局限性。
- 通过共享词嵌入空间,使用相同的 GPT-2 架构统一编码器和解码器组件,以提升模型一致性与效率。
- 在低资源和多任务设置下,以极少的可训练参数实现有效的表征学习与文本生成。
提出的方法
- 在 GPT-2 的前馈层与注意力模块输出之间插入自适应适配器模块,实现参数高效的微调。
- 提出潜在注意力机制,将编码器表示直接融入注意力计算,以更优地构建有意义的潜在码。
- 采用两个参数高效的 GPT-2 模型作为统一的编码器与解码器,共享相同的词嵌入空间以保证一致性。
- 探索两种潜在知识注入策略:通过潜在向量条件化解码器,以及在生成过程中将潜在向量注入隐藏状态。
- 使用重参数化技术的变分推断目标来优化证据下界(ELBO),支持端到端训练。
- 在冻结所有原始 GPT-2 参数的前提下应用基于适配器的微调,将可训练参数量减少至总参数量的 14.66%。
实验结果
研究问题
- RQ1统一的、参数高效的 GPT-2 架构是否可以在不损失性能的前提下同时作为 VAE 的编码器和解码器?
- RQ2与标准潜在向量注入相比,潜在注意力在构建有意义且解耦的潜在空间方面效果如何?
- RQ3在使用参数高效 PLM 时,VAE 中编码器与解码器深度的最佳平衡点是什么?
- RQ4AdaVAE 是否能在使用显著少于现有“大 VAE”模型可训练参数的前提下,实现最先进的语言建模性能?
- RQ5AdaVAE 在多样化的 NLP 任务中(包括低资源分类与可控文本生成)的泛化能力如何?
主要发现
- 在 WikiText-2 数据集上,AdaVAE 的测试困惑度(PPL)达到 15.49,优于以往 SOTA 模型,且可训练参数显著更少。
- 在仅激活 14.66% 参数的情况下,模型达到 -ELBO 为 125.56,证明其具备强大的优化效率与表征学习能力。
- 潜在空间插值与类比任务显示,生成句子之间的语义与句法过渡平滑自然,证实潜在表征具有解耦性与语义意义。
- 消融实验表明,8 层编码器与 12 层解码器组合性能最佳,超过 8 层编码器后收益递减。
- 模型在低资源文本分类与可控生成任务中保持强大性能,验证其在多样化 NLP 任务中的鲁棒性。
- 适配器的使用实现了高效的微调,计算开销极小,使多任务训练成为可能且高效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。