[论文解读] Unsupervised Domain Adaptation with Adapter
该论文提出了一种基于适配器的无监督域自适应(UDA)方法,用于自然语言处理(NLP)中的预训练语言模型(PrLM),在保持原始PrLM权重冻结的同时,将可训练的适配器模块插入到预训练语言模型中。该方法采用两步训练流程——首先在混合源域和目标域数据上进行域融合训练,然后进行特定任务的微调——在实现更优的参数效率和知识保留的同时,取得了当前最优的性能表现,在SDA和XNLI数据集上分别优于全模型微调基线1.21%和1.09%。
Unsupervised domain adaptation (UDA) with pre-trained language models (PrLM) has achieved promising results since these pre-trained models embed generic knowledge learned from various domains. However, fine-tuning all the parameters of the PrLM on a small domain-specific corpus distort the learned generic knowledge, and it is also expensive to deployment a whole fine-tuned PrLM for each domain. This paper explores an adapter-based fine-tuning approach for unsupervised domain adaptation. Specifically, several trainable adapter modules are inserted in a PrLM, and the embedded generic knowledge is preserved by fixing the parameters of the original PrLM at fine-tuning. A domain-fusion scheme is introduced to train these adapters using a mix-domain corpus to better capture transferable features. Elaborated experiments on two benchmark datasets are carried out, and the results demonstrate that our approach is effective with different tasks, dataset sizes, and domain similarities.
研究动机与目标
- 为解决在特定领域无监督域自适应(UDA)中微调完整预训练语言模型(PrLM)时存在的知识扭曲和高部署成本问题。
- 通过在域自适应过程中冻结其参数,保留PrLM中嵌入的通用知识。
- 通过参数高效的适配器模块,提升特征在不同域之间的迁移能力。
- 探索两步训练流程(先域融合,后任务微调)在提升UDA性能方面的有效性。
提出的方法
- 在基于Transformer的预训练语言模型(PrLM)中插入可训练的适配器模块,训练期间保持所有原始PrLM参数冻结。
- 采用两步训练流程:首先在源域和目标域混合语料上使用掩码语言建模(MLM)损失进行域融合训练;其次在源域数据上使用特定任务损失进行任务微调。
- 通过在多样化域数据上联合优化,利用域融合训练学习可迁移的跨域特征。
- 采用瓶颈结构的适配器架构,包含下投影、前馈网络和上投影层,以最小化参数开销。
- 通过t-SNE可视化隐藏表示,分析不同域融合策略下的域对齐性和特征可迁移性。
- 在两个基准数据集——SDA和XNLI上评估该方法,涵盖不同数据规模和域相似度的设置。
实验结果
研究问题
- RQ1基于适配器的微调能否在无监督域自适应过程中保留预训练语言模型中的通用知识?
- RQ2与标准微调相比,两步训练流程(先域融合,后任务微调)在提升UDA性能方面的有效性如何?
- RQ3使用混合域数据进行域融合训练是否能增强特征可迁移性,尤其是在域之间相似的情况下?
- RQ4在UDA设置中,模型性能如何随不同数据规模和域相似度变化?
- RQ5与全模型微调相比,基于适配器的微调在知识保留和下游任务准确率提升方面是否更有效?
主要发现
- 所提出的基于适配器的方法在SDA数据集上比全模型微调绝对提升1.21%,在XNLI数据集上提升1.09%,表现出更优的性能。
- 在小规模SDA数据集上,两步训练流程使适配器的有效性提升了约6倍,性能从92.89%提升至93.31%。
- 域融合训练在SDA上带来1.14%的性能增益(域之间相似),但在XNLI上仅带来0.22%的增益(域之间不相似),表明对域相似度更敏感。
- t-SNE可视化显示,结合适配器的域融合能产生更清晰分离且更对齐的隐藏表示,优于全模型域融合或无域融合的情况。
- 仅使用适配器模块在无域融合时于SDA上仅提升0.07%,但在两步训练流程下提升达0.87%,凸显了在小数据场景下域融合的必要性。
- 该方法保持了高效率和可扩展性,仅微调适配器参数,避免了为每个新域重新训练整个模型的高昂成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。