[论文解读] Knowledge Distillation for BERT Unsupervised Domain Adaptation
本文提出对抗蒸馏适配(Adversarial Adaptation with Distillation, AAD),一种新颖的 BERT 无监督域自适应方法,结合对抗域自适应(ADDA)与知识蒸馏,以缓解灾难性遗忘问题。通过使用微调后的源模型初始化目标 BERT,并应用温度控制的软标签损失进行蒸馏,AAD 在 30 个跨域情感分类任务上实现了最先进性能,平均准确率较基线方法提升 1.6%,且稳定性更优。
A pre-trained language model, BERT, has brought significant performance improvements across a range of natural language processing tasks. Since the model is trained on a large corpus of diverse topics, it shows robust performance for domain shift problems in which data distributions at training (source data) and testing (target data) differ while sharing similarities. Despite its great improvements compared to previous models, it still suffers from performance degradation due to domain shifts. To mitigate such problems, we propose a simple but effective unsupervised domain adaptation method, adversarial adaptation with distillation (AAD), which combines the adversarial discriminative domain adaptation (ADDA) framework with knowledge distillation. We evaluate our approach in the task of cross-domain sentiment classification on 30 domain pairs, advancing the state-of-the-art performance for unsupervised domain adaptation in text sentiment classification.
研究动机与目标
- 解决由于源域与目标域之间分布差异导致 BERT 模型性能下降的问题。
- 在将 ADDA 框架应用于 BERT 等大规模预训练模型时,克服灾难性遗忘问题。
- 通过将知识蒸馏整合到对抗自适应流程中,提升域自适应的稳定性和性能。
- 探究知识蒸馏中温度超参数对模型泛化能力和鲁棒性的影响。
提出的方法
- 通过使用微调后的源编码器权重初始化目标编码器,将 ADDA 框架适配至 BERT。
- 在目标编码器与域判别器之间进行对抗训练,以最小化域差异。
- 利用源模型生成的软标签应用知识蒸馏,以正则化目标模型的预测结果。
- 使用温度缩放的交叉熵损失在蒸馏过程中软化概率分布,以保留类别信息。
- 联合训练目标 BERT 和分类器,采用联合损失函数:对抗域损失与蒸馏损失。
- 采用两阶段优化过程:先进行对抗域对齐,再进行基于蒸馏的正则化。
实验结果
研究问题
- RQ1在无目标数据标签的情况下,知识蒸馏是否能有效防止 BERT 在迁移到新领域时发生灾难性遗忘?
- RQ2知识蒸馏中的温度超参数如何影响适配后 BERT 模型的性能与稳定性?
- RQ3将对抗域自适应与知识蒸馏结合,是否能在基于 BERT 的情感分类任务中超越现有无监督域自适应方法?
- RQ4与基线方法相比,该方法在多样化领域对上的稳定性是否更优?
主要发现
- AAD 在 30 个跨域情感分类对中的 21 组上显著优于基线方法,平均准确率提升 1.6%。
- 该方法表现出更优的稳定性,实验中标准差始终更低。
- 使用温度为 20 的知识蒸馏取得最佳性能,而更高温度(如 50)会因标签信息过度软化而降低性能。
- 除 t=1 外,所有温度值下知识蒸馏均优于监督微调基线,表明蒸馏具有正则化优势。
- 现有方法如 DDC 和 DANN 的平均性能低于基线,凸显将标准域自适应方法应用于 BERT 时的局限性。
- deep CORAL 方法优于 DDC 和 DANN,但平均仍落后 AAD 1.1%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。