[论文解读] Bridging the domain gap in cross-lingual document classification
本文提出了一种联合解决跨语言文档分类中语言差异与领域差异的框架,通过结合跨语言预训练与无监督领域自适应技术——具体为掩码语言建模(MLM)、无监督数据增强(UDA)和自训练——在强基准模型XLM上实现了平均44%的错误率降低,并达到新的最先进性能。
The scarcity of labeled training data often prohibits the internationalization of NLP models to multiple languages. Recent developments in cross-lingual understanding (XLU) has made progress in this area, trying to bridge the language barrier using language universal representations. However, even if the language problem was resolved, models trained in one language would not transfer to another language perfectly due to the natural domain drift across languages and cultures. We consider the setting of semi-supervised cross-lingual understanding, where labeled data is available in a source language (English), but only unlabeled data is available in the target language. We combine state-of-the-art cross-lingual methods with recently proposed methods for weakly supervised learning such as unsupervised pre-training and unsupervised data augmentation to simultaneously close both the language gap and the domain gap in XLU. We show that addressing the domain gap is crucial. We improve over strong baselines and achieve a new state-of-the-art for cross-lingual document classification.
研究动机与目标
- 为解决跨语言迁移学习中被忽视的领域差异问题,该问题即使在语言障碍被克服后仍会限制模型性能。
- 通过利用未标注的目标语言数据减少领域差异,以提升跨语言文档分类性能。
- 证明领域自适应与语言对齐同等重要,是实现在零样本跨语言迁移中高性能的关键。
- 开发一种统一框架,将跨语言迁移与无监督领域自适应技术结合,用于半监督XLU。
- 通过缓解语言与领域差异,实现跨语言文档分类的新SOTA性能。
提出的方法
- 该方法结合基于XLM的跨语言表征与无监督领域自适应,利用未标注的目标语言数据进行掩码语言建模(MLM)预训练。
- 通过回译(目标语言→英语→目标语言)生成合成同义句,应用无监督数据增强(UDA)以提升模型鲁棒性与一致性。
- 引入自训练策略,对目标语言数据的预测进行优化,降低对源领域数据的依赖,并缓解分布偏移问题。
- 在联合训练过程中整合UDA、MLM预训练与自训练,使模型适应目标领域,同时保持跨语言对齐。
- 评估了多种增强策略,包括t2t(目标→目标)、t2s(目标→源)和s2t(源→目标),并通过消融实验确定最优配置。
- 在UDA阶段使用标签一致性损失,对标注的源语言数据使用交叉熵损失,进行端到端微调。
实验结果
研究问题
- RQ1即使具备强大的跨语言表征,语言间领域漂移是否仍会显著降低跨语言文档分类的性能?
- RQ2无监督领域自适应技术(如UDA和MLM预训练)是否能有效降低低资源目标语言中的领域差异?
- RQ3在跨语言设置中,不同数据增强策略(如t2t、s2t、t2s)如何影响模型泛化能力与性能?
- RQ4当目标语言标注数据稀缺时,自训练在多大程度上能提升模型性能?
- RQ5联合优化语言对齐与领域自适应是否能弥合跨语言模型与单语言模型之间的性能差距?
主要发现
- 所提方法在多个跨语言文档分类基准上,相较于强基线XLM,平均错误率降低44%。
- t2t(目标→目标)增强策略(涉及回译)表现最佳,表明领域匹配的数据增强最为有效。
- 在跨语言设置中,性能在每类约10,000个标注样本时达到峰值,随着源语言训练集增大而下降,表明存在因领域漂移导致的负迁移。
- 自训练显著提升性能,通过减少对源领域数据的依赖,并使预测更符合目标领域分布。
- 通过UDA和MLM预训练利用未标注的目标语言数据,使性能几乎接近单语言基线。
- UDA、MLM预训练与自训练的结合,在多个语言对与数据集上实现了跨语言文档分类的新SOTA性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。