[论文解读] On Learning Universal Representations Across Languages
本文提出层级对比学习(Hictl),一种自监督框架,通过对比学习联合学习句子级和词级通用表征,增强多语言预训练模型。Hictl 在 XTREME 上将 XLM-R 的准确率提升 4.2 个百分点绝对值,并在低资源与高资源机器翻译任务中均取得当前最优结果。
Recent studies have demonstrated the overwhelming advantage of cross-lingual pre-trained models (PTMs), such as multilingual BERT and XLM, on cross-lingual NLP tasks. However, existing approaches essentially capture the co-occurrence among tokens through involving the masked language model (MLM) objective with token-level cross entropy. In this work, we extend these approaches to learn sentence-level representations and show the effectiveness on cross-lingual understanding and generation. Specifically, we propose a Hierarchical Contrastive Learning (HiCTL) method to (1) learn universal representations for parallel sentences distributed in one or multiple languages and (2) distinguish the semantically-related words from a shared cross-lingual vocabulary for each sentence. We conduct evaluations on two challenging cross-lingual tasks, XTREME and machine translation. Experimental results show that the HiCTL outperforms the state-of-the-art XLM-R by an absolute gain of 4.2% accuracy on the XTREME benchmark as well as achieves substantial improvements on both of the high-resource and low-resource English-to-X translation tasks over strong baselines.
研究动机与目标
- 解决现有跨语言预训练模型仅依赖标记级掩码语言建模、难以捕捉句子级语义的局限性。
- 通过学习语义等价句子的语言不变表征,弥合跨语言间的语义差异。
- 通过联合句子级与词级对比学习,提升零样本与低资源设置下的跨语言迁移性能。
- 证明层级对比学习可超越当前最先进模型,在跨语言理解与生成任务中实现性能提升。
提出的方法
- Hictl 使用 BERT 风格编码器,从跨语言平行句子对的 [CLS] 标记生成句子表征。
- 在句子层面,应用对比学习以最大化平行句子之间的相似性,同时最小化非平行句子之间的相似性。
- 在词层面,将句子对中的每个词视为正样本,将共享词汇表中的所有其他词视为负样本,并使用困难负样本采样以降低计算成本。
- 该框架结合句子级与词级对比目标,联合优化通用跨语言表征。
- Hictl 在大规模单语语料库(CCNet-100)上进行预训练,并在下游任务(如 XTREME 与机器翻译基准)上进行微调。
- 该方法在零样本与少样本设置下进行评估,包括目标语言对无平行数据的语言迁移任务。
实验结果
研究问题
- RQ1联合句子级与词级对比学习是否能超越仅基于标记级掩码语言建模的跨语言表征学习?
- RQ2层级对比学习在多语言句子对中在多大程度上减少了语义差异?
- RQ3所提出方法是否能在无平行数据的低资源与零样本翻译设置中实现泛化?
- RQ4Hictl 在跨语言理解与生成任务中与 XLM-R 和 BERT 融合 NMT 等强基线相比表现如何?
主要发现
- 在 XTREME 基准测试中,Hictl 相较于 XLM-R 实现了 4.2 个百分点的绝对准确率提升,且在零样本句子检索任务(如 BUCC 与 Tatoeba)中最高提升达 6.0 个百分点。
- 在 IWSLT’14 英语→德语翻译任务中,Hictl 相较标准 Transformer 基线模型 BLEU 分数提升 3.34 分。
- 在高资源 WMT’16 英语→德语翻译任务中,Hictl 相较标准 Transformer 模型 BLEU 分数提升 2.95 分。
- 在零样本语言迁移设置中,Hictl 胜过 mBART 与 HiCTL,在意大利语→英语任务中达到 18.6 BLEU,英语→尼泊尔语任务中达到 16.0 BLEU,而 mBART 分别为 16.7 与 14.5。
- 在 IWSLT’17 英语→法语与英语→中文翻译任务中,Hictl 分别将 BLEU 分数提升 3.24 与 3.40 分。
- 即使在单语数据有限的情况下,模型仍表现出稳健性能,但当预训练数据不足时,低资源语言(如古吉拉特语)的性能显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。