QUICK REVIEW
[论文解读] What makes multilingual BERT multilingual?
Chi-Liang Liu, Tsung-Yuan Hsu|arXiv (Cornell University)|Oct 20, 2020
Topic Modeling参考文献 22被引用 7
一句话总结
本文通过在相同预训练条件下对比上下文相关的 BERT 与非上下文相关的词嵌入(GloVe、Word2Vec),探究了多语言 BERT 实现跨语言迁移能力的根源。研究发现,大规模预训练数据以及通过注意力机制建模长距离依赖关系是实现跨语言对齐的关键,而非上下文相关模型即使使用相同的数据和上下文窗口大小,也无法达到类似性能。
ABSTRACT
Recently, multilingual BERT works remarkably well on cross-lingual transfer tasks, superior to static non-contextualized word embeddings. In this work, we provide an in-depth experimental study to supplement the existing literature of cross-lingual ability. We compare the cross-lingual ability of non-contextualized and contextualized representation model with the same data. We found that datasize and context window size are crucial factors to the transferability.
研究动机与目标
- 理解多语言 BERT 相较于非上下文相关嵌入在跨语言迁移性能方面表现出优越性的具体因素。
- 分离数据规模和上下文窗口长度对多语言模型中跨语言对齐的影响。
- 探究在与 m-BERT 相同条件下训练的非上下文相关嵌入是否能实现相当的跨语言能力。
- 按词性类别分析多语言 BERT 中跨语言对齐发生的位置与方式。
提出的方法
- 使用来自 15 种语言的维基百科数据,从头开始预训练 GloVe、Word2Vec 和 BERT,控制词汇表和 WordPiece 分词。
- 通过 MUSE 提供的双语词典进行词检索,使用 MRR(平均倒数排名)评估跨语言对齐效果。
- 在 14 种语言的 XNLI 基准上评估零样本跨语言迁移性能。
- 改变预训练数据规模(每种语言 200k 与 1M 条句子),以研究数据规模的影响。
- 将输入序列长度修改为 20 个标记,以模拟上下文窗口缩小,评估其对长距离依赖建模的影响。
- 按词性(POS)标签分析对齐性能,将标记分为开放类(名词、动词、形容词、副词)和封闭类(代词、介词)。
实验结果
研究问题
- RQ1与非上下文相关模型相比,预训练数据规模在多语言 BERT 的跨语言能力中起到何种作用?
- RQ2上下文窗口大小(即长距离依赖建模能力)如何影响 BERT 与非上下文相关嵌入之间的跨语言对齐?
- RQ3当在与 BERT 相同的数据和相同上下文窗口下训练时,非上下文相关词嵌入(GloVe、Word2Vec)能否实现与 BERT 相当的跨语言对齐?
- RQ4在多语言 BERT 中,哪些词性类别表现出最强的跨语言对齐?
主要发现
- 大规模预训练数据(每种语言 1M 条句子)显著提升了 BERT 的跨语言对齐效果,而较小数据(200k)即使使用相同模型架构也限制了性能。
- 将输入上下文窗口缩减至 20 个标记会显著降低 BERT 在词检索和 XNLI 任务上的跨语言性能,表明长距离依赖建模至关重要。
- 在与 BERT 相同数据和上下文窗口下训练的非上下文相关模型(GloVe、Word2Vec)无法实现相当的跨语言对齐,证明了上下文化表示的独特贡献。
- BERT 在开放类词性标签(如名词、形容词)上的跨语言对齐优于封闭类标签,其中形容词的 MRR 得分最高。
- 在 XNLI 零样本迁移任务中,BERT 在全部 14 种目标语言上均优于 GloVe 和 Word2Vec,且性能与词检索 MRR 得分高度相关。
- 在低数据场景(200k 条句子)下,减小上下文窗口反而提升了 BERT 的对齐效果,表明有限数据可能从简化的长距离建模中受益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。