[论文解读] Language Contamination Helps Explain the Cross-lingual Capabilities of English Pretrained Models
本文表明,英语预训练语言模型表现出强大的跨语言迁移能力,并非源于其固有的多语言设计,而是因为其预训练语料中存在大量非英语文本的污染——即使比例低于1%,也导致了数亿条非英语语料。研究显示,模型在非英语语言上的表现与预训练期间接触到的本语言数据量高度相关,挑战了此类模型在大规模下真正单语的假设。
English pretrained language models, which make up the backbone of many modern NLP systems, require huge amounts of unlabeled training data. These models are generally presented as being trained only on English text but have been found to transfer surprisingly well to other languages. We investigate this phenomenon and find that common English pretraining corpora actually contain significant amounts of non-English text: even when less than 1% of data is not English (well within the error rate of strong language classifiers), this leads to hundreds of millions of foreign language tokens in large-scale datasets. We then demonstrate that even these small percentages of non-English data facilitate cross-lingual transfer for models trained on them, with target language performance strongly correlated to the amount of in-language data seen during pretraining. In light of these findings, we argue that no model is truly monolingual when pretrained at scale, which should be considered when evaluating cross-lingual transfer.
研究动机与目标
- 探究为何仅在英语上预训练的模型在非英语任务上表现出人意料的良好性能。
- 量化常用英语预训练语料中非英语文本的规模。
- 评估预训练期间接触外语数据是否解释了跨语言迁移性能。
- 挑战模型在仅英语数据上预训练即为真正单语的假设。
提出的方法
- 使用 FastText 语言识别工具,以 0.6 的置信度阈值,将预训练数据集中的行分类为非英语。
- 对六个主要英语预训练语料(包括 C4、Wikipedia、BookCorpus、OpenWebText、CC-NEWS 和 Stories)进行大规模自动语言组成分析。
- 开展小规模人工定性分析,以验证和解释语言识别结果。
- 在 50 种语言上评估掩码语言建模和词性标注任务的模型表现,以衡量跨语言迁移能力。
- 将目标语言的表现与预训练期间看到的本语言语料量进行相关性分析。
- 对比 English T5 和 mBERT 模型在零样本和微调后的词性标注任务上的表现,以评估迁移效果。
实验结果
研究问题
- RQ1尽管声称数据为单语,常用英语预训练语料中实际含有多少非英语文本?
- RQ2预训练数据中接触非英语文本的程度在多大程度上解释了仅英语训练模型的跨语言迁移表现?
- RQ3观察到的跨语言能力是否源于数据污染,而非零样本泛化?
- RQ4由于接触了目标语言数据,像 English T5 这类模型是否能在零样本跨语言任务上超越多语言模型如 mBERT?
- RQ5考虑到数据收集方法,是否在实际中可实现大规模真正单语模型的训练?
主要发现
- 常用英语预训练语料中包含大量非英语文本——估计数量在 300,000 到 406,000,000 个词元之间,尽管被标记为单语。
- 即使非英语内容占比不足 1%,由于数据规模巨大,C4 和 OpenWebText 等数据集仍包含数百万个外语词元。
- 模型在非英语语言上的表现与预训练期间接触的本语言数据量呈强相关性。
- 在多种语言的零样本词性标注任务中,English T5 表现优于 mBERT,表明数据污染是迁移能力的主要驱动因素。
- 基于网络爬取的数据集表现出比 Wikipedia 等人工筛选数据集更高的非英语内容,后者更不易发生泄漏。
- 本研究结论认为,由于大规模数据收集流程中固有的污染问题,真正单语的模型在大规模下可能无法实现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。