Skip to main content
QUICK REVIEW

[论文解读] Model Selection for Cross-Lingual Transfer using a Learned Scoring Function

Yang Chen, Alan Ritter|arXiv (Cornell University)|May 4, 2021
Natural Language Processing Techniques被引用 4
一句话总结

本文提出了一种基于微调后的多语言模型内部表征的可学习评分函数,用于在无需目标语言验证数据的情况下,选择性能更优的跨语言迁移模型。通过利用少量在枢轴语言中的人工标注数据,该方法在五种语言和五项NLP任务上均优于基于英语验证数据的模型选择方法,其性能与使用小规模目标语言开发集相当。

ABSTRACT

Transformers that are pre-trained on multilingual text corpora, such as, mBERT and XLM-RoBERTa, have achieved impressive cross-lingual transfer learning results. In the zero-shot cross-lingual transfer setting, only English training data is assumed, and the fine-tuned model is evaluated on another target language. No target-language validation data is assumed in this setting, however substantial variance has been observed in target language performance between different fine-tuning runs. Prior work has relied on English validation/development data to select among models that are fine-tuned with different learning rates, number of steps and other hyperparameters, often resulting in suboptimal choices. In this paper, we show that it is possible to select consistently better models when small amounts of annotated data are available in an auxiliary pivot language. We propose a machine learning approach to model selection that uses the fine-tuned model's own internal representations to predict its cross-lingual capabilities. In extensive experiments we find that our approach consistently selects better models than English validation data across five languages and five well-studied NLP tasks, achieving results that are comparable to small amounts of target language development data.

研究动机与目标

  • 解决在无目标语言数据时,零样本跨语言迁移性能在不同微调运行中存在高方差的问题。
  • 减少对英语验证数据进行超参数选择的依赖,因为后者常导致次优的模型选择。
  • 通过利用辅助枢轴语言中的少量标注数据,提升零样本跨语言迁移中模型选择的一致性与性能。
  • 开发一种基于机器学习的方法,利用模型的内部表征预测其跨语言能力。

提出的方法

  • 该方法训练一个评分函数,将微调后模型的内部表征映射到预测的跨语言性能得分。
  • 评分函数在枢轴语言的小规模标注样本上进行训练,输入为模型最后一层的表征。
  • 模型的表征在推理阶段从微调后的多语言编码器(如 mBERT 或 XLM-RoBERTa)中提取,输入为枢轴语言数据。
  • 通过回归目标优化学习到的评分函数,以预测模型在目标语言下游任务中的表现。
  • 基于预测得分选择性能最佳的模型,从而避免对目标语言验证数据的依赖。
  • 该方法在多种语言和NLP任务上进行了评估,比较了其模型选择性能与英语验证数据和小规模目标语言开发集的表现。

实验结果

研究问题

  • RQ1基于模型内部表征的可学习评分函数能否提升零样本跨语言迁移中的模型选择性能?
  • RQ2使用少量枢轴语言数据是否能带来优于依赖英语验证数据的模型选择效果?
  • RQ3与使用小规模目标语言开发集相比,该方法的模型选择性能如何?
  • RQ4该方法在不同语言和NLP任务上的泛化能力如何?
  • RQ5仅依靠内部表征能否可靠预测模型的跨语言迁移能力?

主要发现

  • 在五种目标语言和五项NLP任务中,该方法始终优于基于英语验证数据的模型选择方法。
  • 该方法的性能与使用小规模目标语言开发数据相当,显著提升了模型选择的可靠性。
  • 即使在缺乏目标语言验证数据的情况下,利用少量标注的枢轴语言数据也能实现有效的模型选择。
  • 学习到的评分函数在包括文本分类、序列标注和自然语言蕴涵在内的多样化NLP任务中表现出良好的泛化能力。
  • 该方法降低了模型选择结果的方差,从而在零样本跨语言迁移中实现了更一致且可靠的性能表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。