Skip to main content
QUICK REVIEW

[论文解读] A Corpus for Multilingual Document Classification in Eight Languages

Holger Schwenk, Xian Li|arXiv (Cornell University)|May 24, 2018
Natural Language Processing Techniques参考文献 7被引用 18
一句话总结

本文基于路透社语料库第二卷,提出了一种新的多语言文档分类语料库,涵盖八种语言——英语、法语、西班牙语、意大利语、德语、俄语、中文和日语,其类别先验分布均衡,可实现跨语言迁移的公平评估。该研究提出了基于多语言词嵌入和句子嵌入的强基线模型,表明联合多语言训练能显著提升跨语言对(包括低资源语言对)的零样本和定向迁移性能。

ABSTRACT

Cross-lingual document classification aims at training a document classifier on resources in one language and transferring it to a different language without any additional resources. Several approaches have been proposed in the literature and the current best practice is to evaluate them on a subset of the Reuters Corpus Volume 2. However, this subset covers only few languages (English, German, French and Spanish) and almost all published works focus on the the transfer between English and German. In addition, we have observed that the class prior distributions differ significantly between the languages. We argue that this complicates the evaluation of the multilinguality. In this paper, we propose a new subset of the Reuters corpus with balanced class priors for eight languages. By adding Italian, Russian, Japanese and Chinese, we cover languages which are very different with respect to syntax, morphology, etc. We provide strong baselines for all language transfer directions using multilingual word and sentence embeddings respectively. Our goal is to offer a freely available framework to evaluate cross-lingual document classification, and we hope to foster by these means, research in this important area.

研究动机与目标

  • 为解决现有跨语言文档分类基准中因类别先验分布不均衡而导致的评估偏差问题,避免评估结果受语言特异性数据不平衡的影响。
  • 将跨语言文档分类的范围从英语-德语扩展至八种语言,涵盖语言学上差异显著的语言,提升多语言评估的稳健性。
  • 为所有语言迁移方向提供标准化、免费可获取的评估框架,包含平衡的训练集、验证集和测试集。
  • 通过多语言词嵌入和句子嵌入技术,建立适用于零样本、定向和联合多语言训练场景的强基线模型。
  • 通过提供统一基准和详细性能指标,推动多语言文档分类研究的可复现性和可比性。

提出的方法

  • 从路透社语料库第二卷构建一个新的子集,确保八种语言(英语、法语、西班牙语、意大利语、德语、俄语、中文和日语)的类别先验分布均衡。
  • 为每种语言分别定义训练集、验证集和测试集,确保在所有迁移方向上的评估具有一致性和公平性。
  • 通过MultiCCA方法使用多语言词嵌入,将不同语言的词汇映射到共享语义空间。
  • 利用在Europarl和联合国平行语料库上联合训练的多语言句子嵌入,学习跨语言共享的句子表示。
  • 评估三种迁移学习策略:零样本(在一种语言上训练,在另一种语言上测试)、定向(针对目标语言进行优化)以及联合多语言训练(同时在多种语言上训练)。
  • 所有迁移设置均采用单层MLP分类器,超参数通过目标语言的验证集进行调优。

实验结果

研究问题

  • RQ1语言之间的类别先验分布不均衡在多大程度上影响了跨语言文档分类评估的可靠性?
  • RQ2平衡的多语言语料库是否能提升跨语言迁移学习基准的公平性与可复现性?
  • RQ3在零样本和定向跨语言文档分类中,多语言词嵌入与多语言句子嵌入相比表现如何?
  • RQ4与零样本或定向迁移相比,联合多语言训练能带来多大的性能提升?
  • RQ5在语言差异较大的语言对(如俄语和中文)之间进行迁移时,跨语言迁移系统表现有多稳健?

主要发现

  • 所提出的MLDoc语料库在全部八种语言中均实现了均衡的类别先验分布,有效缓解了原始RCV2子集等先前基准中存在的偏差问题。
  • 在零样本迁移中,基于Europarl和联合国语料库训练的多语言句子嵌入优于基于词的嵌入,尤其在非英语源语言上表现更优。
  • 在德语或法语上进行训练,其迁移性能优于在英语上训练,挑战了英语始终是最优源语言的假设。
  • 通过每种语言200个样本的联合多语言训练,在五种语言上的平均准确率达到82.04%,显著优于零样本和定向迁移基线。
  • 使用句子嵌入的最佳系统在从英语到法语的零样本迁移中达到89.75%的准确率,在六种迁移方向中的三个方向上超越了先前的最先进结果。
  • 在语言差异较大的语言对(如俄语和中文)之间进行迁移时,仍能取得显著准确率(例如,从法语到意大利语达到82.88%),表明多语言句子表示具有强大鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。