Skip to main content
QUICK REVIEW

[论文解读] Cross-lingual Distillation for Text Classification

Ruochen Xu, Yiming Yang|arXiv (Cornell University)|May 5, 2017
Text and Document Classification Technologies参考文献 36被引用 6
一句话总结

本文提出了一种名为跨语言蒸馏与特征自适应(CLDFA)的新方法,用于跨语言文本分类,通过使用来自已标注源语言(如英语)的软标签以及对抗性特征自适应技术,将知识从源语言迁移至低资源目标语言(如德语、法语、日语、中文),以减少分布差异。该方法在无需目标语言标注数据的情况下,实现了最先进或具有竞争力的性能。

ABSTRACT

Cross-lingual text classification(CLTC) is the task of classifying documents written in different languages into the same taxonomy of categories. This paper presents a novel approach to CLTC that builds on model distillation, which adapts and extends a framework originally proposed for model compression. Using soft probabilistic predictions for the documents in a label-rich language as the (induced) supervisory labels in a parallel corpus of documents, we train classifiers successfully for new languages in which labeled training data are not available. An adversarial feature adaptation technique is also applied during the model training to reduce distribution mismatch. We conducted experiments on two benchmark CLTC datasets, treating English as the source language and German, French, Japan and Chinese as the unlabeled target languages. The proposed approach had the advantageous or comparable performance of the other state-of-art methods.

研究动机与目标

  • 为解决跨语言文本分类(CLTC)中领域和分布差异不匹配的问题,特别是在目标语言标注数据有限的情况下。
  • 通过并行语料库,实现从标注数据丰富的源语言到低资源目标语言的有效知识迁移。
  • 通过对抗性特征自适应,减少训练数据、并行语料库与目标语言测试数据之间的分布偏移。
  • 开发一种可扩展且高效的框架,将知识蒸馏与特征对齐相结合,用于多语言文本分类。

提出的方法

  • 在标注数据上训练源语言分类器,并在无标注的源语言并行语料数据上进行微调,以减少分布偏移。
  • 使用训练好的源语言分类器为并行语料库的源语言侧生成软概率标签(logits)。
  • 使用源分类器生成的软标签和并行语料库的目标语言侧数据,训练目标语言分类器,实现在语言间的知识蒸馏。
  • 在目标分类器训练过程中应用对抗性特征自适应,以对齐并行语料库与无标注目标语言测试数据之间的特征分布。
  • 通过在源语言和目标语言的无标注单语数据上使用预训练的 word2vec 初始化词嵌入。
  • 在蒸馏过程中使用温度缩放,以平滑软标签并提升泛化能力。

实验结果

研究问题

  • RQ1从源语言分类器进行知识蒸馏是否能提升在低资源目标语言中的零样本跨语言文本分类性能?
  • RQ2对抗性特征自适应在缓解并行语料库与目标领域测试数据之间分布差异方面的有效性如何?
  • RQ3所提出的 CLDFA 框架是否在不使用任何目标语言标注数据的情况下,优于现有的最先进方法?
  • RQ4当存在少量目标语言标注数据时,该框架能在多大程度上受益?

主要发现

  • 在更具有挑战性的零样本设置下,CLDFA-KCNN 在两个基准数据集上均优于所有其他最先进方法,包括那些使用了额外 100 个目标语言标注文档的方法。
  • 包含对抗性特征自适应的完整 CLDFA-KCNN 模型性能优于基线的 CLD-KCNN,证明了分布对齐的有效性。
  • 当仅有少量目标语言标注文档可用时,CLDFA-KCNN 在仅使用目标标签进行训练的基础上表现出显著性能提升,尤其在标注样本少于 100 个时更为明显。
  • 当英语作为源语言时,该方法在多种目标语言(德语、法语、日语、中文)上均保持了强劲性能,表明其具备广泛的跨语言迁移能力。
  • 该框架在计算复杂度低于许多替代方案的前提下,实现了具有竞争力的结果,展现出良好的可扩展性和效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。