Skip to main content
QUICK REVIEW

[論文レビュー] Cross-lingual Distillation for Text Classification

Ruochen Xu, Yiming Yang|arXiv (Cornell University)|May 5, 2017
Text and Document Classification Technologies参考文献 36被引用数 6
ひとこと要約

本稿では、ラベル付きソース言語(例:英語)から低リソースなターゲット言語(例:ドイツ語、フランス語、日本語、中国語)へ知識を転送する新しい手法、Cross-lingual Distillation with Feature Adaptation(CLDFA)を提案する。この手法は、ソース分類器からのソフトラベルと、分布マッチングを低減するための敵対的特徴適応を用いる。ターゲット言語にラベル付きデータを必要とせず、最先端または競争力のある性能を達成する。

ABSTRACT

Cross-lingual text classification(CLTC) is the task of classifying documents written in different languages into the same taxonomy of categories. This paper presents a novel approach to CLTC that builds on model distillation, which adapts and extends a framework originally proposed for model compression. Using soft probabilistic predictions for the documents in a label-rich language as the (induced) supervisory labels in a parallel corpus of documents, we train classifiers successfully for new languages in which labeled training data are not available. An adversarial feature adaptation technique is also applied during the model training to reduce distribution mismatch. We conducted experiments on two benchmark CLTC datasets, treating English as the source language and German, French, Japan and Chinese as the unlabeled target languages. The proposed approach had the advantageous or comparable performance of the other state-of-art methods.

研究の動機と目的

  • 低リソースなターゲット言語において、特にラベル付きデータが限られる状況下で、ドメインおよび分布マッチングの不一致に課題を解決すること。
  • 並列コーパスを用いて、ラベルが豊富なソース言語から低リソースなターゲット言語へ効果的な知識転送を可能にすること。
  • ターゲット言語の訓練データ、並列コーパス、テストデータ間の分布シフトを、敵対的特徴適応によって低減すること。
  • マルチリンガルテキスト分類のため、知識蒸留と特徴アライメントを統合したスケーラブルで効率的なフレームワークの開発すること。

提案手法

  • ラベル付きデータでソース言語分類器を学習し、未ラベルのソース言語並列コーパスデータで微調整することで、分布シフトを低減する。
  • 訓練済みのソース分類器を用いて、並列コーパスのソース側に対してソフト確率的ラベル(ログティス)を生成する。
  • ソース分類器からのソフトラベルと並列コーパスのターゲット側を用いて、ターゲット言語分類器を学習し、言語間の知識蒸留を実現する。
  • ターゲット分類器の学習中に敵対的特徴適応を適用し、並列コーパスと未ラベルのターゲットテストデータ間の特徴分布を一致させる。
  • 両方の言語(ソースおよびターゲット)の未ラベル単語埋め込みを、未ラベルの単言語データ上で事前学習されたword2vecを用いて初期化する。
  • 蒸留の際、温度スケーリングを用いてソフトラベルを平滑化し、一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ソース言語分類器からの知識蒸留は、低リソースなターゲット言語におけるゼロショットクロスリンガルテキスト分類を改善できるか?
  • RQ2敵対的特徴適応は、並列コーパスとターゲットドメインのテストデータ間の分布不一致をどれほど効果的に低減できるか?
  • RQ3提案されたCLDFAフレームワークは、ターゲット言語にラベル付きデータを一切使用しない状況で、既存の最先端手法を上回る性能を発揮するか?
  • RQ4利用可能な少量のラベル付きターゲット言語データがある場合、このフレームワークはどの程度の恩恵を受けるか?

主な発見

  • CLDFA-KCNNは、より困難なゼロショット設定下で、100件の追加ターゲットドキュメントを使用した他の最先端手法を含め、両方のベンチマークデータセットで全てを上回った。
  • 敵対的特徴適応を含む完全なCLDFA-KCNNモデルは、ヴァニラCLD-KCNNよりも優れた性能を示し、分布アライメントの有効性を裏付けた。
  • 少量のラベル付きターゲットドキュメントが利用可能な場合、CLDFA-KCNNは単にターゲットラベルで学習する場合に比べて顕著な性能向上を示した。特に100件未満のラベル例がある場合に顕著であった。
  • 英語をソース言語として用いた場合、ドイツ語、フランス語、日本語、中国語を含む多様なターゲット言語においても、強力な性能を維持した。これは、広範なクロスリンガル転送可能性を示している。
  • 多くの代替手法よりも低い計算複雑性を達成したため、スケーラブルで効率的なフレームワークを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。