Skip to main content
QUICK REVIEW

[論文レビュー] Cross-lingual Dataless Classification for Languages with Small Wikipedia Presence

Yangqiu Song, Stephen Mayhew|arXiv (Cornell University)|Nov 13, 2016
Topic Modeling参考文献 31被引用数 5
ひとこと要約

本稿では、小規模なウィキペディアを持つ低リソース言語向けに、単語レベルの翻訳を活用して大規模ウィキペディア言語(LWL)へ橋渡しを行うことで、ラベル付き学習データが一切不要なクロスリンガルデータレスドキュメント分類手法を提案する。この手法は言語類似度メトリクスを用いて最適なLWLブリッジを自動選択し、最良の可能なブリッジ言語と同等の性能を達成する。

ABSTRACT

This paper presents an approach to classify documents in any language into an English topical label space, without any text categorization training data. The approach, Cross-Lingual Dataless Document Classification (CLDDC) relies on mapping the English labels or short category description into a Wikipedia-based semantic representation, and on the use of the target language Wikipedia. Consequently, performance could suffer when Wikipedia in the target language is small. In this paper, we focus on languages with small Wikipedias, (Small-Wikipedia languages, SWLs). We use a word-level dictionary to convert documents in a SWL to a large-Wikipedia language (LWLs), and then perform CLDDC based on the LWL's Wikipedia. This approach can be applied to thousands of languages, which can be contrasted with machine translation, which is a supervision heavy approach and can be done for about 100 languages. We also develop a ranking algorithm that makes use of language similarity metrics to automatically select a good LWL, and show that this significantly improves classification of SWLs' documents, performing comparably to the best bridge possible.

研究の動機と目的

  • 最小限または完全にウィキペディアが存在しない言語におけるドキュメント分類の課題に対処すること。
  • 従来のCLDDCが、ターゲット言語のウィキペディアが小さすぎて信頼できる意味的マッピングが不可能な場合に機能しないため、スケーラビリティの障壁を克服すること。
  • ラベル名や説明のみを用いて、小規模ウィキペディア言語(SWL)のドキュメントを英語のトピックオントロジーに分類可能にする。
  • 翻訳と分類のための最も効果的な大規模ウィキペディア言語(LWL)をブリッジとして選択する体系的な手法を開発すること。
  • パンレックスのような多言語辞書が利用可能である場合に、単語レベルの翻訳が数千の言語にスケーリング可能であることを実証すること。

提案手法

  • パンレックスなどの単語レベルのバイリンガル辞書を用いて、小規模ウィキペディア言語(SWL)のドキュメントを大規模ウィキペディア言語(LWL)に翻訳する。
  • 翻訳されたLWLドキュメントに対して、ウィキペディアベースの意味的表現を用いてクロスリンガルデータレス分類(CLDDC)を実行する。
  • クロスリンガル明示的意味解析(CLESA)を用いて、英語のラベルと翻訳されたドキュメントを、ウィキペディアのコンセプトを介して共通の意味的空間に埋め込む。
  • 言語類似度メトリクス(例:タイプロジカル、語彙的、構文的特徴)を活用して候補となるLWLをランク付けし、各SWLに対して最適なブリッジ言語を選択する。
  • 既存のSWL-LWLペアを用いてランク付けモデルを学習し、未知の言語ペアへの一般化を可能にする。
  • ウィキペディアの言語リンクと逆インデックスデータを活用して、多言語ページ間のコンセプトの共起に基づく意味的表現を計算する。

実験結果

リサーチクエスチョン

  • RQ1最小限のウィキペディアを持つ言語において、単語レベルの翻訳がクロスリンガルデータレス分類に効果的に利用可能か?
  • RQ2与えられた小規模ウィキペディア言語(SWL)の分類性能を最大化するために、最良の大規模ウィキペディア言語(LWL)を自動でどのようにブリッジ言語として選択できるか?
  • RQ3ブリッジ言語選択に言語類似度に基づくランク付けモデルを用いることで、ランダム選択やヒューリスティック手法と比較して分類精度が顕著に向上するか?
  • RQ4ラベル付きデータが一切ない状況で、単語レベルの翻訳とブリッジ言語選択のみを用いて、SWLにおけるCLDDCの性能が、最良の可能なLWLブリッジにどれほど近づけるか?
  • RQ5パンレックスのような多言語辞書が利用可能である場合に、本手法は数千の言語にスケーリング可能か?

主な発見

  • 提案されたブリッジ付きCLDDCアプローチは、小規模ウィキペディア言語(SWLs)の分類性能を顕著に向上させ、最良の可能なブリッジ言語と同等の結果を達成する。
  • 言語類似度に基づく候補LWLのランク付けは、ランダム選択やヒューリスティック手法を上回り、未学習の言語ペアに対しても良好に一般化する。
  • 本手法は、39種類以上のSWLおよび49種類以上のLWLに対してデータレス分類を可能にし、単語レベルの辞書とウィキペディアのみを用いて数千の言語にスケーリング可能であることを実証した。
  • LWLにおけるCLDDCの性能は、クラスあたり100〜200件のラベル付きドキュメントを用いた教師あり手法と同等であり、意味的空間構築の有効性を裏付けた。
  • 完全なドキュメント翻訳やブリッジ選択なしの単語レベル翻訳よりも本手法が優れていることから、知的なLWL選択の重要性が確認された。
  • パンレックスが提供する多言語辞書(11,000種類以上の言語バリエーションをカバー)を活用することで、通常の機械翻訳システムがカバーする100言語程度を超えてスケーリング可能であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。