Skip to main content
QUICK REVIEW

[論文レビュー] Structural Correspondence Learning for Cross-lingual Sentiment Classification with One-to-many Mappings

Nana Li, Shuangfei Zhai|arXiv (Cornell University)|Nov 26, 2016
Sentiment Analysis and Opinion Mining参考文献 17被引用数 4
ひとこと要約

本稿では、並列コーパスに依存せずに、英語と中国語のピボット特徴間の1対多マッピングを学習するための分散単語表現を用いた、クロスリンガルセンチメント分類手法SCL-OMを提案する。モノリンガルコーパスと小規模な二国語辞書を活用することで、NLP&CC 2013データセットで平均81.4%の精度を達成し、最先端手法を上回る性能を発揮した。

ABSTRACT

Structural correspondence learning (SCL) is an effective method for cross-lingual sentiment classification. This approach uses unlabeled documents along with a word translation oracle to automatically induce task specific, cross-lingual correspondences. It transfers knowledge through identifying important features, i.e., pivot features. For simplicity, however, it assumes that the word translation oracle maps each pivot feature in source language to exactly only one word in target language. This one-to-one mapping between words in different languages is too strict. Also the context is not considered at all. In this paper, we propose a cross-lingual SCL based on distributed representation of words; it can learn meaningful one-to-many mappings for pivot words using large amounts of monolingual data and a small dictionary. We conduct experiments on NLP\&CC 2013 cross-lingual sentiment analysis dataset, employing English as source language, and Chinese as target language. Our method does not rely on the parallel corpora and the experimental results show that our approach is more competitive than the state-of-the-art methods in cross-lingual sentiment classification.

研究の動機と目的

  • クロスリンガル構造的同等性学習(CL-SCL)における1対1単語マッピングの制限を是正すること。これは、厳密な1語翻訳を仮定している。
  • ソース言語とターゲット言語のピボット特徴間におけるより柔軟で文脈に配慮した1対多マッピングを学習することで、クロスリンガルセンチメント分類を向上させること。
  • モノリンガルコーパスと小規模な二国語辞書を活用することで、並列コーパスへの依存度を低減すること。
  • 分散表現を用いて英語から中国語へセンチメント知識を転送することで、リソースが限られた言語環境での性能を向上させること。

提案手法

  • CL-SCLフレームワークに分散単語表現を統合することで、1対多マッピングを用いた構造的同等性学習(SCL-OM)を導入する。
  • モノリンガルコーパスを用いて、英語および中国語のための高密度な単語埋め込みを学習し、文脈に応じたベクトル表現を可能にする。
  • ベクトル類似度に基づき、各ソースピボット特徴に対応する複数のターゲット言語語彙を、類似度閾値φ = 0.1を用いて同定する。
  • 最小サポートδ = 30を用いたピボット特徴選択メカニズムを導入し、学習された対応の堅牢性と関連性を確保する。
  • 共有ピボット特徴を通じてソースおよびターゲット特徴をアライメントすることで、次元数k(最適化時は110〜120)のクロスリンガル表現を構築する。
  • 小規模な二国語辞書を用いて単語翻訳候補を初期化し、その後、分散表現と類似度閾値を用いて改善する。

実験結果

リサーチクエスチョン

  • RQ1ソース言語とターゲット言語のピボット特徴間における1対多マッピングは、1対1マッピングを上回るクロスリンガルセンチメント分類性能を実現できるか?
  • RQ2分散単語表現を用いることで、センチメント分類におけるクロスリンガル対応の質と柔軟性はどのように向上するか?
  • RQ3モノリンガルコーパスと小規模な二国語辞書は、クロスリンガル転移学習において大規模な並列コーパスの代替としてどの程度有効か?
  • RQ4分類精度を最大化するための主要ハイパーパrameter(例:ピボット数m、クロスリンガル次元k)の最適設定は何か?

主な発見

  • SCL-OMは、NLP&CC 2013のクロスリンガルセンチメント分類データセットで平均81.4%の精度を達成し、最先端手法を上回った。
  • BooksおよびMusicではk = 120が最良の性能を示し、DVDではk = 110が最適であった。これは、分類タスクに応じた次元数の最適化を示している。
  • 性能はk ∈ (100, 150)の範囲でピークに達し、kが150を超えると精度が低下する傾向にあり、表現能力とノイズのトレードオフが生じていることが示唆された。
  • ピボット数mは、小さなm(例:300)でも、ほとんどの関連するクロスリンガル対応が捉えられ、収束効果が顕著に現れた。
  • 可視化結果から、SCL-OMは意味的に意味のある1対多マッピングを学習していることが確認された。例えば、'fun'は中国語で複数の語彙(好玩、有趣、搞笑)に対応し、1対1翻訳よりも文脈的に正確である。
  • 並列学習やテストデータを一切必要としないにもかかわらず、CL-SCLおよびコトレーニングベースラインを上回る性能を発揮し、本手法の堅牢性と効率性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。