Skip to main content
QUICK REVIEW

[論文レビュー] Semi Supervised Preposition-Sense Disambiguation using Multilingual Data

Hila Gonen, Yoav Goldberg|arXiv (Cornell University)|Nov 27, 2016
Natural Language Processing Techniques参考文献 43被引用数 10
ひとこと要約

本稿では、多言語並列データを活用してLSTMベースの文脈エンコーダーを事前学習する半教師ありアプローチを提案し、前置詞意味解釈(PSD)を実現する。モデルは文脈からの外国語前置詞の予測を学習し、意味を示唆する表現を獲得する。その後、小規模な教師ありPSDデータセットで微調整することで、外部の語彙リソースを用いずにWeb-reviewsコーパスで80.54、SemEvalコーパスで81.7の最先端の精度を達成した。

ABSTRACT

Prepositions are very common and very ambiguous, and understanding their sense is critical for understanding the meaning of the sentence. Supervised corpora for the preposition-sense disambiguation task are small, suggesting a semi-supervised approach to the task. We show that signals from unannotated multilingual data can be used to improve supervised preposition-sense disambiguation. Our approach pre-trains an LSTM encoder for predicting the translation of a preposition, and then incorporates the pre-trained encoder as a component in a supervised classification system, and fine-tunes it for the task. The multilingual signals consistently improve results on two preposition-sense datasets.

研究の動機と目的

  • 前置詞意味解釈(PSD)という、重要だがリソースが限られるNLPタスクにおける教師あり学習データの不足に取り組む。
  • WordNetのような手動で整備された語彙リソースに依存するのを避け、大規模な多言語並列コーパスを弱い監視信号の源として活用する。
  • 多言語文脈表現からの転移学習により、単一言語PSDのパフォーマンスを向上させる。
  • 曖昧な前置詞の文脈に敏感な表現を学習するための多言語信号の有効性を示す。
  • 外部語彙リソースを一切使用せず、2つの主要なPSDベンチマークで最先端の結果を達成する。

提案手法

  • 英語の前置詞の翻訳を文脈から予測するように、大規模な並列単語・多言語コーパスでLSTMエンコーダーを事前学習する。
  • 事前学習済みLSTMを文脈エンコーダーとして用い、ターゲットの前置詞の意味を区別する表現を生成する。
  • 分類のための交差エントロピー損失を用いて、小規模な教師ありPSDデータセット上で、モデル全体をエンドツーエンドで微調整する。
  • 補助タスクとして前置詞の翻訳予測を設定し、マルチタスク学習により多言語信号を統合する。
  • 多言語タスクと単一言語タスクの間で共有される表現を活用し、一般化性能と意味の区別能力を向上させる。
  • Web-reviewsコーパスでは12種類の粗いスーパーセンスを統一した意味インベントリを、評価にはオリジナルのSemEval 2007意味セットを用いる。

実験結果

リサーチクエスチョン

  • RQ1多言語並列データは、前置詞意味解釈のための効果的な弱い監視信号として機能するか?
  • RQ2翻訳予測の事前学習により、PSDのための文脈表現の質が向上するか?
  • RQ3多言語信号を活用する半教師ありアプローチは、限定的なアノテーションデータに依存する教師ありモデルを上回るか?
  • RQ4多言語信号による改善効果は、異なる前置詞意味データセットおよび意味インベントリにおいて一貫しているか?
  • RQ5手動で整備された語彙リソース(例:WordNet)を一切使用せず、最先端のパフォーマンスを達成できるか?

主な発見

  • 提案手法はWeb-reviewsコーパスで80.54のテスト精度を達成し、先行の教師ありモデルと比べて顕著な向上を示した。
  • SemEval 2007コーパスでは81.7%の精度に達し、WordNetやその他の語彙リソースを一切使用せず、多数の先行手法を上回った。
  • 多言語事前学習は両データセットで一貫して性能向上をもたらし、翻訳予測からの信号の強固さを示した。
  • モデルは、多言語翻訳予測により学習された文脈表現が、前置詞の意味を非常に予測可能であることを示した。
  • 改善の要因は、明示的な意味アノテーションがなくても、大規模な並列データから意味を区別する表現を学習できる能力に起因する。
  • 結果は、特に意味解釈タスクにおける低リソースNLP状況において、マルチタスク学習と転移学習の有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。