[論文レビュー] A Large-Scale Multilingual Disambiguation of Glosses
本稿では、263言語で複数のソースから得た意味の明確化されたテクスト的定義(glosses)の大型マルチリンガルコーパスを提示する。BabelNetの意味ネットワークとクロスリンガルな補完性を活用することで、90%を超える意味の明確化精度を達成した。このコーパスは、http://lcl.uniroma1.it/disambiguated-glosses で無料公開されており、最先端のシステムに統合された際、オープン情報抽出および意味クラスタリングタスクのパフォーマンスを顕著に向上させる。
Linking concepts and named entities to knowledge bases has become a crucial Natural Language Understanding task. In this respect, recent works have shown the key advantage of exploiting textual definitions in various Natural Language Processing applications. However, to date there are no reliable large-scale corpora of sense-annotated textual definitions available to the research community. In this paper we present a large-scale high-quality corpus of disambiguated glosses in multiple languages, comprising sense annotations of both concepts and named entities from a unified sense inventory. Our approach for the construction and disambiguation of the corpus builds upon the structure of a large multilingual semantic network and a state-of-the-art disambiguation system; first, we gather complementary information of equivalent definitions across different languages to provide context for disambiguation, and then we combine it with a semantic similarity-based refinement. As a result we obtain a multilingual corpus of textual definitions featuring over 38 million definitions in 263 languages, and we make it freely available at http://lcl.uniroma1.it/disambiguated-glosses. Experiments on Open Information Extraction and Sense Clustering show how two state-of-the-art approaches improve their performance by integrating our disambiguated corpus into their pipeline.
研究の動機と目的
- マルチリンガルNLPアプリケーション向けに、大規模で高品質で意味アノテーション済みの定義コーパスが不足しているという問題に対処すること。
- 定義におけるクロスリンガルおよびクロスリソースの補完性を活用することで、定義知識の信頼性とカバレッジを向上させること。
- 高カバレッジと高精度のNLPパイプラインをサポートする意味明確化済みglossコーパスを構築すること。
- コーパスの有用性を内在的および外在的NLPタスクにおいて評価し、下流システムに与える影響を示すこと。
提案手法
- 意味インベントリの統合と意味明確化のための大規模なターゲットを提供する、マルチリンガル意味ネットワークBabelNetを活用すること。
- 言語およびリソース間で同等の定義を収集し、意味明確化のための文脈を豊かにすること。
- NASARIベクトルを用いた意味的類似度ベースの精緻化モジュールを適用し、意味明確化精度を向上させること。
- Babelfyとヒューリスティック手法(MCS)を用いて初期の意味明確化スコアを生成し、高精度のインスタンスをフィルタリングすること。
- 標準化されたXMLフォーマットに結果を格納し、各定義に対してBabelNet ID、ソース、表層形一致、信頼度スコアなどのアノテーションを付与すること。
- 完全コーパスと高精度サブセットの両方をリリースし、後者は低エラー・高精度のアプリケーションに最適化されていること。
実験結果
リサーチクエスチョン
- RQ1テクスト的定義におけるクロスリンガルおよびクロスリソースの補完性は、意味明確化パフォーマンスを顕著に向上させることができるか?
- RQ2定義のマルチリンガル・マルチソースコーパスにおいて、どの程度の意味明確化精度を達成できるか?
- RQ3意味明確化済みglossコーパスは、オープン情報抽出や意味クラスタリングといった下流NLPタスクのパフォーマンスをどの程度向上させられるか?
- RQ4コーパスの高精度サブセットは、信頼できる意味ネットワークや知識ベースの強化として利用可能か?
主な発見
- 意味明確化システムは、3言語のランダムサンプルで90%を超える精度を達成し、先行手法を上回った。
- NASARIベースの意味的類似度で強化された高精度バージョンのコーパスは、SemEval Wikipedia意味クラスタリングデータセットでF1スコアを7.3ポイント向上させた。
- オープン情報抽出システムに意味明確化済みglossを統合したところ、元のパイプラインに比べて測定可能なパフォーマンス向上が得られた。
- NASARI+glossesモデルはSemEvalデータセットで88.1%の精度を達成し、ベースラインおよびDandala-multilingualシステムを上回った。
- 完全コーパスには263言語で3800万件を超える意味明確化済み定義が含まれており、これまでに知られている最大のマルチリンガルglossコーパスである。
- 高精度コーパスはサイズは小さいが、著しく低いエラー率を示しており、意味ネットワーク強化などの高精度要件を満たすアプリケーションに適している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。