Skip to main content
QUICK REVIEW

[論文レビュー] Supervised Neural Models Revitalize the Open Relation Extraction.

Shengbin Jia, E Shijia|arXiv (Cornell University)|Sep 25, 2018
Natural Language Processing Techniques被引用数 9
ひとこと要約

この論文は、大規模な自動アノテートデータセットを用いて、OREを順序付けタグ付けタスクとして定式化することで、オープン関係抽出(ORE)のための教師ありニューラルシーケンスタグギングモデルを提案する。BiLSTM、CNN、CRFを単語および品詞(POS)埋め込みと組み合わせることで、文脈的、空間的、グローバルなシーケンス情報を捉えることができ、複数のベンチマークで、パターンベースおよびニューラルORE手法の大多数を上回る性能を発揮する。

ABSTRACT

Open relation extraction (ORE) remains a challenge to obtain a semantic representation by discovering arbitrary relation tuples from the un-structured text. However, perhaps due to limited data, previous extractors use unsupervised or semi-supervised methods based on pattern matching, which heavily depend on manual work or syntactic parsers and are inefficient or error-cascading. Their development has encountered bottlenecks. Although a few people try to use neural network based models to improve the ORE task performance recently, it is always intractable for ORE to produce supervised systems based on various neural architectures. We analyze and review the neural ORE methods. Further, we construct a large-scale automatically tagging training set and design a tagging scheme to frame ORE as a supervised sequence tagging task. A hybrid neural sequence tagging model (NST) is proposed which combines BiLSTM, CNN and CRF to capture the contextual temporal information, local spatial information, and sentence level tag information of the sequence by using the word and part-of-speech embeddings. Experiments on multiple datasets show that our method is better than most of the existing pattern-based methods and other neural networks based models.

研究の動機と目的

  • 手動パターンや句構造解析器に強く依存する非教師ありおよび準教師ありORE手法の限界を克服すること。
  • 既存のパターンベースOREシステムに見られる非効率性およびエラーの連鎖的拡大問題を解決すること。
  • 大規模なアノテートデータの不足により実装が困難であった教師ありニューラルOREモデルの開発を可能にすること。
  • 教師あり学習に適した大規模な自動アノテート訓練データセットを構築すること。
  • 文脈的、局所的、グローバルなシーケンス情報の効果的捕捉を可能にするハイブリッドニューラルアーキテクチャを設計すること。

提案手法

  • 新しいタグ付けスキームを用いて、OREを教師ありシーケンスタグギングタスクとして定式化する大規模な自動アノテート訓練データセットを構築する。
  • 文脈的、局所的、グローバルなシーケンス表現の共同学習を可能にする、ハイブリッドニューラルシーケンスタグギングモデル(NST)を設計する。このモデルはBiLSTM、CNN、CRFを組み合わせている。
  • シーケンス表現を豊かにするために、単語埋め込みと品詞(POS)埋め込みの両方を入力特徴として利用する。
  • 入力テキスト内の長距離依存関係と順序的文脈をモデル化するためにBiLSTMを採用する。
  • 単語およびPOS埋め込みシーケンスから局所的、n-gramレベルの特徴を抽出するためにCNNを適用する。
  • ラベル間の依存関係をモデル化し、グローバルに一貫性のあるシーケンスタグ付けを保証するために、上部にCRF層を統合する。

実験結果

リサーチクエスチョン

  • RQ1大規模な自動アノテートデータセットは、オープン関係抽出における効果的な教師あり学習を可能にするか?
  • RQ2BiLSTM、CNN、CRFを組み合わせたハイブリッドニューラルシーケンスタグギングモデルは、既存のパターンベースおよびニューラルORE手法を上回る性能を発揮するか?
  • RQ3単語およびPOS埋め込みの使用は、教師ありシーケンスタグギングフレームワークにおける関係抽出性能をどの程度向上させるか?
  • RQ4文脈的、局所的、グローバルモデリングコンponentsの統合は、OREタスクにおけるより良い一般化をもたらすか?

主な発見

  • 提案された教師ありニューラルシーケンスタグギングモデルは、既存の大多数のパターンベースORE手法を上回る優れた性能を達成する。
  • 複数のベンチマークデータセットにおいて、他のニューラルネットワークベースのOREアプローチを上回る性能を発揮する。
  • BiLSTM、CNN、CRFコンponentsの統合により、多様なシーケンス情報の捉え込みが可能となり、抽出精度が向上する。
  • 自動生成された訓練データの使用により、手動アノテーションおよび句構造解析器への依存が軽減される。
  • 単語およびPOS埋め込みの組み合わせにより、多様な文脈における関係タプルの区別能力が向上する。
  • シーケンスタグギングフレームワークによりエンドツーエンドの学習が可能となり、パイプラインベースのアプローチで一般的に見られるエラー伝搬を回避できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。