Skip to main content
QUICK REVIEW

[논문 리뷰] Logician: A Unified End-to-End Neural Approach for Open-Domain Information Extraction

Mingming Sun, Xu Li|arXiv (Cornell University)|2019. 04. 29.
Topic Modeling참고 문헌 48인용 수 10
한 줄 요약

이 논문은 SAOKE라고 불리는 새로운 지식 표현 형식을 사용하여 문장을 사실로 변환하는 통합형 엔드 투 엔드 신경망 모델인 Logician을 소개한다. 48,248개의 문장으로 구성된 가장 큰 공개된 인간 주석 기반 OIE 데이터셋을 기반으로 훈련된 Logician은 주의 메커니즘과 커버리지 메커니즘을 통해 다중 사실을 동시에 최적화함으로써 최신 기법들을 능가하는 성능을 보이며, 다양한 OIE 작업에서 뛰어난 성능을 입증한다.

ABSTRACT

In this paper, we consider the problem of open information extraction (OIE) for extracting entity and relation level intermediate structures from sentences in open-domain. We focus on four types of valuable intermediate structures (Relation, Attribute, Description, and Concept), and propose a unified knowledge expression form, SAOKE, to express them. We publicly release a data set which contains more than forty thousand sentences and the corresponding facts in the SAOKE format labeled by crowd-sourcing. To our knowledge, this is the largest publicly available human labeled data set for open information extraction tasks. Using this labeled SAOKE data set, we train an end-to-end neural model using the sequenceto-sequence paradigm, called Logician, to transform sentences into facts. For each sentence, different to existing algorithms which generally focus on extracting each single fact without concerning other possible facts, Logician performs a global optimization over all possible involved facts, in which facts not only compete with each other to attract the attention of words, but also cooperate to share words. An experimental study on various types of open domain relation extraction tasks reveals the consistent superiority of Logician to other states-of-the-art algorithms. The experiments verify the reasonableness of SAOKE format, the valuableness of SAOKE data set, the effectiveness of the proposed Logician model, and the feasibility of the methodology to apply end-to-end learning paradigm on supervised data sets for the challenging tasks of open information extraction.

연구 동기 및 목표

  • 개방 도메인 텍스트에서 다양한 엔티티-관계 중간 구조를 추출하기 위한 통합적이고 지도 기반 접근 방식의 부족을 해결하기 위해.
  • 관계, 속성, 서술, 개념의 네 가지 유형의 사실을 통합하는 지식 표현 형식(SAOKE)을 설계하기 위해.
  • SAOKE 형식으로 표현된 개방 정보 추출을 위한 가장 큰 공개된 인간 주석 기반 데이터셋을 제작하고 배포하기 위해.
  • 문장 내 모든 가능한 사실에 대해 글로벌 최적화를 수행하는 엔드 투 엔드 신경망 모델인 Logician을 개발하기 위해.
  • 개방 도메인 정보 추출을 위한 엔드 투 엔드 딥 러닝의 가능성과 효과성을 입증하기 위해.

제안 방법

  • 관계, 속성, 서술, 개념의 네 가지 유형의 사실을 자연어 단어를 사용하여 표현할 수 있는 통합 형식인 SAOKE(Symbolic Aided Open Knowledge Expression)를 제안한다.
  • 48,248개의 중국어 문장과 해당하는 SAOKE 사실을 포함한 대규모 인간 주석 기반 데이터셋을 제작하여 연구 목적으로 공개한다.
  • 제한된 복사 메커니즘과 커버리지 메커니즘을 갖춘 주의 메커니즘 기반의 시퀀스 투 시퀀스 신경망 모델인 Logician을 개발하여 문장의 단어를 그대로 유지함으로써 사실성과 정확성을 향상시키고, 부족하거나 과도한 추출을 줄인다.
  • 디코딩 중에 사실들이 단어를 공유하고 주의를 경쟁함으로써 글로벌 최적화 전략을 적용하여 문장 내 다수의 사실을 동시에 고려한다.
  • 휴리스틱 패턴 생성이나 자기지도 학습에 의한 노이즈를 피하기 위해, 지도 학습 기반으로 SAOKE 데이터셋을 기반으로 Logician을 엔드 투 엔드로 훈련시킨다.
  • 기호적 구성 요소를 활용하여 사실 내 누락되거나 은폐된 정보를 정확히 표현함으로써 정밀도를 향상시킨다.

실험 결과

연구 질문

  • RQ1통합 지식 표현 형식은 개방 도메인 텍스트 내 다양한 유형의 엔티티-관계 사실을 효과적으로 표현할 수 있는가?
  • RQ2대규모 인간 주석 기반 데이터셋을 기반으로 훈련된 엔드 투 엔드 신경망 모델은 기존의 패턴 기반 또는 자기지도 학습 기반 OIE 시스템을 능가하는가?
  • RQ3문장 내 다수의 사실에 대해 글로벌 최적화를 수행할 경우, 개별 사실 추출 대비 정확도가 향상되는가?
  • RQ4SAOKE 형식은 자연어 기반의 구조화된 지식을 필요로 하는 후속 NLP 작업을 지원하는 데 적합한가?
  • RQ5제안된 방법은 다양한 유형의 개방 도메인 관계 추출 작업에 일반화 가능한가?

주요 결과

  • Logician은 다양한 개방 도메인 관계 추출 작업에서 최신 기술 수준의 알고리즘들을 일관되게 능가하며, 엔드 투 엔드 접근 방식의 효과성을 입증한다.
  • SAOKE 형식은 관계, 속성, 서술, 개념을 포함한 다양한 유형의 사실 표현에 합리적이고 효과적임이 입증된다.
  • 48,248개의 인간 주석 기반 문장으로 구성된 공개된 SAOKE 데이터셋은 지도 기반 OIE 연구를 위한 가장 큰 자원이다.
  • Logician의 제한된 복사 메커니즘은 입력 문장의 단어를 그대로 유지함으로써 사실성과 충실도를 향상시켜 문장 원본에 대한 충실한 표현을 보장한다.
  • 커버리지 메커니즘은 부족한 추출과 과도한 추출을 효과적으로 줄여 더 균형 잡히고 정확한 사실 생성을 가능하게 한다.
  • Logician의 글로벌 최적화 전략은 사실들이 단어를 공유하고 주의를 경쟁함으로써 더 나은 사실 공존 모델링을 가능하게 하여 전체 추출 품질을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.