Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-labeled Relation Extraction with Attentive Capsule Network

Xinsong Zhang, Pengshuai Li|arXiv (Cornell University)|2018. 11. 11.
Topic Modeling참고 문헌 26인용 수 12
한 줄 요약

이 논문은 겹치는 이산적 관계 언급이 포함된 문장에서 특징 클러스터링과 관계 탐지 성능을 향상시키는 새로운 주의 기반 캡슐 네트워크인 Att-CapNet을 제안한다. 주의 기반 라우팅 메커니즘과 슬라이딩 마진 손실 함수를 통합함으로써, SemEval-2010 및 NYT-10 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 이는 기존의 CNN- 및 RNN-기반 방법보다 다수의 높은 겹침을 가진 관계를 처리하는 데서 뚜렷한 승리를 거두었다.

ABSTRACT

To disclose overlapped multiple relations from a sentence still keeps challenging. Most current works in terms of neural models inconveniently assuming that each sentence is explicitly mapped to a relation label, cannot handle multiple relations properly as the overlapped features of the relations are either ignored or very difficult to identify. To tackle with the new issue, we propose a novel approach for multi-labeled relation extraction with capsule network which acts considerably better than current convolutional or recurrent net in identifying the highly overlapped relations within an individual sentence. To better cluster the features and precisely extract the relations, we further devise attention-based routing algorithm and sliding-margin loss function, and embed them into our capsule network. The experimental results show that the proposed approach can indeed extract the highly overlapped features and achieve significant performance improvement for relation extraction comparing to the state-of-the-art works.

연구 동기 및 목표

  • 현재 신경망 모델이 특징 융합과 공간 민감성으로 인해 한 문장에서 다수의 겹치는 관계를 추출하는 데 어려움을 겪는 문제를 해결하기 위해.
  • 최대 풀링과 고정 풀링의 한계를 극복하여 문장 전반에 걸쳐 이산적이고 비연속적인 관계 특징을 효과적으로 캡처하기 위해.
  • 동적 특징 클러스터링을 통해 고수준의 관계 표현을 모델링하여 다중 레이블 시나리오에서의 관계 추출 성능을 향상시키기 위해.
  • 관계 신뢰도 기준을 동적으로 조정함으로써 '관계 없음' 클래스를 적절히 처리하는 손실 함수를 개발하기 위해.

제안 방법

  • 모델은 입력 문장의 저수준 의미 특징을 추출하기 위해 Bi-LSTM 또는 CNN을 사용한다.
  • 저수준 특징은 캡슐에 내장되며, 이후 주의 기반 라우팅 알고리즘을 통해 고수준 관계 표현을 형성하는 클러스터링이 이루어진다.
  • 주의 기반 라우팅 메커니즘은 특징 관련성에 기반하여 관련성이 높은 저수준 캡슐을 고수준 캡슐로 동적으로 라우팅한다.
  • 다중 레이블 시나리오를 다루기 위해 슬라이딩 마진 손실 함수를 도입하였으며, '관계 없음'은 모든 다른 관계 확률이 동적으로 조정된 기준 이하일 때에만 예측된다.
  • 기존의 풀링 방법과 비교해 캡슐 네트워크 아키텍처는 관계 특징의 공간적 및 구조적 정보를 더 잘 유지한다.
  • 전체 파ip라인은 특징 추출, 캡슐 기반 특징 클러스터링, 엔드 투 엔드 훈련을 통한 관계 예측으로 구성된다.

실험 결과

연구 질문

  • RQ1캡슐 네트워크는 다중 레이블 관계 추출에서 높이 겹치고 이산적인 관계 특징을 효과적으로 캡처하고 클러스터링할 수 있는가?
  • RQ2주의 기반 라우팅은 기존의 동적 라우팅과 비교해 특징 라우팅 정밀도를 어떻게 향상시키는가?
  • RQ3슬라이딩 마진 손실 함수는 고정 마진 또는 표준 교차 엔트로피 손실과 비교해 다중 레이블 관계 추출에서 '관계 없음' 클래스를 더 잘 다룰 수 있는가?
  • RQ4제안된 Att-CapNet 모델은 표준 벤치마크에서 기존의 CNN- 및 RNN-기반 모델보다 다중 레이블 관계 추출 성능에서 뛰어나게 성능을 발휘하는가?
  • RQ5핵심 관계 단어가 공간적으로 분리되어 있을 경우, 모델은 한 문장에서 다수의 관계를 얼마나 잘 탐지할 수 있는가?

주요 결과

  • 제안된 Att-CapNet 모델은 SemEval-2010 Task 8 데이터셋에서 F1 스코어 84.5%를 기록하여 최고의 베이스라인 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 제거 실험 결과, 주의 기반 라우팅을 제거하면 F1 스코어가 0.9%p 감소하였고, 슬라이딩 마진 손실을 제거하면 F1 스코어가 2.2%p 감소하였다.
  • 사례 연구에서 Att-CapNet은 다중 레이블 문장의 모든 레이블된 관계를 성공적으로 식별한 반면, 최대 풀링 및 워드 수준 주의 방법은 하나 이상의 관계를 탐지하지 못했다.
  • 그림 4의 PR 곡선은 두 모듈을 모두 사용할 경우 모든 재현율 수준에서 가장 우수한 전반적인 성능을 달성함을 보여준다.
  • 모델은 같은 문장 내에서 'place_born', 'place_lived', 'place_death'와 같은 겹치는 관계를 탐지하는 데 뛰어난 능력을 보였다.
  • 슬라이딩 마진 손실 함수는 학습 진행 상황에 따라 기준을 동적으로 조정함으로써 '관계 없음' 예측에 대한 과도한 확신을 효과적으로 방지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.