Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Ranking Model for Entity Coreference Resolution

Xuezhe Ma, Zhengzhong Liu|arXiv (Cornell University)|2016. 03. 15.
Topic Modeling참고 문헌 32인용 수 8
한 줄 요약

이 논문은 언어적 특징 기반으로 전행어 처리 전략을 구분할 수 있도록 해석 모드 변수를 도입함으로써, 엔티티 공명사슬 해결을 위한 최초의 비지도 생성형 랭킹 모델을 제안한다. 이 모델은 CoNLL-2012 영어 벤치마크에서 58.44%의 F1 스코어를 기록하여 스탠포드의 결정론적 시스템보다 3.01% 높고, 지도 학습 기반 최신 기술에 가까이 다가섰다.

ABSTRACT

Coreference resolution is one of the first stages in deep language understanding and its importance has been well recognized in the natural language processing community. In this paper, we propose a generative, unsupervised ranking model for entity coreference resolution by introducing resolution mode variables. Our unsupervised system achieves 58.44% F1 score of the CoNLL metric on the English data from the CoNLL-2012 shared task (Pradhan et al., 2012), outperforming the Stanford deterministic system (Lee et al., 2013) by 3.01%.

연구 동기 및 목표

  • 수동으로 레이블링된 훈련 데이터가 필요 없는 비지도 공명사슬 해결 시스템을 개발하는 것.
  • 비지도 및 지도 학습 기반 공명사슬 해결 시스템 간의 성능 격차를 줄이는 것.
  • 이전에 지도 학습 환경에서 성공을 거둔 랭킹 모델을 비지도 생성 프레임워크에 적용할 수 있는 가능성을 탐색하는 것.
  • 인간 레이블 없이 언어적 특징과 생성 모델링을 활용해 공명사슬 해결 정확도를 향상시키는 것.

제안 방법

  • 각 언급에 대해 언급 유형, 성별, 수, 동명사성, 의미적 클래스, 거리 등 언어적 특징 기반으로 전행어 선택 전략을 구분할 수 있도록 해석 모드 변수를 도입한다.
  • 공통 확률을 P(D,C) = ∏P(m_j|m_{c_j}) × ∏P(c_j|j)로 인수분해하는 생성형 랭킹 모델을 제안함으로써 각 언급에 대해 독립적으로 추론할 수 있도록 한다.
  • 전행어 점수 계산을 위해 언급 유형, 성별, 수, 동명사성, 의미적 클래스, 언급 간 거리 등의 언어적 특징 세트를 사용한다.
  • 랭킹 모델을 기반으로 EM 유사 추론 절차를 적용하여 각 언급에 대해 가장 가능성이 높은 전행어를 추정한다.
  • 부분적 표현, 수량어를 포함한 명사구, 빈 명사구는 유지하고, 불필요한 'it' 등 허위 언급은 제거하는 언급 탐지 규칙을 적용한다.
  • Gigaword 코퍼스의 APW 및 NYT 섹션(1994–2010)에서 모델을 훈련하고, 평가에는 CoNLL-2012 데이터를 사용한다.

실험 결과

연구 질문

  • RQ1레이블 없는 훈련 데이터 없이도 생성형 비지도 랭킹 모델이 공명사슬 해결에서 경쟁적인 성능을 달성할 수 있는가?
  • RQ2해석 모드 변수는 다양한 언급 유형 간 전행어 선택 모델링을 어떻게 향상시키는가?
  • RQ3비지도 랭킹 모델은 지도 학습 기반 공명사슬 시스템과의 성능 격차를 어느 정도 줄일 수 있는가?
  • RQ4성별, 수, 의미적 클래스 등 다양한 언어적 특징을 통합함으로써 비지도 공명사슬 해결 정확도가 향상되는가?

주요 결과

  • 제안된 비지도 랭킹 모델은 CoNLL-2012 테스트 세트에서 CoNLL F1 스코어 58.44%를 기록하여 스탠포드의 결정론적 시스템보다 3.01% 높은 성능을 보였다.
  • 개발 세트와 테스트 세트에서 각각 스탠포드 시스템 대비 2.93%와 3.01% 향상된 성능을 기록하였다.
  • 개발 세트와 테스트 세트에서 Multigraph 비지도 시스템 대비 각각 1.41%와 1.77% 향상된 성능을 기록하였다.
  • 개발 세트와 테스트 세트에서 MIR 비지도 시스템 대비 각각 2.62%와 3.02% 향상된 성능을 기록하였다.
  • 감독 학습 기반 IMS 시스템 대비 CoNLL F1 스코어가 1.02% 높아, 최신 감독 학습 기반 모델들과의 경쟁력 있는 성능을 입증하였다.
  • 잠재 트리 모델과 경쟁 가능한 결과를 달성하였고, 평가에서 언급된 다른 감독 학습 기반 시스템들과의 성능 격차를 크게 좁혔다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.