Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Cross-Lingual Entity Linking

Avirup Sil, Gourab Kundu|arXiv (Cornell University)|2017. 12. 05.
Topic Modeling인용 수 51
한 줄 요약

영어로 학습된 신경 EL 모델이 언급을 구분하기 위한 미세한 맥락 유사성을 학습하고 다국어 임베딩을 활용해 스페인어와 중국어 TAC 2015 데이터세트에 대한 제로샷 교차 언어 EL을 가능하게 하며 최첨단 성능을 달성한다.

ABSTRACT

A major challenge in Entity Linking (EL) is making effective use of contextual information to disambiguate mentions to Wikipedia that might refer to different entities in different contexts. The problem exacerbates with cross-lingual EL which involves linking mentions written in non-English documents to entries in the English Wikipedia: to compare textual clues across languages we need to compute similarity between textual fragments across languages. In this paper, we propose a neural EL model that trains fine-grained similarities and dissimilarities between the query and candidate document from multiple perspectives, combined with convolution and tensor networks. Further, we show that this English-trained system can be applied, in zero-shot learning, to other languages by making surprisingly effective use of multi-lingual embeddings. The proposed system has strong empirical evidence yielding state-of-the-art results in English as well as cross-lingual: Spanish and Chinese TAC 2015 datasets.

연구 동기 및 목표

  • 쿼리 맥락과 후보 위키피디아 페이지 간의 미세한 유사성을 학습하는 신경 EL 모델을 개발한다.
  • 재학습 없이 다국어 임베딩을 사용하여 제로샷 교차 언어 EL을 가능하게 한다.
  • 의미 구분을 향상시키기 위해 컨텍스트의 여러 표현(CNNs, LSTMs, NTN)과 일관성(coherence) 특징을 통합한다.
  • 인터링구지 링크를 통한 교차 언어 매핑 및 빠른 앵커-타이틀 기반 후보 검색을 활용한다.
  • 영어(CoNLL/TAC) 및 교차 언어 TAC 2015 스페인어/중국어 데이터셋에서 평가하여 최첨단 성능을 확립한다.

제안 방법

  • 인터링구지 링크를 통해 매핑된 영어 및 대상 언어 위키피디아에서 구축된 앵커-타이틀 색인을 사용한 빠른 매치 후보 생성.
  • 다국어 임베딩(MultiCCA, CCA, LS)으로 단어를 임베드하고 위키피디아 페이지를 IDF 가중치 단어 임베딩으로 표현한다.
  • 언급의 지칭 연결(coreference chain) 문장들과 후보 페이지의 첫 단락에 대해 CNN으로 컨텍스트를 모델링한다.
  • 좌우 컨텍스트를 사용하는 LSTMs와 신경 텐서 네트워크로 미세한 컨텍스트 모델링을 적용해 미묘한 Dis/Similarities를 포착한다.
  • 문장 컨텍스트–위키 링크, 문장 컨텍스트–위키 첫 번째 단락, 미세한 컨텍스트–위키 링크 등 여러 유사도 측정치와 LIEL 스타일 특성을 더한 특징 추상화 층을 구성하고 피드포워드 네트워크로 처리해 이진 분류기로 학습한다.
  • 양성/음성 예시 쌍으로 학습하고 교차 엔트로피 손실을 최적화한다; 디코딩은 빠른 매치 후보와 학습된 점수를 사용해 가장 좋은 링크 또는 NIL을 선택한다.

실험 결과

연구 질문

  • RQ1영어만으로 학습된 EL 모델이 재학습 없이 다른 언어에서 교차 언어 연결을 수행할 수 있는가(제로샷)?
  • RQ2다국어 임베딩 전략 중 어떤 것이 스페인어와 중국어에 대한 교차 언어 EL을 가장 잘 지원하는가(MultiCCA, CCA, LS)?
  • RQ3어휘 분해/구성(LDC) 및 다중 관점 컨텍스트 매칭(MPCM) 층이 EL 성능을 향상시키는가?
  • RQ4제안된 제로샷 교차 언어 EL 방식이 영어 및 교차 언어 TAC 데이터셋의 최첨단 시스템과 어떤 차이가 있는가?

주요 결과

  • 모델은 영어 EL 벤치마크(CoNLL 2003 및 TAC 2010)에서 최첨단 결과를 달성한다.
  • 교차 언어 EL에서 이 접근법은 TAC 2015 스페인어 및 중국어 데이터셋에서 최첨단 성능을 달성한다.
  • 다국어 임베딩 중 MultiCCA 기반 표현이 교차 언어 EL에서 LS 및 CCA를 능가한다.
  • LDC 및 MPCM 층의 도입으로 기준선 및 더 단순한 아키텍처에 비해 측정 가능한 성능 향상이 있다.
  • 맥락 LSTMs, LDC, MPCM을 포함한 전체 모델이 모국어 및 교차 언어 설정에서 이전 연구에 비해 보고된 최상의 결과를 낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.