Skip to main content
QUICK REVIEW

[논문 리뷰] Co-training Embeddings of Knowledge Graphs and Entity Descriptions for Cross-lingual Entity Alignment

Muhao Chen, Yingtao Tian|arXiv (Cornell University)|2018. 06. 18.
Topic Modeling인용 수 11
한 줄 요약

이 논문은 다국어 지식 그래프 임베딩과 엔티티 설명 임베딩을 공동으로 학습하여 다국어 간 엔티티 정렬을 향상시키는 KDCoE라는 공훈련 프레임워크를 제안한다. 약한 연결된 삼국어 위키백과 데이터셋에서 양 모델이 신뢰도 높은 예측을 반복적으로 개선함으로써, KDCoE는 이전 방법들을 크게 능가하며 엔티티 정렬, 제로샷 정렬, 다국어 간 지식 그래프 보완 작업에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Multilingual knowledge graph (KG) embeddings provide latent semantic representations of entities and structured knowledge with cross-lingual inferences, which benefit various knowledge-driven cross-lingual NLP tasks. However, precisely learning such cross-lingual inferences is usually hindered by the low coverage of entity alignment in many KGs. Since many multilingual KGs also provide literal descriptions of entities, in this paper, we introduce an embedding-based approach which leverages a weakly aligned multilingual KG for semi-supervised cross-lingual learning using entity descriptions. Our approach performs co-training of two embedding models, i.e. a multilingual KG embedding model and a multilingual literal description embedding model. The models are trained on a large Wikipedia-based trilingual dataset where most entity alignment is unknown to training. Experimental results show that the performance of the proposed approach on the entity alignment task improves at each iteration of co-training, and eventually reaches a stage at which it significantly surpasses previous approaches. We also show that our approach has promising abilities for zero-shot entity alignment, and cross-lingual KG completion.

연구 동기 및 목표

  • 다국어 지식 그래프에서 희박한 다국어 간 링크(ILLs) 문제를 해결하여 다국어 간 추론 품질을 향상시키기.
  • ILLs가 제한된 상황에서 다국어 엔티티 설명을 보조 지도 정보로 활용하여 다국어 간 정렬을 향상시키기.
  • 서로 다른 모델 간 상호 지도를 통해 다국어 지식 그래프 임베딩과 설명 임베딩을 번갈아가며 향상시키는 준지도 학습 공훈련 프레임워크 개발하기.
  • 공유된 다국어 표현을 활용하여 제로샷 다국어 간 엔티티 정렬과 다국어 간 지식 그래프 보완 향상하기.
  • 구조적 지식과 텍스트 기반 설명을 결합하여 강력한 다국어 표현 학습을 위한 효과성 입증하기.

제안 방법

  • 교차 다국어 정렬을 위해 선형 변환을 사용하는 이동 모델을 활용해 다국어 지식 그래프 임베딩 모델 훈련하기.
  • 다국어 단어 임베딩을 사용해 엔티티 설명을 인코딩하는 주의 기반 게이팅 순환 단위(AGRU)를 활용해 설명 임베딩 모델 훈련하기.
  • 각 모델이 도출한 가장 신뢰도 높은 예측된 ILL을 서로의 모델에 가짜 레이블로 사용하여 공훈련 수행하기.
  • 두 모odal(지식 그래프 구조 및 설명) 간 교차 다국어 엔티티 쌍의 임베딩을 동시에 정렬하는 공동 최적화 목표 함수 사용하기.
  • 희소 언어에서 추론을 가능하게 하기 위해 영어를 중간 다리로 활용해 다국어 간 예측 수행하기.
  • 다국어 워드 임베딩(예: 다국어 스킵그램에서 유도)을 활용해 설명 인코더 내에서 다국어 의미 정렬 향상시키기.

실험 결과

연구 질문

  • RQ1소규모 ILL 집합만 존재할 경우, 지식 그래프 임베딩과 엔티티 설명 임베딩 간의 공훈련이 다국어 간 엔티티 정렬 성능 향상에 기여하는가?
  • RQ2지표 정렬 데이터가 전혀 없는 제로샷 정렬 환경에서 제안된 방법의 효과성은 어떠한가?
  • RQ3지식 그래프와 설명 임베딩의 공동 학습이 자원이 제한된 언어 환경에서 다국어 간 지식 그래프 보완 성능 향상에 기여하는가?
  • RQ4자기 주의(self-attention)와 다국어 워드 임베딩이 엔티티 설명 내 다국어 의미 유사도 모델링에 기여하는 정도는 어떠한가?
  • RQ5공훈련 과정이 여러 반복 동안 일관된 성능 향상을 이끌어내며 기존 최신 기술 수준의 모델을 초월하는가?

주요 결과

  • KDCoE는 제로샷 설정에서 Hit@1이 4.04% 향상되고 Hit@10이 11.97% 향상되어 이전 방법들을 크게 능가한다.
  • AGRU 기반 설명 인코더는 단일층, CNN, GRU 기반 베이스라인보다 우수한 성능을 보이며, 주의 기반 및 다국어 임베딩의 중요성을 입증한다.
  • 공훈련은 반복 과정 전반에 걸쳐 안정적인 수렴과 두 모델 간 상호 향상이 이루어지는 일관된 성능 향상을 보인다.
  • KDCoE의 단일 언어 예측 변형은 TransE와 유사한 성능을 보이며, 단일 언어 지식 그래프의 구조 품질를 유지하고 있음을 확인한다.
  • 영어를 중간 다리로 활용한 다국어 예측은 단일 언어 예측보다 유의미하게 높은 성능을 보이며, 다국어 간 지식 전이의 가능성을 입증한다.
  • 이 방법은 효과적인 다국어 간 지식 그래프 보완을 가능하게 하여, 향후 다중 언어 브리지 기반의 다국어 앙상블 방법에 대한 잠재적 응용 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.