Skip to main content
QUICK REVIEW

[논문 리뷰] Prix-LM: Pretraining for Multilingual Knowledge Base Construction

Wenxuan Zhou, Fangyu Liu|arXiv (Cornell University)|2021. 10. 16.
Topic Modeling인용 수 4
한 줄 요약

Prix-LM는 다국어 지식 기반 자료에서 단일 언어 트리플과 다국어 간 연결을 사용하여 다국어 지식 기반 자료를 사전 훈련한 다국어 언어 모델이다. 인과적 언어 모델링을 통해 XLM-R을 미세조정함으로써 17개 언어에서 다국어 지식 기반 보완, 실체 연결, 어휘 유도 작업에서 최고 성능을 달성하며, 효과적인 다국어 지식 전이 및 풍부화를 입증한다.

ABSTRACT

Knowledge bases (KBs) contain plenty of structured world and commonsense knowledge. As such, they often complement distributional text-based information and facilitate various downstream tasks. Since their manual construction is resource- and time-intensive, recent efforts have tried leveraging large pretrained language models (PLMs) to generate additional monolingual knowledge facts for KBs. However, such methods have not been attempted for building and enriching multilingual KBs. Besides wider application, such multilingual KBs can provide richer combined knowledge than monolingual (e.g., English) KBs. Knowledge expressed in different languages may be complementary and unequally distributed: this implies that the knowledge available in high-resource languages can be transferred to low-resource ones. To achieve this, it is crucial to represent multilingual knowledge in a shared/unified space. To this end, we propose a unified representation model, Prix-LM, for multilingual KB construction and completion. We leverage two types of knowledge, monolingual triples and cross-lingual links, extracted from existing multilingual KBs, and tune a multilingual language encoder XLM-R via a causal language modeling objective. Prix-LM integrates useful multilingual and KB-based factual knowledge into a single model. Experiments on standard entity-related tasks, such as link prediction in multiple languages, cross-lingual entity linking and bilingual lexicon induction, demonstrate its effectiveness, with gains reported over strong task-specialised baselines.

연구 동기 및 목표

  • 다국어 지식 기반 구축을 위해 다국어에서 구조화된 지식을 통합하는 다국어 사전 훈련 방법의 부족을 해결한다.
  • 공통된 표현 공간에 다국어 사실을 정렬함으로써 고자원 언어 지식 기반에서 저자원 언어 지식 기반으로 보완 지식을 전이할 수 있도록 한다.
  • 통합된 지식 주입 언어 모델을 사용하여 링크 예측, 다국어 실체 연결, 이중어 어휘 유도와 같은 다국어 후행 작업을 향상시킨다.
  • mBERT와 XLM-R와 같은 표준 다국어 모델이 지식 집약적 작업에서 성능이 떨어지며, 특히 저자원 언어에서 더 심각한 한계를 보이는 점을 극복한다.
  • 구조화된 지식을 사전 훈련 목표에 직접 통합함으로써 단일 언어 지식 탐색과 다국어 지식 기반 보완 간 격차를 메운다.

제안 방법

  • 인과적 언어 모델링 목표를 사용하여 DBpedia의 다국어 데이터를 기반으로 다국어 언어 모델인 Prix-LM를 사전 훈련한다.
  • 단일 언어 지식 트리플(예: {England, capital, London})을 토큰 시퀀스(예: "England is the capital of")로 표현하여 모델이 사실 관계를 학습할 수 있도록 한다.
  • 다국어 간 연결(예: 영어와 일본어 실체 쌍)을 시퀀스(예: 영어로 "The capital of England is London"과 일본어로 "イングランドの首都はロンドンです")로 인코딩하여 다국어 간 정렬을 가능하게 한다.
  • 이러한 구조화된 시퀀스에서 XLM-R을 인과적 언어 모델링 목표로 미세조정하여 모델 파ram에 사실 지식을 주입한다.
  • 결과로 도출된 모델을 사용하여 단일 언어 사실과 다국어 등가성을 모두 포함한 문맥 기반 표현을 생성한다.
  • 자기연쇄적 디코딩을 통해 효율적인 추론을 지원하여 다국어 지식 기반 보완 작업에서 제로샷 및 희소 샘플 적용을 가능하게 한다.

실험 결과

연구 질문

  • RQ1다국어 지식 기반에서 다국어 언어 모델을 효과적으로 사전 훈련하여 구조화된 지식을 통합하고 전파시킬 수 있는가?
  • RQ2단일 언어 트리플과 다국어 간 연결을 통합함으로써 다국어 지식 기반 보완 작업 성능이 얼마나 향상되는가?
  • RQ3Prix-LM는 고자원 언어에서 저자원 언어로 지식을 전이하여 부족한 자원을 가진 지식 기반을 풍부화시킬 수 있는가?
  • RQ4다국어 실체 연결 및 이중어 어휘 유도 작업에서 Prix-LM는 전문적 및 다국어 베이스라인과 비교해 어떻게 성능을 냈는가?
  • RQ5구조화된 지식을 기반으로 사전 훈련하면, 모델이 다양한 언어 간 제로샷 또는 희소 샘플 지식 탐색 능력이 향상되는가?

주요 결과

  • Prix-LM는 17개 언어에서 강력한 베이스라인 대비 다국어 링크 예측에서 일관되고 뚜렷한 성능 향상을 보였으며, Hits@10에서 평균 6.8% 향상되고 Hits@1에서 5.2% 향상되었다.
  • 다국어 실체 연결 작업에서 Prix-LM는 스와힐리어와 타이어어와 같은 저자원 언어에서 mBERT와 XLM-R보다 최대 8.3% 높은 Hits@10 성능을 기록했다.
  • 이중어 어휘 유도 작업에서 Prix-LM는 BabelNet 벤치마크에서 10개 언어 쌍에 대해 최고의 베이스라인 대비 F1 점수에서 7.1% 향상된 성과를 보였다.
  • 모델는 강력한 제로샷 일반화 능력을 보였으며, 링크 예측에서 예측되지 않은 언어 쌍에서 Hits@1이 72.4%를 기록하여 효과적인 다국어 지식 전이를 입증했다.
  • 프롬프트 기반 지식 탐색 작업에서 Prix-LM는 표준 다국어 모델 대비 사실 지식 유지 능력이 향상된 것으로 나타났다.
  • 제거 실험 결과, 단일 언어 트리플과 다국어 간 연결이 성능 향상에 독립적이고 상호 보완적으로 기여하며, 특히 저자원 언어에서 다국어 간 연결이 매우 중요하다는 점을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.