[논문 리뷰] XLM-K: Improving Cross-Lingual Language Model Pre-training with Multilingual Knowledge
XLM-K는 두 가지 새로운 사전 훈련 작업인 마스크된 엔티티 예측과 개체 함의를 통해 다국어 지식을 통합함으로써 다국어 언어 모델링을 향상시킨다. 다국어 지식 기반을 활용하여 엔티티와 관계 이해를 향상시켜, MLQA, NER 및 XNLI에서 최신 기술 성능을 달성하며, 지식 집약적이고 다국어 간 전이 작업에서 뚜렷한 성과 향상을 이룬다.
Cross-lingual pre-training has achieved great successes using monolingual and bilingual plain text corpora. However, most pre-trained models neglect multilingual knowledge, which is language agnostic but comprises abundant cross-lingual structure alignment. In this paper, we propose XLM-K, a cross-lingual language model incorporating multilingual knowledge in pre-training. XLM-K augments existing multilingual pre-training with two knowledge tasks, namely Masked Entity Prediction Task and Object Entailment Task. We evaluate XLM-K on MLQA, NER and XNLI. Experimental results clearly demonstrate significant improvements over existing multilingual language models. The results on MLQA and NER exhibit the superiority of XLM-K in knowledge related tasks. The success in XNLI shows a better cross-lingual transferability obtained in XLM-K. What is more, we provide a detailed probing analysis to confirm the desired knowledge captured in our pre-training regimen. The code is available at https://github.com/microsoft/Unicoder/tree/master/pretraining/xlmk.
연구 동기 및 목표
- 기존 다국어 모델이 언어 간 엔티티와 관계 의미를 포괄하지 못하는 한계를 해결하기 위해.
- 다국어 및 双국어 텍스트를 초월해 언어에 종속되지 않는 다국어 지식을 사전 훈련에 통합함으로써 다국어 간 전이 능력을 향상시키기 위해.
- 구조화되고 기술적인 지식을 다국어 표현에 명시적으로 통합하기 위한 지식 인식 사전 훈련 작업을 설계하기 위해.
- 사실 기반 지식과 다국어 정렬이 요구되는 하류 작업에서 지식 통합의 효과를 평가하기 위해.
- 사전 훈련 과정에서 모델이 의도된 지식 표현을 어떻게 습득하는지에 대한 실증적이고 탐색적인 증거를 제공하기 위해.
제안 방법
- 모델이 다국어 지식 기반에서 제공하는 설명을 사용해 문장 내 마스크된 엔티티를 예측하는 마스크된 엔티티 예측(MEP) 작업을 도입한다.
- 주어와 관계를 바탕으로 객체 엔티티를 예측해야 하는 개체 함의(OE) 작업을 제안하며, 지식 기반의 다국어 설명을 사용한다.
- 사전 훈련 중 대조 학습을 활용하여 올바른 엔티티 쌍(긍정 예시)과 부정 예시를 구분한다.
- 표준 마스크된 언어 모델링(MLM)과 번역 언어 모델링(TLM)과 함께 두 가지 지식 기반 작업을 다중 작업 사전 훈련 체제에 통합한다.
- 다국어 지식 기반(예: Wikidata)을 활용해 다국어로 제공되는 엔티티 설명과 삼중항($<$주어, 관계, 목적어$>$)을 확보한다.
- 주어와 목적어를 다국어 설명을 사용해 인코딩하는 듀얼 인코더 설정을 활용해 다국어 간 정렬을 가능하게 한다.
실험 결과
연구 질문
- RQ1사전 훈련에 다국어 지식을 통합하면 하류 작업에서 다국어 간 전이 성능이 향상되는가?
- RQ2마스크된 엔티티 예측과 개체 함의와 같은 지식 인식 사전 훈련 작업은 모델이 사실 기반 지식을 얼마나 잘 포착하는지에 영향을 미치는가?
- RQ3XLM-K는 MLQA 및 NER와 같은 지식 집약적 벤치마크에서 XLM-R과 같은 기존 다국어 모델보다 얼마나 뛰어나게 성능을 내는가?
- RQ4다국어 지식의 통합이 개방 도메인 질의 응답 및 일반 지식 추론 능력 향상에 기여하는가?
- RQ5사전 훈련 과정에서 모델이 구조적이고 기술적인 지식을 습득하고 유지하는지에 대한 증거는 무엇인가?
주요 결과
- XLM-K는 MLQA와 NER에서 최신 기술 성능을 달성하며, 특히 지식 집약적인 상황에서 XLM-R 및 기타 다국어 모델보다 뚜렷한 향상을 보였다.
- XNLI 벤치마크에서 XLM-K는 이중어 데이터가 필요 없이도 기존 모델보다 뛰어난 다국어 간 전이 능력을 보였다.
- 제거 실험 결과, 마스크된 엔티티 예측과 개체 함의 작업이 각각 성능 향상에 기여하며, Google-RE에서 MEP는 0.6점, OE는 2.5점 향상되었다.
- LAMA 탐색 작업에서 XLM-K는 SQuAD에서 XLM-R base 대비 6.0점 향상되었고, T-REx에서 총점 29.7을 기록하여 모든 기준 모델을 압도했다.
- 사례 연구 결과, XLM-K는 타실라 무와레의 출생 연도로 '1984'와 같이 사실 기반 지식을 정확히 예측하는 반면, XLM-R base는 실패함을 확인했다.
- 탐색 분석 결과, XLM-K는 구조적이고 기술적인 지식을 효과적으로 포착하며, 사실 기반 지식 통합 향상에 명백한 증거를 제시했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.