[논문 리뷰] X-FACTR: Multilingual Factual Knowledge Retrieval from Pretrained Language Models
X-FACTR는 23개의 다양한 언어 유형을 포함한 다국어 벤치마크를 도입하여 사전 훈련된 언어 모델에서 사실 지식 검색 능력을 평가한다. 이는 클로즈 스타일의 탐색을 다중 토큰 엔티티와 형태소 인식 기반 프롬프트 생성으로 확장함으로써, 다국어 모델이 자원이 적은 언어에서 성능이 열 劣하다는 점과 코드 스위칭 훈련이 이러한 환경에서 지식 접근성을 향상시킬 수 있음을 드러낸다.
Language models (LMs) have proven surprisingly successful at capturing factual knowledge by completing cloze-style fill-in-the-blank questions such as "Punta Cana is located in _." However, while knowledge is both written and queried in many languages, studies on LMs' factual representation ability have almost invariably been performed on English. To assess factual knowledge retrieval in LMs in different languages, we create a multilingual benchmark of cloze-style probes for 23 typologically diverse languages. To properly handle language variations, we expand probing methods from single- to multi-word entities, and develop several decoding algorithms to generate multi-token predictions. Extensive experimental results provide insights about how well (or poorly) current state-of-the-art LMs perform at this task in languages with more or fewer available resources. We further propose a code-switching-based method to improve the ability of multilingual LMs to access knowledge, and verify its effectiveness on several benchmark languages. Benchmark data and code have been released at https://x-factr.github.io.
연구 동기 및 목표
- 영어 중심의 관행을 넘어 다양한 언어에서 다국어 언어 모델(M-LMs)의 사실 지식 검색 능력을 평가하기 위해.
- 비영어 언어에서 형태적 변동성과 다중 토큰 엔티티 문제를 해결하기 위해 형태소 감지 프롬프트 생성 체계를 설계하기 위해.
- 다국어 사전 훈련이 단일 언어 사전 훈련보다 사실 지식 회상 능력을 향상시키는지 조사하기 위해.
- M-LMs 내에서의 다국어 지식 공유 정도를 탐색하고, 자원이 적은 언어에서의 검색 성능 향상을 위한 방법을 제안하기 위해.
- 자원이 적은 언어에서의 지식 접근성을 향상시키기 위해 코드 스위칭 기반의 훈련 방법을 개발하고 검증하기 위해.
제안 방법
- 23개 언어에 대해 클로즈 스타일 프롬프트를 사용한 다국어 벤치마크(X-FACTR)를 구축하였으며, 사실 지식 소스로 위키데이터 트리플을 사용하였다.
- 엔티티 메타데이터(예: 성별, 수)와 형태소 변화 모델을 활용하여 문법적으로 올바른 프롬프트를 생성하는 형태소 감지(annotation) 체계를 설계하였다.
- 단일 토큰에서 다중 토큰 엔티티로의 탐색을 확장하였으며, 이는 데이터셋 내 75% 이상의 사실을 차지한다.
- 마스크된 언어 모델에서 다중 토큰 예측을 생성하기 위해 다양한 디코딩 알고리즘(greedy, beam search, confidence-based 등)을 제안하였다.
- 프롬프트 내 엔티티를 다른 언어(예: 영어-프랑스어)의 대응어로 교체하는 코드 스위칭 기반의 훈련 목표를 도입하여 다국어 지식 접근성을 향상시켰다.
- 최신의 다국어 모델(M-BERT, XLM, XLM-R)과 단일 언어 모델의 정확도 및 커버리지 지표를 바탕으로 성능을 평가하였다.
실험 결과
연구 질문
- RQ1다국어 언어 모델에서 사실 지식 검색 성능은 자원이 많은 언어와 자원이 적은 언어 간에 어떻게 다를까?
- RQ2다국어 사전 훈련이 단일 언어 사전 훈련보다 더 나은 사실 지식 회상 능력을 제공하는가?
- RQ3M-LMs 내에서 사실 지식이 얼마나 공유되어 있으며, 각 언어 간에 얼마나 다를까?
- RQ4코드 스위칭 기반의 훈련이 자원이 적은 언어에서 사실 지식 검색 성능을 향상시킬 수 있는가?
주요 결과
- 다국어 언어 모델은 자원이 적은 언어에서 사실 지식 검색 정확도가 크게 떨어지며, 예를 들어 스와힐리, 요르وبا, 마라티어에서는 5% 미만으로 나타나고, 영어의 경우 M-BERT로 13.57%에 그친다.
- 다국어 사전 훈련에도 불구하고 M-LMs가 지식 회상에서 단일 언어 모델을 항상 능가하지는 않으며, 언어와 모델에 따라 성능 격차가 크게 벌어진다.
- 약 50%의 사실만이 두 개 이상의 언어에서 회상되며, M-LMs 내 지식은 주로 언어별로 특화되어 있고, 언어 간 이식성이 떨어진다.
- 코드 스위칭 기반의 훈련 방법은 자원이 적은 언어(예: 프랑스어, 러시아어, 그리스어)에서 프롬프트를 해당 언어로 제시했을 때 사실 지식 검색 성능을 향상시켜 효과를 입증한다.
- 다중 토큰 엔티티 예측은 여전히 주요 과제이며, 영어에서 M-BERT의 경우 단일 토큰 엔티티 대비 정확도가 크게 하락한다(예: 5.57%).
- 일부 경우에서 신뢰도 기반 디코딩이 그레디 또는 비트 서치보다 더 나은 성능을 보였지만, 전체적으로 성능은 여전히 낮게 유지되며, 특히 형태소가 풍부하고 자원이 적은 언어에서 두드러진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.