Skip to main content
QUICK REVIEW

[논문 리뷰] One Question Answering Model for Many Languages with Cross-lingual Dense Passage Retrieval

Akari Asai, Xinyan Yu|arXiv (Cornell University)|2021. 07. 26.
Topic Modeling인용 수 31
한 줄 요약

CORA는 단일 교차 언어 검색기와 다언어 오픈 QA 모델로, 단일 교차 언어 검색기로 언어 간 증거를 검색하고 번역이나 언어별 모듈 없이 대상 언어로 응답을 생성합니다. 반복적 데이터 마이닝을 사용하여 학습 데이터를 확장하고 26개 언어에 걸쳐 최첨단 결과를 달성합니다.

ABSTRACT

We present Cross-lingual Open-Retrieval Answer Generation (CORA), the first unified many-to-many question answering (QA) model that can answer questions across many languages, even for ones without language-specific annotated data or knowledge sources. We introduce a new dense passage retrieval algorithm that is trained to retrieve documents across languages for a question. Combined with a multilingual autoregressive generation model, CORA answers directly in the target language without any translation or in-language retrieval modules as used in prior work. We propose an iterative training method that automatically extends annotated data available only in high-resource languages to low-resource ones. Our results show that CORA substantially outperforms the previous state of the art on multilingual open QA benchmarks across 26 languages, 9 of which are unseen during training. Our analyses show the significance of cross-lingual retrieval and generation in many languages, particularly under low-resource settings.

연구 동기 및 목표

  • 언어별 파이프라인이나 번역 기반 오류 전파 없이 다국어 오픈 QA 다루기.
  • 다언어 패시지에서 질문에 답하기 위해 단일 교차 언어 검색기와 다국어 생성기 개발.
  • 반복 학습과 위키피디아 언어 링크를 통해 학습 데이터를 언어 전반에 걸쳐 자동 확장.
  • 다양한 언어에서의 혜택을 보여주기 위해 언어 간 검색 및 생성의 이점을 평가, 특히 저자원이 부족한 설정에서.

제안 방법

  • 패시지 인코딩과 질문을 mBERT로 처리하고 내부 내적을 통해 상위 패시지를 검색하도록 다국어 설정(mDPR)으로 Dense Passage Retrieval 확장.
  • 검색된 패시지를 조건으로 대상 언어로 답을 생성하는 다국어 시퀀스-투-시퀀스 생성기(mGEN, 예: mT5).
  • 추가 인간 주석이나 MT 없이 Wikipedia 언어 링크와 모델 예측을 사용해 학습 데이터를 확장하는 반복 데이터 마이닝으로 학습.
  • 생성 중 대상 언어를 나타내기 위해 질문에 언어 태그를 부착.
  • 데이터 증강은 번역 전용으로 피하고; 합성 답은 생성기가 생성하여 훈련에 사용.
  • 추론 시 CORA는 어떤 언어에서든 검색하고 단일 mDPR/mGEN 쌍으로 대상 언어를 생성합니다.

실험 결과

연구 질문

  • RQ1하나의 교차 언어 검색기와 생성기가 언어별 파이프라인 없이도 여러 언어에 걸친 오픈 QA를 가능하게 할 수 있는가?
  • RQ2교차-언어 검색이 저자원 언어의 정답 품질에 어떤 영향을 주는가?
  • RQ3반복 데이터 마이닝이 언어 전반의 학습 데이터를 확장하고 교차 언어 QA 성능을 향상시키는 정도는 어느 정도인가?
  • RQ4다국어 생성이 번역 기반 혹은 추출적 접근법과 비교해 정답을 향상시키는가?

주요 결과

  • CORA는 26개 언어에 걸쳐 이전의 다국어 오픈 QA 방법보다 현저히 우수하며 Xor-TyDi QA 및 MKQA 벤치마크에서 눈에 띄는 향상을 보인다.
  • Xor-TyDi QA에서 CORA는 이전 SOTA에 비해 최대 23.4 F1 포인트의 향상을 달성한다.
  • MKQA에서 CORA는 훈련에 MKQA 데이터를 사용하지 않아도 최대 4.7 F1 포인트까지 향상시킨다.
  • CORA는 특히 저자원 설정 및 학습 중에 보이지 않은 언어에 대해 교차-언어 검색 및 생성의 혜택을 본다.
  • 영어 소스의 증거 격차로 인해 답이 불가능하다고 간주되던 문제의 일부를 비영어 소스에서 검색함으로써 해결 가능해진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.