Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Lingual Open-Domain Question Answering with Answer Sentence Generation

Benjamin Müller, Luca Soldaini|arXiv (Cornell University)|2021. 10. 14.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 질문의 언어와 다를 수 있는 다국어 문단 후보를 사용하여 전체 문장 형식의 답변을 생성하는 다국어 생성형 질문 응답 시스템인 CrossGenQA를 소개한다. 이는 아랍어, 베트남어, 영어, 일본어, 러시아어 등 다섯 언어에서 유창하고 완전한 답변을 포함하는 다국어 데이터셋인 Gen-TyDiQA를 제안하며, 질문에 필요한 다국어 정보가 필요한 경우를 제외하고는 다국어 질문 응답에서 기존의 문장 선택 기반 모델과 단일 언어 파ipelines보다 우수한 성능을 보임을 입증한다.

ABSTRACT

Open-Domain Generative Question Answering has achieved impressive performance in English by combining document-level retrieval with answer generation. These approaches, which we refer to as GenQA, can generate complete sentences, effectively answering both factoid and non-factoid questions. In this paper, we extend GenQA to the multilingual and cross-lingual settings. For this purpose, we first introduce GenTyDiQA, an extension of the TyDiQA dataset with well-formed and complete answers for Arabic, Bengali, English, Japanese, and Russian. Based on GenTyDiQA, we design a cross-lingual generative model that produces full-sentence answers by exploiting passages written in multiple languages, including languages different from the question. Our cross-lingual generative system outperforms answer sentence selection baselines for all 5 languages and monolingual generative pipelines for three out of five languages studied.

연구 동기 및 목표

  • 비영어 언어에서 완전하고 자연스러운 답변을 포함하는 고품질의 다국어 생성형 질문 응답 데이터셋이 부족한 문제를 해결하기 위해.
  • 생성형 질문 응답(GenQA)을 다국어 환경으로 확장하여, 모델이 여러 언어에서 온 정보를 활용해 질문에 답변할 수 있도록 하기 위해.
  • 스팬 추출 방식이 아닌 전체 문장 형식의 답변을 생성함으로써 답변의 자연스러움과 이해 가능성 향상을 위해.
  • 특히 문화적으로 특수한 혹은 영어 중심이 아닌 질문에 대해, 다국어 검색 및 생성의 효과성을 평가하기 위해.
  • 인간이 생성한 기준 답변을 사용하여 일관성 있는 평가 프로토콜을 확립함으로써 애너테이션 일관성 향상시키기 위해.

제안 방법

  • TyDiQA 데이터셋을 확장하여, 아랍어, 베트남어, 영어, 일본어, 러시아어 등 다섯 언어에서 인간이 애너테이션한 자연스럽고 독립적인 답변을 포함하는 다국어 질문 응답 데이터셋인 Gen-TyDiQA를 구축한다.
  • 문서 검색, 답변 문장 선택(AS2), 다국어 모델을 사용한 생성형 답변 생성의 세 단계로 구성된 파이프라인을 설계한다.
  • 질문과 다른 언어의 언어에서 후보 문장을 사용하여 전체 문장 형식의 답변을 생성하는 다국어 생성형 모델(CrossGenQA)을 훈련한다.
  • 평가 시 기준 답변을 사용함으로써 다수 애너테이터 간 일치도를 크게 향상시켰으며, 기준 답변이 없는 경우 Fleiss’ Kappa 0.1387에서 기준 답변이 있는 경우 0.5071로 상승하였다.
  • 표준 BM25 검색기와 다국어 인코더를 사용하여 언어 간 경계를 넘는 검색 및 생성을 가능하게 한다.
  • 정확도 매칭 및 F1 점수를 사용하여 다국어 질문 응답에서 CrossGenQA의 성능을 평가하였으며, 단일 언어 파이프라인 및 AS2 기준 모델과의 비교를 수행하였다.

실험 결과

연구 질문

  • RQ1다국어 생성형 질문 응답 시스템은 다국어 오픈도메인 질문 응답에서 답변 문장 선택 기반 기준 모델을 능가할 수 있는가?
  • RQ2다국어 문단 후보를 사용하면, 답변이 질문 언어와 다를 경우에도 답변 생성 성능이 향상되는가?
  • RQ3인간이 생성한 기준 답변의 사용은 생성형 질문 응답 시스템 평가에서 애너테이션 일관성에 어떤 영향을 미치는가?
  • RQ4왜 CrossGenQA는 영어 질문에서는 단일 언어 GenQA보다 성능이 열 劣하나, 문화적으로 영어 중심이 아닌 질문에서는 어떻게 되는가?
  • RQ5생성형 질문 응답 시스템의 성능은 어느 정도까지 검색기 및 답변 문장 선택 구성 요소의 품질에 의해 제한되는가?

주요 결과

  • CrossGenQA는 아랍어, 베트남어, 영어, 일본어, 러시아어 등 모든 다섯 언어에서 답변 문장 선택(AS2) 기준 모델을 능가하며, 생성형 방식이 추출형 대비 우수한 성능을 보임을 입증한다.
  • CrossGenQA는 아랍어, 러시아어, 일본어에서 단일 언어 GenQA 파이프라인을 초월하며, 다국어 정보 통합이 성능 향상에 기여함을 보여준다.
  • 인간이 생성한 기준 답변의 사용으로 다수 애너테이터 간 일치도가 Fleiss’ Kappa 0.1387에서 0.5071로 상승하여 애너테이션 신뢰도가 크게 향상되었다.
  • 단일 언어 GenQA는 아랍어, 베트남어, 영어, 러시아어에서 추출형 QA 시스템을 능가하며, 전체 문장 생성의 이점이 확인되었다.
  • CrossGenQA의 영어 질문에 대한 성능은 단일 언어 GenQA보다 낮은 편이지만, 이는 문화적으로 특수한 질문이 영어 자료에서 더 잘 해결되기 때문일 가능성이 높다.
  • 문화적으로 특수한 일본어 질문에 대해 테스트한 결과, CrossGenQA는 단일 언어 GenQA를 초월하며, 답변이 영어 중심이 아닌 경우 다국어 생성이 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.