Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-task Learning with Multi-head Attention for Multi-choice Reading Comprehension

Hui Wan|arXiv (Cornell University)|2020. 02. 26.
Topic Modeling참고 문헌 11인용 수 9
한 줄 요약

이 논문은 DREAM 데이터셋에서 다중 선택 독해 이해를 위한 다중 작업 학습 접근법을 제안한다. ALBERT-xxlarge와 이중 다중 헤드 공주의 (DUMA) 모듈을 사용하며, DREAM 및 RACE 데이터셋에서 동시 학습함으로써 테스트 정확도 91.8%의 새로운 최고 성능을 달성하였다. 대화체 형식과 서술체 형식의 맥락 차이가 있음에도 불구하고 일반화 능력 향상과 지식 전이 효과 덕분에 이전 방법들을 능가하였다.

ABSTRACT

Multiple-choice Machine Reading Comprehension (MRC) is an important and challenging Natural Language Understanding (NLU) task, in which a machine must choose the answer to a question from a set of choices, with the question placed in context of text passages or dialog. In the last a couple of years the NLU field has been revolutionized with the advent of models based on the Transformer architecture, which are pretrained on massive amounts of unsupervised data and then fine-tuned for various supervised learning NLU tasks. Transformer models have come to dominate a wide variety of leader-boards in the NLU field; in the area of MRC, the current state-of-the-art model on the DREAM dataset (see[Sunet al., 2019]) fine tunes Albert, a large pretrained Transformer-based model, and addition-ally combines it with an extra layer of multi-head attention between context and question-answer[Zhuet al., 2020].The purpose of this note is to document a new state-of-the-art result in the DREAM task, which is accomplished by, additionally, performing multi-task learning on two MRC multi-choice reading comprehension tasks (RACE and DREAM).

연구 동기 및 목표

  • DREAM 데이터셋은 상대적으로 작고 도전적인 다중 선택 독해 이해 작업의 성능 향상.
  • 더 큰 관련 다중 선택 MRC 데이터셋(RACE)에서의 지식 전이가 DREAM에서의 일반화 능력과 성능 향상에 기여하는지 조사.
  • 다른 맥락 형식을 가진 두 개의 유사한 MRC 작업 간에 공유된 모델 아키텍처를 사용한 다중 작업 학습의 효과 평가.
  • 다중 헤드 어텐션 메커니즘(DUMA)이 공동 학습 환경에서 맥락, 질문, 보기 간의 추론을 향상시킬 수 있는지 검증.

제안 방법

  • DREAM 및 RACE 데이터셋 모두에 대해 사전 학습된 ALBERT-xxlarge 모델을 주 엔코더로 미세조정.
  • 맥락과 질문-보기 쌍 간의 교차 어텐션을 계산하기 위해 이중 다중 헤드 공주의(DUMA) 모듈을 사용하여 깊은 상호작용을 가능하게 함.
  • <sep> 토큰을 사용해 맥락, 질문, 보기 옵션을 하나의 시퀀스로 결합하고, 이를 엔코더 및 DUMA 레이어에 입력.
  • 두 DUMA 어텐션 표현(맥락 → QA 및 QA → 맥락)에 대해 평균 풀링을 적용하고 이를 분류를 위해 연결.
  • 교답 손실 함수를 사용해 답변 옵션에 대한 선형 분류기로 최적화하여 답변 예측을 위한 학습 수행.
  • DREAM 및 RACE 데이터셋의 크기에 비례하여 미니배치를 샘플링함으로써 다중 작업 학습을 구현하며, 모든 모델 구성 요소를 공유.

실험 결과

연구 질문

  • RQ1두 다중 선택 MRC 데이터셋(DREAM 및 RACE)에서의 동시 학습이 더 작은 DREAM 데이터셋의 성능 향상에 기여하는가?
  • RQ2공유된 모델 아키텍처를 사용한 다중 작업 학습이 대화체 형식과 서술체 형식의 맥락 간에 유용한 추론 패턴을 전이하는가?
  • RQ3이중 다중 헤드 공주의 메커니즘(DUMA) 통합이 다중 선택 독해 이해 성능에 어떤 영향을 미치는가?
  • RQ4다중 작업 학습이 DREAM과 같은 저자원 MRC 데이터셋에서 과적합을 완화하고 일반화 능력을 향상시키는 데 어느 정도 기여하는가?
  • RQ5RACE와 DREAM 간의 도메인 또는 형식 차이로 인한 잠재적 부정적 간섭을 감안할 때, 다중 작업 학습으로부터의 성능 향상이 그에 비해 유의미한가?

주요 결과

  • 제안된 다중 작업 학습 모델은 DREAM 데이터셋에서 새로운 최고 성능인 91.8%의 테스트 정확도를 달성하였으며, 이는 Zhu 등(2020)이 이전에 기록한 90.4%를 초월하였다.
  • DREAM 데이터셋은 더 작고 대화체 맥락을 사용하는 반면 RACE는 서술체 맥락을 사용하지만, 여전히 동시 학습으로부터 상당한 이점을 얻었다.
  • 단일 작업 설정에서 ALBERT-xxlarge + DUMA를 적용한 결과, 개발 세트에서 90.7%, 테스트 세트에서 88.6%의 성능를 기록하여 강력한 기준 성능를 확보하였다.
  • 다중 작업 학습 설정은 단일 작업 기준 및 이전 최고 성능보다 개발 세트 및 테스트 세트 양쪽에서 성능 향상을 보였다.
  • 결과는 유사하지만 동일하지 않은 MRC 작업 간에 추론 패턴을 효과적으로 전이할 수 있음을 시사하며, 맥락 형식의 차이가 있음에도 불구하고 성능 향상이 가능하다.
  • 모델의 성능 향상은 공유 표현 학습을 통해 더 큰 관련 데이터셋을 활용해 저자원 MRC 작업의 성능을 향상시키는 데서 가치가 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.