[논문 리뷰] RikiNet: Reading Wikipedia Pages for Natural Question Answering
RikiNet은 장문의 위키백과 페이지를 대상으로 한 오픈도메인 질의응답을 위한 새로운 기계독해 모델로, 동적 문단 双-주의(reader)와 다중 수준의 계층적 답변 예측기(예측자)를 도입하여 짧은 답변 구간, 긴 답변 문단, 답변 유형을 동시에 예측한다. 장문 답변 과제에서 74.3 F1, 짧은 답변 과제에서 57.9 F1을 기록하며, 자연 질문(Natural Questions) 벤치마크에서 단일 모델로서는 최초로 단일 인간 성능을 초월했다.
Reading long documents to answer open-domain questions remains challenging in natural language understanding. In this paper, we introduce a new model, called RikiNet, which reads Wikipedia pages for natural question answering. RikiNet contains a dynamic paragraph dual-attention reader and a multi-level cascaded answer predictor. The reader dynamically represents the document and question by utilizing a set of complementary attention mechanisms. The representations are then fed into the predictor to obtain the span of the short answer, the paragraph of the long answer, and the answer type in a cascaded manner. On the Natural Questions (NQ) dataset, a single RikiNet achieves 74.3 F1 and 57.9 F1 on long-answer and short-answer tasks. To our best knowledge, it is the first single model that outperforms the single human performance. Furthermore, an ensemble RikiNet obtains 76.1 F1 and 61.3 F1 on long-answer and short-answer tasks, achieving the best performance on the official NQ leaderboard
연구 동기 및 목표
- 장문의 위키백과 문서에서 더 많은 노이즈와 복잡성을 지닌 환경에서 오픈도메인 질문에 대답하는 과제를 해결하기 위해.
- 긴 컨텍스트와 이중 답변 유형(짧은 구간과 긴 문단)으로 인해 기존 모델이 어려움을 겪는 자연 질문(Natural Questions, NQ) 데이터셋에서 성능을 향상시키기 위해.
- 짧은 답변, 긴 답변, 답변 유형을 계층적 순서로 동시에 예측하는 통합 모델을 설계하여 추론 능력과 일반화 능력을 향상시키기 위해.
- 이전 모델들이 짧은 답변과 긴 답변을 별도로 처리하거나 외부 검색에 의존하는 한계를 극복하기 위해.
- 중대한 데이터 증강이나 앙상블 기법 없이도 단일 모델로 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 동적 문단 이중주의(DPDA) 리더는 반복적인 이중주의 메커니즘을 사용하여 문서 토큰과 문단 수준의 표현을 질문에 맞게 학습한다.
- 각 문단 내 핵심 토큰에 집중하기 위해 동적 주의 마스킹을 적용하여 맥락 인식 능력을 향상시키고, 관련 없는 내용으로 인한 노이즈를 줄인다.
- 다중 수준의 계층적 답변 예측기는 짧은 답변 구간, 긴 답변 문단, 답변 유형을 순차적이고 계층적인 방식으로 동시에 예측한다.
- 답변 유형 예측을 위한 보조 사전 지식으로 질문 임베딩을 사용하여, 짧은 답변이 없는 질문에 대해서도 일반화 능력을 향상시킨다.
- fine-tuned wordpiece 토크나이저를 사용하는 BERT 기반 백본과 ReLU 유사 활성화 함수(Tanh)를 적용한 밀집 예측 레이어를 사용하여 출력 헤드를 구성한다.
- 모델은 NQ 데이터에서 엔드 투 엔드로 훈련되며, 전체 위키백과 페이지를 커버하기 위해 슬라이딩 윈도우 방식으로 다수의 문서 스퍼브스를 생성한다.
실험 결과
연구 질문
- RQ1단일 모델이 짧은 답변 구간과 긴 답변 문단을 동시에 예측하면서도 장문의 위키백과 페이지를 효과적으로 다룰 수 있는가?
- RQ2답변 유형, 짧은 답변, 긴 답변을 계층적으로 예측하는 방식이 독립적 또는 순차적 예측 방식보다 성능을 얼마나 향상시키는가?
- RQ3핵심 문단 토큰에 집중된 동적 주의 메커니즘이 장문 문서에서 표현 학습을 얼마나 향상시키는가?
- RQ4질문 수준의 임베딩을 답변 유형 예측의 사전 지식으로 통합함으로써, 특히 짧은 답변이 없는 질문에 대해 모델의 강건성은 얼마나 향상되는가?
- RQ5데이터 증강이나 앙상블 기법 없이도 단일 모델이 자연 질문 벤치마크에서 인간 성능을 초월할 수 있는가?
주요 결과
- RikiNet은 단일 모델로 장문 답변 과제에서 74.3 F1, 짧은 답변 과제에서 57.9 F1을 달성하여 이전 최고의 단일 모델(66.8 및 53.9 F1)을 초월하고, 단일 인간 성능(73.2 및 56.8 F1)을도 초월했다.
- RikiNet의 앙상블 버전은 장문 답변 과제에서 76.1 F1, 짧은 답변 과제에서 61.3 F1을 기록하여, 2019년 11월 29일 기준 공식 NQ 랭킹에서 최신 기술 수준의 성능을 달성했다.
- 절단 실험 결과, 다중 수준의 계층적 예측기와 DPDA 리더 각각이 성능 향상에 기여하며, 비계층적 기반 모델 대비 장문 답변 과제에서 F1 점수를 7점 이상 향상시켰다.
- 질문 임베딩을 답변 유형 예측에서 제거하면 성능 저하가 발생함을 확인하여, 이가 사전 신호로서의 가치가 있음을 입증했다.
- 밀집 예측 레이어를 Bi-LSTM, Transformer, 또는 GELU 활성화 함수를 사용하는 레이어로 대체해도 성능 향상이 미미하여 현재 설계가 거의 최적임을 시사한다.
- 특히 짧은 답변이 없는 질문에 대해 강력한 일반화 능력을 보이며, 통합된 답변 유형 예측 기능 덕분이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.