[논문 리뷰] Cosmos QA: Machine Reading Comprehension with Contextual Commonsense Reasoning
Cosmos QA은 명시적 텍스트를 넘어서는 맥락적 상식 추론이 필요한 대규모 객관식 데이터셋을 도입하고, 새로운 BERT 기반의 다중 경로 어텐션 모델을 포함한 다양한 baselines를 평가하여 기계와 인간 성능 간의 상당한 차이를 드러냅니다.
Understanding narratives requires reading between the lines, which in turn, requires interpreting the likely causes and effects of events, even when they are not mentioned explicitly. In this paper, we introduce Cosmos QA, a large-scale dataset of 35,600 problems that require commonsense-based reading comprehension, formulated as multiple-choice questions. In stark contrast to most existing reading comprehension datasets where the questions focus on factual and literal understanding of the context paragraph, our dataset focuses on reading between the lines over a diverse collection of people's everyday narratives, asking such questions as "what might be the possible reason of ...?", or "what would have happened if ..." that require reasoning beyond the exact text spans in the context. To establish baseline performances on Cosmos QA, we experiment with several state-of-the-art neural architectures for reading comprehension, and also propose a new architecture that improves over the competitive baselines. Experimental results demonstrate a significant gap between machine (68.4%) and human performance (94%), pointing to avenues for future research on commonsense machine comprehension. Dataset, code and leaderboard is publicly available at https://wilburone.github.io/cosmos.
연구 동기 및 목표
- 맥락적 상식 추론이 필요한 독해 연구를 촉진한다.
- 일상적 서사를 다양한 원인-결과, 반사실적 사고, 사회적 상식 연구를 위한 대규모 벤치마크(Cosmos QA)를 제공한다.
- 최신 MRC 모델의 성능을 평가하고 맥락적 상식 추론에 특화된 아키텍처를 제안한다.]
- method: [
제안 방법
- Cosmos QA를 블로그 서사에서 35,588개의 질문 세트로 구성하고 사람에 의해 생성된 검증된 질문과 답을 확보한다.
- 질문-선지 다지선다형으로 문제를 형식화하고 답이 불가능한 경우 None-of-the-above를 포함한다.
- 사전 학습된 모델(BERT를 주로)을 Cosmos QA에 대해 미세 조정하고, 전통적 MRC 모델 및 GPT 기반 접근법을 포함한 벤치마크를 비교한다.
- 문단(P), 질문(Q), 후보 답변(A) 간의 상호작용을 모델링하는 다중 경로 주의(attention)를 갖는 BERT 변형을 제안한다.
- 4개의 후보 답변에 대해 소프트맥스와 교차 엔트로피 손실을 사용하는 학습 목표를 정의한다.
- 관련 데이터셋(RACE, SWAG)에 대한 지식 전달 실험을 수행한 뒤 Cosmos에서 평가한다.
실험 결과
연구 질문
- RQ1맥락적 상식 추론이 필요한 질문에서 기존의 독해 모델이 얼마나 잘 수행하는가?
- RQ2문단(P), 질문(Q), 답(A) 간의 다중 경로 주의가 Cosmos QA의 성능을 향상시키는가?
- RQ3관련 데이터셋(RACE, SWAG)으로의 미세 조정이 Cosmos QA 성능에 미치는 영향은 무엇인가?
- RQ4정답이 문맥 단락에 명시되지 않은 경우가 얼마나 자주 발생하며, 어떤 유형의 상식 추론이 가장 도전적인가?
주요 결과
- Cosmos QA는 최적 모델로도 68.4%의 테스트 정확도이며, 인간 성능은 94.0%이다.
- 대부분의 정답(83% 이상)은 단락에 명시되지 않아 맥락적 상식 추론의 필요성을 강조한다.
- BERT 기반 다중 경로 주의 모델은 표준 BERT 미세 조정 대비 향상을 보이며(테스트에서 67.1%에서 68.4%로 증가).
- 사전 학습된 언어 모델은 미세 조정을 통해 전통적인 독해 모델보다 큰 폭으로 우수하다.
- 지식 전달: RACE에서의 직접 전달이 SWAG보다 더 도움이 되며, Cosmos 이전에 SWAG에서 순차적으로 미세 조정하는 것이 큰 이득을 준다.
- 삭제 실험은 P, Q, A 간 상호작용 제거가 성능을 저하시킴을 보여주며, ablation에서 상호작용 제거 시 질문의 기여도가 적어 맥락 의존도가 견고함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.