Skip to main content
QUICK REVIEW

[논문 리뷰] ReCO: A Large Scale Chinese Reading Comprehension Dataset on Opinion

BingningWang, Ting Yao|arXiv (Cornell University)|2020. 06. 22.
Topic Modeling참고 문헌 36인용 수 4
한 줄 요약

ReCO는 실제 검색 쿼리에서 유래한 30만 개의 의견 기반 질문을 포함한 대규모이고 인간이 분석한 중국어 독해 이해 데이터셋이다. 원본 문장과 정제된 지원 증거를 모두 제공하며, 인과적 및 논리적 추론과 같은 깊이 있는 추론 능력이 요구된다. 강력한 베이스라인에도 불구하고 BERT는 인간 성능인 92%에 비해 오직 77%의 정확도를 기록하여 기계 독해 이해의 도전성을 드러낸다.

ABSTRACT

This paper presents the ReCO, a human-curated ChineseReading Comprehension dataset on Opinion. The questions in ReCO are opinion based queries issued to the commercial search engine. The passages are provided by the crowdworkers who extract the support snippet from the retrieved documents. Finally, an abstractive yes/no/uncertain answer was given by the crowdworkers. The release of ReCO consists of 300k questions that to our knowledge is the largest in Chinese reading comprehension. A prominent characteristic of ReCO is that in addition to the original context paragraph, we also provided the support evidence that could be directly used to answer the question. Quality analysis demonstrates the challenge of ReCO that requires various types of reasoning skills, such as causal inference, logical reasoning, etc. Current QA models that perform very well on many question answering problems, such as BERT, only achieve 77% accuracy on this dataset, a large margin behind humans nearly 92% performance, indicating ReCO presents a good challenge for machine reading comprehension. The codes, datasets are freely available at https://github.com/benywon/ReCO.

연구 동기 및 목표

  • 기존 MRC 데이터셋이 사실 기반 질문과 긴 노이즈가 많은 문서에 집중하는 데서 비롯하는 한계를 해결하기 위해.
  • 검색 엔진에서 유래한 실제 세계의 의견 기반 질문을 중심으로 한 대규모이고 고품질의 중국어 MRC 데이터셋을 구축하기 위해.
  • 정답 선택에 대한 의존도를 줄이기 위해 정제된 지원 증거를 제공함으로써, 모델이 추론에 집중하도록 유도하기 위해.
  • 인과적 및 논리적 추론과 같은 복잡한 추론이 요구되는 MRC 작업의 어려움을 평가하기 위해.
  • 현재 모델과 인간 성능 간의 격차를 드러내는 벤치마크를 설정하기 위해.

제안 방법

  • 질문은 실제 사용자 검색 쿼리에서 수집되며, 예/아니요/알 수 없음으로 답변 가능한지 확인하기 위해 필터링된다.
  • 크라우드워커들이 각 쿼리당 10개의 문서를 검색하고, 그 중 하나에서 관련성이 높은 지원 증거 스니펫을 추출한다.
  • 검토자들이 증거를 바탕으로 세 가지 후보 답변(예, 아니요, 불확실)을 제공하여 개괄적 추론을 보장한다.
  • 데이터셋은 전체 문장과 함께 추출된 증거를 포함하여, 정답 선택과 추론 간의 분석이 가능하도록 한다.
  • 엄격한 품질 점검 절차를 통해 높은 데이터 신뢰성과 노이즈 감소를 확보한다.
  • BERT, BiDAF, ELMo 등의 모델들이 ReCO에서 미세조정되며, BERT는 [CLS] 토큰 뒤에 후보 답변을 연결하여 다중 선택 분류에 적합하게 조정된다.

실험 결과

연구 질문

  • RQ1정제된 증거를 제공하는 대규모 의견 기반 MRC 데이터셋이 기존의 사실 기반 중심 데이터셋에 비해 추론 복잡도 측면에서 어떻게 다른가?
  • RQ2BERT와 같은 현재의 사전 훈련된 모델이 인과적 또는 논리적 추론이 요구되는 의견 기반 비사실 기반 질문에 얼마나 일반화되는가?
  • RQ3지원 증거의 포함이 정답 선택 오류의 영향을 줄이고 모델의 추론 능력을 더 잘 분리하는 데 기여하는가?
  • RQ4최첨단 모델과 인간 간의 성능 격차가 MRC에서 추론의 진정한 어려움을 어떻게 반영하는가?
  • RQ5현재 모델이 이 데이터셋에서 가장 어려운 추론 기술은 무엇인가? 예를 들어 인과적 또는 논리적 추론 등.

주요 결과

  • ReCO 데이터셋은 30만 개의 고품질이고 인간이 분석한 의견 기반 질문을 포함하여, 이와 유사한 종류의 가장 큰 알려진 중국어 MRC 데이터셋이다.
  • 현재의 모델, 특히 미세조정된 BERT는 ReCO에서 77%의 정확도를 기록하며 인간 성능인 92%에 크게 못 미친다.
  • 상대적 향상 지수(RI) 지표는 모델과 인간 간의 성능 격차가 크며, 이는 높은 어려움을 시사한다.
  • 지원 증거 대신 전체 문장을 사용할 경우 모델 성능이 크게 떨어지며, 이는 정답 선택이 여전히 핵심 과제임을 확인한다.
  • BERT는 어휘적 및 문법적 작업에선 잘 수행하지만, 인과적 및 논리적 추론과 같은 깊이 있는 추론 능력에선 어려움을 겪으며, 지식 통합 향상의 필요성을 시사한다.
  • 오류 분석 결과, 강력한 사전 훈련을 거친 모델들도 특정 세계 지식이나 복잡한 추론이 요구되는 질문에 실패하는 것으로 나타나, 더 정교한 추론 메커니즘의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.