Skip to main content
QUICK REVIEW

[논문 리뷰] Multiple-Choice Question Generation: Towards an Automated Assessment Framework

Vatsal Raina, Mark Gales|arXiv (Cornell University)|2022. 09. 23.
Topic Modeling인용 수 15
한 줄 요약

이 논문은 문맥 단락에서 질문, 정답, 오답 선택지를 추출하거나 답변 인식 프롬프트에 의존하지 않고, 완전히 자동화되고 엔드 투 엔드로 작동하는 다중 선택 문제 생성(MCQG) 프레임워크를 제안한다. 새로운 평가 프레임워크를 도입하여 문법적 정확성, 답변 가능성, 다양성, 복잡도를 자동화된 메트릭을 사용해 평가한다. T5 기반 MCQG에 필터링을 적용한 결과, RACE++ 데이터셋에서 답변 가능성은 100%에 도달했고 다양성은 66.29%를 기록했으며, 하류 MCMRC 성능 향상에 미미한 기여를 하였다.

ABSTRACT

Automated question generation is an important approach to enable personalisation of English comprehension assessment. Recently, transformer-based pretrained language models have demonstrated the ability to produce appropriate questions from a context paragraph. Typically, these systems are evaluated against a reference set of manually generated questions using n-gram based metrics, or manual qualitative assessment. Here, we focus on a fully automated multiple-choice question generation (MCQG) system where both the question and possible answers must be generated from the context paragraph. Applying n-gram based approaches is challenging for this form of system as the reference set is unlikely to capture the full range of possible questions and answer options. Conversely manual assessment scales poorly and is expensive for MCQG system development. In this work, we propose a set of performance criteria that assess different aspects of the generated multiple-choice questions of interest. These qualities include: grammatical correctness, answerability, diversity and complexity. Initial systems for each of these metrics are described, and individually evaluated on standard multiple-choice reading comprehension corpora.

연구 동기 및 목표

  • 고엔트로피 다중 선택 문제 생성(MCQG) 시스템 평가에 있어서 n-그램 기반 메트릭의 한계를 해결하기 위해.
  • 명시적인 어휘 추출이나 답변 인식 프롬프트 없이 질문, 정답, 오답 선택지를 생성하는 완전히 자동화된 엔드 투 엔드 MCQG 시스템을 개발하기 위해.
  • 문법적 유창성, 답변 가능성, 다양성, 복잡도를 평가하는 종합적인 자동 평가 프레임워크를 설계하고 검증하기 위해.
  • 기준 기반 메트릭을 초월해 확장 가능하고 신뢰성 있으며 품질 기반의 MCQG 시스템 평가를 가능하게 하기 위해.
  • 다중 선택 기반 기계 독해(MCMRC)에서의 데이터 증강을 위한 MCQG의 효과를 향상시키기 위해.

제안 방법

  • 입력 문맥 단락에서 완전한 MCQ를 엔드 투 엔드로 생성하기 위해 T5 기반의 시퀀스 투 시퀀스 모델을 사용한다.
  • 4개 이상의 고유한 선택지가 없거나, 다수의 MCMRC 모델 앙상블에서 일관성 없는 예측을 보이는 질문을 제거하기 위해 필터링 파이프라인을 적용한다.
  • 사전 훈련된 언어 모델을 사용해 유창성 오류를 탐지함으로써 문법적 정확성을 측정한다.
  • 고성능 MCMRC 모델 앙상블의 예측 불확실성 추정치를 통해 답변 가능성을 평가한다.
  • 생성된 질문들 간의 질문 유형 분포에 대한 엔트로피를 측정하여 다양성을 정량화한다.
  • 질문의 구조와 추론 깊이를 기반으로 복잡도 점수(easy/medium/hard)를 할당하기 위해 지도 학습 분류기를 훈련한다.

실험 결과

연구 질문

  • RQ1완전히 자동화되고 엔드 투 엔드로 작동하는 MCQG 시스템이 어휘 추출이나 답변 인식 프롬프트 없이도 고품질의 질문, 정답, 타당한 오답 선택지를 생성할 수 있는가?
  • RQ2MCQG 시스템에서 문법적 정확성, 답변 가능성, 다양성, 복잡도를 신뢰성 있고 자동으로 평가할 수 있는 방법은 무엇인가?
  • RQ3자동화된 메트릭이 MCQG에서 질문 품질 평가에 인간의 판단과 얼마나 관련이 있는가?
  • RQ4MCQG로 생성된 질문들이 하류 MCMRC 작업의 훈련 데이터 증강에 효과적으로 기여할 수 있는가?
  • RQ5제안된 평가 메트릭은 RACE++ 데이터셋 외부로도 일반화 가능한가?

주요 결과

  • 필터링을 적용한 T5 기반 MCQG 시스템은 RACE++ 데이터셋에서 100%의 답변 가능성과 66.29%의 다양성을 기록하여 유효하고 다양한 질문 생성 능력을 입증하였다.
  • 자동 평가 프레임워크는 기준 기반 메트릭에 의존하지 않고도 문법적 유창성, 답변 가능성, 다양성, 복잡도와 같은 핵심 품질 차원을 성공적으로 포착하였다.
  • 필터링된 MCQG 데이터를 사용한 데이터 증강으로 인해 하류 MCMRC 성능이 Dev에서 0.36% 향상되었고, Evl에서 0.12% 향상되었다.
  • GPT-3가 생성한 질문은 다양성(51.04%)이 낮고 답변 불가능성(71.10%)이 높아, 출력 품질에 한계가 있음을 시사하였다.
  • 복잡도 분류기는 쉽게, 중간, 어려움으로 나누어진 질문들 사이에 명확한 구분을 보였으며, 이는 인지적 부담을 평가하는 데의 유용성을 입증하였다.
  • 평가 프레임워크는 일부 오답 선택지가 실제로 정답으로 타당한 경우가 있음을 드러내어, 오답 선택지 생성 전략의 개선이 필요함을 시사하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.