[논문 리뷰] Automatic Generation of Multiple-Choice Questions
이 논문은 문법적으로 올바르고 맥락적으로 관련된 다중선택형 문제(MCQ)를 자동으로 생성하기 위한 두 가지 딥러닝 방법—TP3(사전/사후처리를 갖춘 T5 기반 엔드 투 엔드 모델)와 MetaQA(의미적 및 문법적 태그를 사용하는 메타시퀀스 학습 접근법)—을 제안한다. 이 시스템은 SAT 연습 시험에서 97%의 정확도를 기록하며, 고급 수준의 오답 선택지를 생성하여 높은 품질의 질문을 제공한다. 오답 선택지 중 96%는 충분한 혼란을 유도하고, 84%의 MCQ는 완전히 적절하다.
Creating multiple-choice questions to assess reading comprehension of a given article involves generating question-answer pairs (QAPs) and adequate distractors. We present two methods to tackle the challenge of QAP generations: (1) A deep-learning-based end-to-end question generation system based on T5 Transformer with Preprocessing and Postprocessing Pipelines (TP3). We use the finetuned T5 model for our downstream task of question generation and improve accuracy using a combination of various NLP tools and algorithms in preprocessing and postprocessing to select appropriate answers and filter undesirable questions. (2) A sequence-learning-based scheme to generate adequate QAPs via meta-sequence representations of sentences. A meta-sequence is a sequence of vectors comprising semantic and syntactic tags. we devise a scheme called MetaQA to learn meta sequences from training data to form pairs of a meta sequence for a declarative sentence and a corresponding interrogative sentence. The TP3 works well on unseen data, which is complemented by MetaQA. Both methods can generate well-formed and grammatically correct questions. Moreover, we present a novel approach to automatically generate adequate distractors for a given QAP. The method is a combination of part-of-speech tagging, named-entity tagging, semantic-role labeling, regular expressions, domain knowledge bases, word embeddings, word edit distance, WordNet, and other algorithms.
연구 동기 및 목표
- 읽기 이해 평가를 위한 문법적으로 정확하고 맥락적으로 관련된 다중선택형 문제(MCQ)를 자동으로 생성하는 데 도전하는 것.
- 오답 선택지가 문법적으로 정확할 뿐 아니라 의미적으로 관련 있고 충분히 혼란스럽게 만들어, 원본 기사의 이해가 필요하도록 하는 방법을 개발하는 것.
- 품질과 관련성 향상을 위해 품사 태깅, 명명된 실체 인식, 의미 역할 레이블링 등의 자연어 처리 기법을 통합하는 것.
- 실제 SAT 연습 독해 시험을 대상으로 생성된 MCQ를 평가하여 높은 정확도와 교육 현장에서의 실용성을 확보하는 것.
- 딥러닝 기반 생성에 메타시퀀스 학습 접근법을 융합하여 일반화 능력을 향상시키고 비일관된 질문 생성을 줄이는 것.
제안 방법
- TP3는 사전 처리 파이프라인을 통해 적절한 정답을 선별하고, 사후 처리 파이프라인을 통해 비일관된 질문을 걸러내기 위해 미세조정된 T5 트랜스포머 모델을 사용한다.
- MetaQA는 의미 역할(SR), 품사(POS), 명명된 실체(NE) 태그로 구성된 메타시퀀스를 사용하여 서술문과 그에 해당하는 의문문을 표현한다.
- 학습 데이터에서 메타시퀀스-서술문-의문문 쌍(MSDIP)을 학습하여 메타시퀀스의 매칭 및 변환을 통해 서술문을 의문문으로 매핑한다.
- 오답 선택지 생성을 위해 대상 단어를 세 유형—유형-1(정량적), 유형-2(사람/장소/조직), 유형-3(기타)—으로 분류하고, 유형별로 특화된 대체 전략을 적용한다.
- 품사 태깅, 명명된 실체 인식, 의미 역할 레이블링, fastText 임베딩을 통합하여 오답 선택지의 문법적 정확성과 의미적 타당성을 확보한다.
- 오답 선택지를 생성할 때는 대상 단어를 의미적으로 유사하고 문법적으로 일관된 대체어로 교체하면서 품사와 문법적 구조를 유지한다.

실험 결과
연구 질문
- RQ1사전 및 사후 처리 파이프라인을 갖춘 T5 기반 엔드 투 엔드 모델이 높은 정확도로 문법적으로 정확하고 맥락적으로 관련된 다중선택형 문제를 생성할 수 있는가?
- RQ2의미적 및 문법적 태그를 사용하는 메타시퀀스 학습 접근법이 서술문에서 다양하고 일관된 질문을 효과적으로 생성할 수 있는가?
- RQ3자연어 처리 도구와 유형별 대체 전략의 조합이 문법적으로 정확하고 충분히 혼란스러운 오답 선택지를 생성할 수 있는가?
- RQ4생성된 MCQ가 실제 SAT 연습 시험 문제의 품질과 난이도 수준에 얼마나 부합하는가?
- RQ5생성된 오답 선택지가 질문 수준의 분석을 넘어서 기사 전체의 이해가 필요하도록 하는 데 얼마나 효과적인가?
주요 결과
- MetaQA 모델은 공식 SAT 연습 독해 시험에서 97%의 정확도를 기록하여 실제 세계의 다양한 문장 패턴에서 뛰어난 성능을 입증했다.
- TP3 모델은 시험되지 않은 데이터셋인 Gaokao-EN 데이터셋에서 95% 이상의 정확도를 기록하여 뛰어난 일반화 능력을 보였다.
- 생성된 오답 선택지 중 98%(303개 중 296개)가 질문과 관련이 있었고 충분한 혼란을 유도하여 의미적 타당성이 높음을 나타냈다.
- 오답 선택지 중 96%(303개 중 291개)가 충분한 혼란을 유도하여, 기사의 이해 없이 질문만으로는 정답을 선택할 수 없음을 의미한다.
- 생성된 MCQ 중 84%가 완전히 적절했으며, 모든 세 개의 오답 선택지가 문법적으로 정확하고 관련이 있었고 충분히 혼란스러웠다.
- 모든 생성된 오답 선택지가 문법적으로 정확했고, 문법 오류로 인해 어떤 MCQ도 기각되지 않아 높은 언어적 품질을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.