Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Educational Question Generation with Pre-trained Language Models

Sahan Bulathwela, Hamze Muse|arXiv (Cornell University)|2023. 05. 13.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 과학 텍스트에서 사전 훈련을 추가로 수행하고 과학 문제 데이터셋에서 미세조정한 대규모 언어 모델을 기반으로 한 확장 가능한 교육적 질문 생성 모델인 EduQG를 제안한다. 이 방법은 최첨단 기준 모델을 크게 능가하며, 도메인 특화 사전 훈련과 미세조정이 인공지능 생성 질문의 어휘 유창성과 교육적 관련성을 향상시킨다는 것을 입증한다.

ABSTRACT

The automatic generation of educational questions will play a key role in scaling online education, enabling self-assessment at scale when a global population is manoeuvring their personalised learning journeys. We develop extit{EduQG}, a novel educational question generation model built by adapting a large language model. Our extensive experiments demonstrate that extit{EduQG} can produce superior educational questions by further pre-training and fine-tuning a pre-trained language model on the scientific text and science question data.

연구 동기 및 목표

  • 오픈 교육 자원과 MOOC에서의 확장 가능하고 고품질의 교육적 질문의 부족을 해결한다.
  • 사전 훈련된 언어 모델을 과학 및 교육 도메인에 적응시켜 인공지능이 생성한 교육적 질문의 품질을 향상시킨다.
  • 과학 문헌 코퍼스에서의 사전 훈련과 질문-답변 데이터셋에서의 미세조정이 교육적 질문 생성(QG)에 미치는 영향을 조사한다.
  • 도메인 특화 적응을 통해 사전 훈련된 언어 모델이 저비용으로 인간과 유사하고 어휘적으로 타당한 질문을 생성할 수 있음을 입증한다.
  • 기술 기반 학습 환경에서의 확장 가능하고 개인화된 평가 도구를 위한 기반을 제공한다.

제안 방법

  • 교육적 질문 생성을 위한 기초로 사전 훈련된 T5 기반 언어 모델을 활용한다.
  • 과학 개요 코퍼스(S2ORC)의 대규모 과학 문헌을 기반으로 모델을 추가로 사전 훈련하여 도메인 특화 언어 이해 능력을 향상시킨다.
  • 13,679개의 과학 시험 문제로 구성된 SciQ 데이터셋에서 모델을 미세조정하여 질문 생성 품질을 향상시킨다.
  • 자동 평가 지표(BLEU, ROUGE, METEOR, F1, 퍼플렉서티, 다양성)와 인간 평가를 활용하여 질문 품질을 평가한다.
  • 제안된 모델의 성능을 SQuAD 1.1에서 미세조정된 최첨단 기준 모델인 Leaf 모델과 비교한다.
  • 모델 성능에 미치는 사전 훈련 데이터 크기의 영향을 평가하기 위해 다양한 크기의 사전 훈련 데이터를 사용하여 성능을 분석한다.
Figure 1: Methodology for training and evaluating the baseline Leaf model (blue), novel EduQG Small (green) and EduQG Large (yellow) models (and their $\cdot\ +$ counterparts), introducing additional pre-training and fine-tuning steps (green dashed boxes) to address RQ 2,3 and 4.
Figure 1: Methodology for training and evaluating the baseline Leaf model (blue), novel EduQG Small (green) and EduQG Large (yellow) models (and their $\cdot\ +$ counterparts), introducing additional pre-training and fine-tuning steps (green dashed boxes) to address RQ 2,3 and 4.

실험 결과

연구 질문

  • RQ1도메인 특화 데이터로 적응시킨 사전 훈련된 언어 모델이 인간과 유사한 교육적 질문을 생성할 수 있는가?
  • RQ2일반적인 사전 훈련 대비 과학 텍스트에서의 사전 훈련이 교육적 질문 생성 품질 향상에 기여하는가?
  • RQ3사전 훈련 데이터셋의 크기가 질문 생성 모델의 성능에 미치는 영향은 어떠한가?
  • RQ4도메인 특화 질문 데이터셋에서의 미세조정이 고품질 교육적 질문 생성 능력을 추가로 향상시키는가?

주요 결과

  • 과학 초록에서 언어 모델을 사전 훈련하면 일반적인 사전 훈련 대비 생성된 질문의 어휘 유창성과 언어적 타당성이 크게 향상된다.
  • 제안된 모델은 자동 평가 지표에서 최첨단 기준 모델인 Leaf 모델을 능가하며, 특히 ROUGE 및 F1 점수에서 더 나은 의미적 일치를 보여, 기준 질문과의 유사도가 높다는 것을 시사한다.
  • 사전 훈련 데이터의 크기를 늘일수록 질문 생성 품질에 측정 가능한 향상이 나타나며, 데이터 크기의 긍정적 영향을 입증한다.
  • SciQ 데이터셋에서의 미세조정은 특히 과학 분야에서 내용 기반 및 교육 과정에 부합하는 질문 생성 능력을 모델이 더욱 향상시킨다.
  • 모델는 어휘적으로 타당하고 인간과 유사한 질문을 생성하며, 교육 현장에서의 실질적 적용 잠재력이 높다는 것을 시사한다.
  • 현재 결과는 자동 평가 지표와 레이블이 부여된 데이터셋에 의존하고 있어 인간 평가가 다음 단계로 중요하다고 판단되며, 인공지능 생성 질문과 인간 생성 질문 간 직접 비교가 부족하다는 점이 지적된다.
Figure 2: The distribution of (i) BLEU 1, (ii) F1 and (iii) Perplexity Score between the Leaf and EduQG models.
Figure 2: The distribution of (i) BLEU 1, (ii) F1 and (iii) Perplexity Score between the Leaf and EduQG models.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.