Skip to main content
QUICK REVIEW

[논문 리뷰] Assessing the Quality of Multiple-Choice Questions Using GPT-4 and Rule-Based Methods

Steven Moore, Huy A. Nguyen|arXiv (Cornell University)|2023. 07. 16.
Software Engineering Research인용 수 7
한 줄 요약

이 연구는 학생이 작성한 다중선택형 질문(MCQ)에서 19개의 일반적인 문항 작성 결함을 탐지하기 위해 규칙 기반 방법과 GPT-4를 평가한다. 규칙 기반 접근 방식은 91%의 정확도를 기록하며 GPT-4의 79%를 능가하여, 생성형 AI의 환각 위험에 의존하지 않고도 교육 평가에서 더 뛰어난 신뢰성을 보여준다.

ABSTRACT

Multiple-choice questions with item-writing flaws can negatively impact student learning and skew analytics. These flaws are often present in student-generated questions, making it difficult to assess their quality and suitability for classroom usage. Existing methods for evaluating multiple-choice questions often focus on machine readability metrics, without considering their intended use within course materials and their pedagogical implications. In this study, we compared the performance of a rule-based method we developed to a machine-learning based method utilizing GPT-4 for the task of automatically assessing multiple-choice questions based on 19 common item-writing flaws. By analyzing 200 student-generated questions from four different subject areas, we found that the rule-based method correctly detected 91% of the flaws identified by human annotators, as compared to 79% by GPT-4. We demonstrated the effectiveness of the two methods in identifying common item-writing flaws present in the student-generated questions across different subject areas. The rule-based method can accurately and efficiently evaluate multiple-choice questions from multiple domains, outperforming GPT-4 and going beyond existing metrics that do not account for the educational use of such questions. Finally, we discuss the potential for using these automated methods to improve the quality of questions based on the identified flaws.

연구 동기 및 목표

  • 학생이 작성한 다중선택형 질문(MCQ)의 낮은 품질 문제를 해결하기 위해, 특히 교육 현장에서 발생하는 문제를 다루기 위해.
  • 규칙 기반 방법이 GPT-4와 같은 대규모 언어 모델보다 다중선택형 질문의 특정 문항 작성 결함 탐지에서 뛰어난 성능을 보일 수 있는지 평가하기 위해.
  • 자동화된 방법이 문법적 또는 구조적 읽기 용이성 외에도 교육적 품질과 관련된 결함을 효과적으로 식별할 수 있는지 평가하기 위해.
  • 다양한 학문 분야에서 학생이 작성한 다중선택형 질문의 품질 제어를 위한 신뢰성 있고 해석 가능하며 교육적으로 기반된 방법을 제공하기 위해.

제안 방법

  • 다중선택형 질문에서 발생할 수 있는 19개의 정의된 문항 작성 결함(예: 모호한 선택지, 이중 부정, 비현실적인 오답 선택지 등)을 탐지하기 위해 맞춤형 규칙 기반 시스템을 개발하였다.
  • 과학, 인문학, 사회과학, STEM 등 네 가지 다른 학문 분야에서 수집한 200개의 학생이 작성한 다중선택형 질문에 규칙 기반 시스템을 적용하였다.
  • 동일한 19개의 결함을 탐지하기 위해 일관된 지시 템플릿을 사용한 제로샷 프롬프팅 설정에서 GPT-4를 활용하여 동일한 다중선택형 질문을 평가하였다.
  • 세 명의 인간 전문가가 각 질문의 결함을 독립적으로 레이블링한 인간 기반 기준(ground truth)과 비교하여 두 방법 모두를 평가하였다.
  • 두 시스템의 결함 탐지 정확도를 비교하기 위해 정밀도, 재현율, F1 점수를 계산하였다.
  • 다양한 학문 분야에서 언어적 및 인지적 요구가 상이한 환경에서도 적용 가능한 일반화 능력을 확보하기 위해, 다양한 학문 분야에서 시험을 실시하였다.

실험 결과

연구 질문

  • RQ1규칙 기반 시스템이 학생이 작성한 다중선택형 질문에서 일반적인 문항 작성 결함을 탐지하는 데 있어 GPT-4를 능가할 수 있는가?
  • RQ2규칙 기반 및 LLM 기반 방법의 성능가 학문 분야에 따라 어떻게 달라지는가?
  • RQ3자동화된 방법이 다중선택형 질문 품질에 대한 인간 레이블링 기준과 어느 정도 일치하는가?
  • RQ4규칙 기반 시스템이 교육 평가 환경에서 LLM보다 더 신뢰성 있고 해석 가능한 결함 탐지 기능을 제공하는가?
  • RQ5자동화된 품질 평가 도구는 기술 기반 학습 환경에서 학생이 작성한 다중선택형 질문의 교육적 타당성을 향상시킬 수 있는가?

주요 결과

  • 규칙 기반 방법은 인간 전문가의 기준에 따라 91%의 정확도를 기록하며, GPT-4의 79%를 뛰어넘었다.
  • 규칙 기반 시스템은 모든 네 가지 학문 분야에서 일관된 성능을 보이며, 강력한 교차 도메인 일반화 능력을 보였다.
  • GPT-4는 높은 거짓 양성률을 보이며, 종종 문제가 없는 요소까지 문제로 간주하여 환각 또는 과도한 해석에 취약함을 보였다.
  • 규칙 기반 접근 방식은 GPT-4보다 더 높은 정밀도와 재현율을 보이며, 인간 전문가의 기준과 더 잘 일치함을 확인하였다.
  • 이 연구는 규칙 기반 시스템이 다중선택형 질문의 특정이고 잘 정의된 교육적 품질 기준에 대해 LLM보다 더 신뢰할 수 있음을 확인한다.
  • 문항 작성 결함의 자동 탐지는 교육 기술 플랫폼에서 학생이 작성한 평가 자료의 품질 향상에 효과적으로 활용될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.