[논문 리뷰] Automated Distractor and Feedback Generation for Math Multiple-choice Questions via In-context Learning
이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 사용하여 수학 다중선택지 문제(MCQ)의 타당한 오답항과 정보성 피드백 메시지를 자동으로 생성하는 인-컨텍스트 학습 접근법을 제안한다. 기준 없는 평가 지표에서 유망한 결과를 보였지만, LLM이 지시를 잘못 이해하거나 정답을 그대로 복사하는 등의 문제로 인해 현재 LLM의 교육적 피드백 생성 능력에 한계가 드러나며, 이는 교육 분야에서의 LLM 활용에 있어 여전히 해결해야 할 과제임을 시사한다.
Multiple-choice questions (MCQs) are ubiquitous in almost all levels of education since they are easy to administer, grade, and are a reliable form of assessment. An important aspect of MCQs is the distractors, i.e., incorrect options that are designed to target specific misconceptions or insufficient knowledge among students. To date, the task of crafting high-quality distractors has largely remained a labor-intensive process for teachers and learning content designers, which has limited scalability. In this work, we explore the task of automated distractor and corresponding feedback message generation in math MCQs using large language models. We establish a formulation of these two tasks and propose a simple, in-context learning-based solution. Moreover, we propose generative AI-based metrics for evaluating the quality of the feedback messages. We conduct extensive experiments on these tasks using a real-world MCQ dataset. Our findings suggest that there is a lot of room for improvement in automated distractor and feedback generation; based on these findings, we outline several directions for future work.
연구 동기 및 목표
- 수학 다중선택지 문제(MCQ)의 고급 수준의 오답항과 피드백을 수작업으로 제작하는 데 드는 노동력 문제를 해결하기 위해.
- 대규모 언어 모델(LLMs)을 활용해 수학 MCQ의 자동 오답항 및 피드백 생성 가능성을 탐색하기 위해.
- 기존 기준 기반 유사도 지표에 의존하지 않고, 생성된 LLM을 활용해 피드백 품질을 평가할 수 있는 새로운 기준 없는 평가 지표를 개발하고 평가하기 위해.
- 교육적 피드백 생성 과정에서 LLM의 행동 한계, 예를 들어 지시를 잘못 이해하거나 정답 또는 오답항을 그대로 복사하는 등의 문제를 규명하기 위해.
- 다양한 프롬프팅 전략과 평가 방법을 분석함으로써 향후 자동 MCQ 생성 분야의 기초 자료를 제공하기 위해.
제안 방법
- 목표 질문과 유사한 의미적 특성(문장 임베딩를 사용)을 가진 예시를 선택하여 소수의 예시를 기반으로 한 인-컨텍스트 학습을 수행한다.
- 오답항 생성을 조건부 생성 작업으로 설정: 주어진 질문의 본문과 정답을 바탕으로 일반적인 오류 개념에 부합하는 설득력 있는 잘못된 선택지를 생성한다.
- 피드백 생성을 조건부 작업으로 설정: 주어진 질문 본문과 특정 오답항을 바탕으로 학생의 오류를 설명하고 정답으로 이끌어내는 피드백 메시지를 생성한다.
- 기존 기준 없는 지표인 Adj. Pred.과 Dist. Pred.을 도입하여, 실제 기준 참조 없이도 피드백의 유용성과 정보성에 대해 생성된 LLM이 평가하도록 한다.
- 기존 기준 기반 지표(BLEU, ROUGE 등)와 새로운 기준 없는 지표를 모두 활용하여 다양한 프롬프팅 방법에 따른 피드백 품질을 평가한다.
- 실제 수학 MCQ 데이터셋과 학생 응답 통계를 기반으로 정성적 및 정량적 분석을 수행하여 방법의 성능과 오류 패턴을 평가한다.

실험 결과
연구 질문
- RQ1LLM을 활용한 인-컨텍스트 학습이 학생의 일반적인 오류 개념을 반영하는 타당한 오답항을 효과적으로 생성할 수 있는가?
- RQ2LLM이 정답이나 오답항을 그대로 복사하지 않고도 오류를 수정하는 데 도움이 되는 정보성 있는 피드백 메시지를 생성할 수 있는가?
- RQ3기준 없는 LLM 기반 지표는 표준 기준 기반 지표와 비교해 피드백 품질 평가에서 어떻게 다를까? 그리고 기준 참조 스타일에 대한 편향을 줄일 수 있는가?
- RQ4LLM의 피드백 생성 과정에서 주로 발생하는 실패 유형은 무엇이며, 예를 들어 지시를 잘못 이해하거나 도움이 되지 않는 콘텐츠를 생성하는 경우가 발생할 때 평가에 어떤 영향을 미치는가?
- RQ5다양한 프롬프팅 전략(예: 제로샷, kNN 기반 소수 예시, 무작위 예시 기반 소수 예시)이 기준 기반 및 기준 없는 평가 지표에서 각각 어떻게 성능을 내는가?
주요 결과
- kNN 기반 인-컨텍스트 학습 방법(kNN^one)이 기준 없는 지표에서 다른 프롬프팅 전략보다 뛰어난 성능을 보였으며, 이는 고급 수준의 피드백 스타일과 구조를 더 잘 반영하고 있음을 시사한다.
- 제로샷 프롬프팅은 기준 기반 지표에서 가장 높은 점수를 기록했으며, 이는 기준 피드백의 스타일을 모방하는 경향이 있기 때문일 것이다. 그러나 이 경우 피드백에 정답이나 오답항이 포함되는 경우가 많아 교육적 가치가 떨어진다.
- 기준 없는 지표에서는 다양한 방법 간 성능 격차가 기준 기반 지표보다 훨씬 작았으며, 이는 기준 기반 지표가 실제 유용성보다는 스타일 유사도에 치우쳐 있음을 시사한다.
- 기준 피드백은 모든 생성된 피드백보다 기준 없는 지표에서 뛰어난 성능을 보였지만, 예상보다 격차가 작았으며, 이는 LLM이 생성한 피드백가 비록 한계가 있더라도 상당히 효과적으로 작동할 수 있음을 시사한다.
- LLM이 피드백 지시를 잘못 이해하거나 맥락을 忽略(무시)하는 경우(예: 선택지를 집합으로 묘사하는 질문일 경우) 거짓 음성 결과가 자주 발생했으며, 반면 문제를 독립적으로 해결한 채로 유용하지 않은 피드백을 생성하는 경우 거짓 양성 결과가 발생했다.
- 본 연구는 현재의 LLM, 심지어 GPT-4와 같은 고급 모델이라도 일관된 지시 준수나 오류 특정 피드백 생성에 어려움을 겪고 있음을 드러내며, 향후 프롬프팅 엔지니어링 또는 파인튜닝 개선이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.