[논문 리뷰] Automated Feedback in Math Education: A Comparative Analysis of LLMs for Open-Ended Responses
이 연구는 개방형 수학 문제에 대한 자동 점수 매기기와 피드백을 제공하기 위해 미세조정된 Mistral 기반 GOAT, SBERT-Canberra, 및 제로샷 GPT-4의 세 모델을 평가한다. GOAT는 점수 정확도에서 SBERT-Canberra를 능가하지만, GPT-4는 인간 평가자들이 선호하는 더 높은 품질의 보다 구체적인 피드백을 생성한다. 이는 LLM 기반 교육 시스템에서 점수 정확도와 피드백 품질 사이의 상충 관계를 시사한다.
The effectiveness of feedback in enhancing learning outcomes is well documented within Educational Data Mining (EDM). Various prior research has explored methodologies to enhance the effectiveness of feedback. Recent developments in Large Language Models (LLMs) have extended their utility in enhancing automated feedback systems. This study aims to explore the potential of LLMs in facilitating automated feedback in math education. We examine the effectiveness of LLMs in evaluating student responses by comparing 3 different models: Llama, SBERT-Canberra, and GPT4 model. The evaluation requires the model to provide both a quantitative score and qualitative feedback on the student's responses to open-ended math problems. We employ Mistral, a version of Llama catered to math, and fine-tune this model for evaluating student responses by leveraging a dataset of student responses and teacher-written feedback for middle-school math problems. A similar approach was taken for training the SBERT model as well, while the GPT4 model used a zero-shot learning approach. We evaluate the model's performance in scoring accuracy and the quality of feedback by utilizing judgments from 2 teachers. The teachers utilized a shared rubric in assessing the accuracy and relevance of the generated feedback. We conduct both quantitative and qualitative analyses of the model performance. By offering a detailed comparison of these methods, this study aims to further the ongoing development of automated feedback systems and outlines potential future directions for leveraging generative LLMs to create more personalized learning experiences.
연구 동기 및 목표
- 개방형 수학 문제에 대해 정확한 점수와 의미 있는 피드백을 생성하는 데에 미세조정된 LLM의 효과를 평가하는 것.
- 미세조정된 Mistral 기반 모델(GOAT)이 SBERT-Canberra 및 제로샷 GPT-4와 비교하여 자동 점수 매기기 및 피드백 생성 성능에서 어떻게 나타나는지 비교하는 것.
- 수업 경험이 있는 인간 평가자들이 피드백의 품질, 관련성, 유용성 측면에서 세 모델 중 어느 것을 선호하는지 평가하는 것.
- 특히 교사가 제공한 응답에 변동성이 있는 상황에서 훈련 데이터의 품질과 일관성이 모델 성능에 미치는 영향을 조사하는 것.
- 현재 자동 피드백 시스템의 한계를 규명하고 향후 개인화 및 신뢰성 향상에 기여할 방향을 제시하는 것.
제안 방법
- 중학 수학 문제에 대한 학생 응답과 교사가 제공한 점수 및 피드백을 포함한 데이터셋을 기반으로, Mistral 기반 LLM(GOAT)을 미세조정한다.
- 동일한 데이터셋을 사용하여 SBERT-Canberra 모델을 훈련시켜 자동 점수 매기기의 기준선으로 활용하며, 응답 평가에 의미적 유사도를 활용한다.
- GPT-4에 대해 미세조정 없이 제로샷 프롬프팅 전략을 적용하여, 점수 매기기 및 피드백 생성을 위한 상세한 평가 기준을 제공한다.
- 두 명의 경험이 풍부한 교사가 사용한 공통 평가 기준을 활용하여, 블라인드 비교 평가 방식으로 점수 정확도와 피드백 품질을 평가한다.
- 점수 예측의 정량적 분석과 인간 평가자들을 활용한 피드백 내용의 정성적 분석을 동시에 수행한다.
- 이전 연구에서 확보한 교사 일관성 데이터를 활용하여 성능 변동성을 맥락화하고, 모델 훈련의 한계를 설명한다.
실험 결과
연구 질문
- RQ1미세조정된 GOAT 모델은 개방형 학생 응답에 대해 교사가 부여한 점수를 SBERT-Canberra와 비교해 볼 때 어떻게 성능을 발휘하는가?
- RQ2제로샷 GPT-4 모델은 개방형 수학 문제에 대한 자동 점수 매기기 작업에서 미세조정된 GOAT 모델과 비교해 어떻게 성능을 내는가?
- RQ3피드백의 품질, 관련성, 유용성 측면에서 인간 평가자(수업 경험이 있는 자)들이 SBERT-Canberra, GOAT, 또는 GPT-4 중 어느 모델을 선호하는가?
- RQ4훈련 데이터의 품질, 특히 일관성 없거나 저품질인 교사 피드백이 미세조정된 GOAT 모델의 성능에 어떤 영향을 미치는가?
- RQ5인간 평가자들이 점수 매기기 및 피드백 부여에서 나타내는 일관성의 부족은 자동 피드백 시스템의 평가 및 校정에 어떤 영향을 미치는가?
주요 결과
- GOAT는 SBERT-Canberra보다 점수 정확도에서 뛰어나며, 후자 모델이 간과한 교사 점수 기준의 패턴을 식별했다.
- GPT-4가 생성한 피드백은 인간 평가자들로부터 GOAT 및 SBERT-Canberra와 비교해 훨씬 더 높은 품질, 구체성, 유용성로 평가받았다.
- GOAT의 피드백는 훈련 데이터의 품질을 그대로 반영하여, 저품질, 모호하거나 동기 부여를 떨어뜨리는 메시지도 포함되어 있었으며, 이는 교사의 잘못된 예시에서 학습한 결과로 보인다.
- 인간 평가자들은 피드백 평가에서 상당한 변동성을 보였으며, 최상위 교사조차도 우연의 경우를 초월해 73%의 일관성만 확보하였다. 이는 인간 평가의 주관성에 기인함을 반영한다.
- 연구 결과, 교사의 피드백는 종종 공개된 평가 기준과 일치하지 않으며, 많은 교사들이 정신적 모델이나 맥락적 요소에 의존하는 것으로 나타났다. 이는 자동 피드백의 정렬을 복잡하게 만든다.
- 높은 점수 성능에도 불구하고, GOAT의 피드백 품질은 훈련 데이터의 품질에 의해 제한되었으며, 이는 모델 성능이 데이터 품질과 다양성에 의해 제약받음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.