Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating ChatGPT's Decimal Skills and Feedback Generation in a Digital Learning Game

Huy Nguyen, Hayden Stec|arXiv (Cornell University)|2023. 06. 29.
Online Learning and AnalyticsComputer Science인용 수 3
한 줄 요약

이 연구는 디지털 학습 게임 환경에서 챗지피티의 소수 산술 문제 해결 능력, 학생의 자가설명 평가 능력, 피드백 생성 능력을 평가한다. 5,000개 이상의 학생 응답을 포함한 '소수점' 게임 데이터를 바탕으로 챗지피티는 개념적 질문에서는 뛰어난 성능을 보였고, 높은 품질의 피드백을 생성했지만, 소수 자릿값과 수직선 문제에서는 어려움을 겪어 학생 응답의 75%만 정확하게 평가했다.

ABSTRACT

While open-ended self-explanations have been shown to promote robust learning in multiple studies, they pose significant challenges to automated grading and feedback in technology-enhanced learning, due to the unconstrained nature of the students' input. Our work investigates whether recent advances in Large Language Models, and in particular ChatGPT, can address this issue. Using decimal exercises and student data from a prior study of the learning game Decimal Point, with more than 5,000 open-ended self-explanation responses, we investigate ChatGPT's capability in (1) solving the in-game exercises, (2) determining the correctness of students' answers, and (3) providing meaningful feedback to incorrect answers. Our results showed that ChatGPT can respond well to conceptual questions, but struggled with decimal place values and number line problems. In addition, it was able to accurately assess the correctness of 75% of the students' answers and generated generally high-quality feedback, similar to human instructors. We conclude with a discussion of ChatGPT's strengths and weaknesses and suggest several venues for extending its use cases in digital teaching and learning.

연구 동기 및 목표

  • 대규모 언어 모델인 챗지피티가 디지털 학습 환경에서 개방형 학생 자가설명을 효과적으로 평가할 수 있는지 평가하는 것.
  • 특히 자릿값과 수직선 표현을 포함한 소수 산술 문제의 정확도를 측정하여 챗지피티의 문제 해결 능력을 조사하는 것.
  • 틀린 학생 응답에 대해 챗지피티가 생성한 피드백의 품질과 정확도를 평가하는 것.
  • 기술 기반 학습 환경에서 인간 강사의 피드백과 비교하여 챗지피티의 피드백 품질을 평가하는 것.
  • 수학 교육 분야에서 자동 형성 평가를 위한 LLM(대규모 언어 모델) 사용의 강점과 한계를 규명하는 것.

제안 방법

  • 디지털 학습 게임 '소수점'을 사용한 학생들의 5,000개 이상의 개방형 자가설명 응답 데이터셋을 활용하였다.
  • 각 학생의 응답을 해당 소수 문제와 함께 챗지피티에 제시하여 정확성 평가 및 피드백 생성을 수행하였다.
  • 채점 정확도 평가를 위해 챗지피티의 응답을 기준값(정답)과 비교하였다.
  • 인간 레이블러가 제공한 정확성 레이블을 사용하여 챗지피티의 정확한 학생 응답과 잘못된 응답을 식별하는 능력을 측정하였다.
  • 정성적 및 정량적 분석을 통해 피드백 품질을 인간 강사의 피드백과 비교하였으며, 명확성, 구체성, 교육적 가치를 기준으로 평가하였다.
  • 문제를 유형(예: 개념적, 자릿값, 수직선 등)으로 분류하여 문제 유형 간 성능 차이를 평가하였다.

실험 결과

연구 질문

  • RQ1챗지피티는 자릿값과 수직선 표현을 포함한 소수 산술 문제를 정확하게 해결할 수 있는가?
  • RQ2챗지피티는 소수 수학 문제에서 학생이 제공한 개방형 자가설명의 정확성을 얼마나 정확하게 판단할 수 있는가?
  • RQ3틀린 학생 응답에 대해 챗지피티가 생성한 피드백의 품질은 인간 강사의 피드백과 비교해 어떻게 되는가?
  • RQ4챗지피티가 가장 어려움을 겪는 소수 문제의 유형은 무엇이며, 그 이유는 무엇인가?
  • RQ5챗지피티는 기술 기반 학습 환경에서 인간 채점의 확장 가능한 대안으로 얼마나 유용한가?

주요 결과

  • 챗지피티는 학생 응답의 75%에 대해 정확도를 평가하여 개방형 수학 설명의 자동 채점에서 뛰어난 성능을 보였다.
  • 챗지피티는 소수 비교 및 등가성 이해와 같은 개념적 소수 질문에서 뛰어난 성능을 보였다.
  • 모델는 소수 자릿값과 수직선 표현 문제에서 심각한 어려움을 겪었으며, 추론과 평가에서 눈에 띄는 오류를 보였다.
  • 인간 평가자들이 챗지피티가 생성한 피드백을 높은 품질로 평가하였으며, 명확성, 구체성, 교육적 관련성 면에서 인간 강사의 피드백과 유사한 수준을 보였다.
  • 높은 품질의 피드백을 제공함에도 불구하고, 챗지피티의 성능은 문제 유형 간에 일관되지 않았으며, 영역별 한계가 뚜렷하게 드러났다.
  • 이 연구는 LLM(대규모 언어 모델)이 교육 게임에서 자동 피드백 생성에 효과적으로 활용될 수 있음을 확인했지만, 특정 수학적 내용 영역에 대해서는 신중한 검증이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.