[논문 리뷰] Exploring the Efficacy of ChatGPT in Analyzing Student Teamwork Feedback with an Existing Taxonomy
본 논문은 기존 분류학에 따라 학생들의 팀워크 코멘트를 라벨링하는 ChatGPT의 능력과 라벨링 정확도를 자체 평가하는 능력을 평가하고, 인간 라벨과의 높은 일치를 발견했습니다.
Teamwork is a critical component of many academic and professional settings. In those contexts, feedback between team members is an important element to facilitate successful and sustainable teamwork. However, in the classroom, as the number of teams and team members and frequency of evaluation increase, the volume of comments can become overwhelming for an instructor to read and track, making it difficult to identify patterns and areas for student improvement. To address this challenge, we explored the use of generative AI models, specifically ChatGPT, to analyze student comments in team based learning contexts. Our study aimed to evaluate ChatGPT's ability to accurately identify topics in student comments based on an existing framework consisting of positive and negative comments. Our results suggest that ChatGPT can achieve over 90\% accuracy in labeling student comments, providing a potentially valuable tool for analyzing feedback in team projects. This study contributes to the growing body of research on the use of AI models in educational contexts and highlights the potential of ChatGPT for facilitating analysis of student comments.
연구 동기 및 목표
- 교육에서 팀워크 피드백 분석의 활용 필요성을 촉진하고 대규모 수업에서 피드백 리뷰의 확장 가능성을 입증한다.
- 기존 분류학의 사전 정의된 주제들로 학생 코멘트를 분류하는 ChatGPT의 능력을 평가한다.
- 인간 채점자에 대한 ChatGPT의 자체 평가 정확도를 평가하여 라벨링의 신뢰성을 가늠한다.
- 교육 피드백의 질적 분석에서 생성형 AI를 활용하는 실용적 시사점과 한계점을 탐구한다.
제안 방법
- 학부 과정의 비식별화된 200개 학생 코멘트로 이루어진 보관 데이터 세트를 테스트 데이터로 사용한다.
- 제공된 분류학에서 주제를 식별하기 위해 ChatGPT-3.5-turbo에 제로샷 프롬프트를 적용한다(긍정적 및 부정적 코멘트).
- 원래 코멘트 ID와 라벨링된 주제를 포함한 표 형식으로 코멘트별 주제를 반환하도록 ChatGPT에 프롬프트를 준다.
- 인간 연구자들이 세 점 척도(정확함, 불분명함, 부정확함)로 ChatGPT의 라벨링 정확도를 평가하게 하여 정확성을 평가한다.
- 모델에 인간 판단에 비해 자신의 라벨링 정확도를 1–10의 서수 척도로 평가하도록 정확도 확인을 프롬프트한다.
실험 결과
연구 질문
- RQ1RQ1: 질문 지시가 조정된 GPT-3.5 모델이 학생 피드백을 분류하여 분류학 기반 카테고리와 인간 라벨 간의 일치를 얼마나 잘 보이나요?
- RQ2RQ2: 모델의 자체 평가 라벨 정확도가 서수 척도상의 인간 평가와 얼마나 잘 일치하나요?
주요 결과
- ChatGPT가 분석된 200개 코멘트에 대해 인간 채점자에 의해 약 85%의 완전한 정확한 라벨을 달성했습니다.
- 모델은 코멘트 전반에 걸쳐 282개의 라벨을 산출했고, 일부 코멘트가 여러 라벨을 받았음을 시사합니다.
- 가장 흔한 오라벨링은 Attended group meetings였으며, 이는 가끔 발생하는 라벨링 오류와 첫 번째 옵션으로의 기본 설정 가능성을 반영합니다.
- 전반적으로 모델은 긍정적 피드백과 건설적 피드백을 모두 포착하고, 정확한 표현을 넘는 의미를 식별하는 능력을 보여주었습니다.
- 연구는 사전 학습된 생성 모델이 미세 조정 없이도 인간 라벨과 높은 정합성을 갖춘 개방형 피드백의 질적 분석이 가능하다고 시사하지만, 감정 분석과 라벨 선택 문제는 여전히 남아 있음을 시사합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.