[논문 리뷰] Exploring the Potential of Large Language Models to Generate Formative Programming Feedback
이 연구는 대규모 언어 모델(Large Language Models, LLMs), 특히 ChatGPT가 초보자 프로그래밍 수업 학생들을 대상으로 형성적 프로그래밍 피드백을 생성할 잠재력을 조사한다. CS1 과정에서 수집한 실제 학생의 코드 시퀀스를 사용하여, 저자들은 ChatGPT가 피드백과 올바른 해결책을 얼마나 효과적으로 제공하는지 평가하며, 일부 작업에 대해서는 합리적으로 효과적임을 발견하지만, 올바른 지도 없이 잘못된 정보가 초보자 학습자를 오도할 수 있음을 경고한다.
Ever since the emergence of large language models (LLMs) and related applications, such as ChatGPT, its performance and error analysis for programming tasks have been subject to research. In this work-in-progress paper, we explore the potential of such LLMs for computing educators and learners, as we analyze the feedback it generates to a given input containing program code. In particular, we aim at (1) exploring how an LLM like ChatGPT responds to students seeking help with their introductory programming tasks, and (2) identifying feedback types in its responses. To achieve these goals, we used students' programming sequences from a dataset gathered within a CS1 course as input for ChatGPT along with questions required to elicit feedback and correct solutions. The results show that ChatGPT performs reasonably well for some of the introductory programming tasks and student errors, which means that students can potentially benefit. However, educators should provide guidance on how to use the provided feedback, as it can contain misleading information for novices.
연구 동기 및 목표
- 대규모 언어 모델(Large Language Models)이 초보자 프로그래밍 과제를 해결하기 위해 도움을 요청하는 학생들에게 어떻게 반응하는지 조사하는 것.
- 학생의 코드에 대한 LLM의 반응에서 생성된 피드백 유형을 식별하고 분류하는 것.
- 초보자 프로그래머를 대상으로 한 LLM 기반 피드백의 신뢰성과 교육적 가치를 평가하는 것.
- LLM 기반 피드백에서 오해의 소지가 있는 정보가 초래할 수 있는 위험과 교사의 지도 필요성을 강조하는 것.
제안 방법
- 연구는 CS1 과정에서 수집한 학생의 프로그래밍 시퀀스를 ChatGPT의 입력으로 사용하였다.
- 코드 제출와 함께 구체적인 질문을 제기하여 피드백과 정답을 유도하였다.
- LLM의 응답을 분석하여 피드백 유형을 식별하고 정확성과 유용성을 평가하였다.
- 분석은 일반적인 초보자 프로그래밍 오류와 과제 유형에 집중하였다.
- 연구진은 정확성, 명확성, 교육적 관련성 기반으로 피드백의 품질을 평가하였다.
실험 결과
연구 질문
- RQ1ChatGPT는 초보자 프로그래밍 과제에서 학생의 코드 제출에 어떻게 반응하는가?
- RQ2학생의 코드를 수정해 달라고 요청했을 때 ChatGPT는 어떤 유형의 피드백을 생성하는가?
- RQ3ChatGPT가 초보자 프로그래밍 오류에 대해 제공하는 피드백은 얼마나 정확하고 유용한가?
- RQ4LLM 기반 피드백이 초보자 학습자를 어떻게 오도할 수 있는가?
주요 결과
- ChatGPT는 일부 초보자 프로그래밍 과제와 일반적인 학생 오류에 대해 합리적으로 정확한 피드백을 생성하였다.
- 특히 기본 프로그래밍 구조에서의 문법 오류와 논리 오류에 대해 도움이 되는 피드백을 제공한 경우가 있었다.
- 그러나 모델은 때때로 잘못되거나 오해의 소지가 있는 피드백을 제공하였으며, 특히 더 복잡하거나 모호한 코드에서는 더욱 그러했다.
- 피드백의 품질은 입력의 명확성과 프로그래밍 오류의 성격에 따라 크게 달라졌다.
- 연구는 초보자 학습자가 비판적 평가 없이 잘못된 피드백을 수용할 위험을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.