Skip to main content
QUICK REVIEW

[논문 리뷰] Students' Perceptions and Preferences of Generative Artificial Intelligence Feedback for Programming

Zhengdong Zhang, Zihan Dong|arXiv (Cornell University)|2023. 12. 17.
Software Engineering Research인용 수 4
한 줄 요약

이 연구는 CS1 과정에서 Java 프로그래밍 과제에 대해 학생들이 챗지피티가 생성한 피드백을 어떻게 인식하는지 평가한다. 쇼트의 형성적 피드백 프레임워크를 사용하여, 학생들은 코드가 프롬프트에 포함된 경우 LLM 피드백을 매우 형성적으로 본다. 구체적이고 수정 지시가 포함되며 코드 예시가 있는 피드백을 선호하며, 어조의 개인화와 정확성 향상이 필요하다고 제안한다.

ABSTRACT

The rapid evolution of artificial intelligence (AI), specifically large language models (LLMs), has opened opportunities for various educational applications. This paper explored the feasibility of utilizing ChatGPT, one of the most popular LLMs, for automating feedback for Java programming assignments in an introductory computer science (CS1) class. Specifically, this study focused on three questions: 1) To what extent do students view LLM-generated feedback as formative? 2) How do students see the comparative affordances of feedback prompts that include their code, vs. those that exclude it? 3) What enhancements do students suggest for improving AI-generated feedback? To address these questions, we generated automated feedback using the ChatGPT API for four lab assignments in the CS1 class. The survey results revealed that students perceived the feedback as aligning well with formative feedback guidelines established by Shute. Additionally, students showed a clear preference for feedback generated by including the students' code as part of the LLM prompt, and our thematic study indicated that the preference was mainly attributed to the specificity, clarity, and corrective nature of the feedback. Moreover, this study found that students generally expected specific and corrective feedback with sufficient code examples, but had diverged opinions on the tone of the feedback. This study demonstrated that ChatGPT could generate Java programming assignment feedback that students perceived as formative. It also offered insights into the specific improvements that would make the ChatGPT-generated feedback useful for students.

연구 동기 및 목표

  • 학생들이 형성적 피드백 품질 측면에서 LLM이 생성한 프로그래밍 과제 피드백을 어떻게 인식하는지 조사하는 것.
  • 학생들이 자신의 코드를 포함한 프롬프트와 포함하지 않은 프롬프트에서 생성된 피드백을 비교하여 선호도를 평가하는 것.
  • LLM이 생성한 피드백의 유용성과 명확성을 향상시키기 위해 학생들이 제안하는 실질적인 개선 사항을 특정화하는 것.
  • 초기 컴퓨터 과학 수업에서 챗지피티를 사용해 형성적 피드백을 자동화하는 가능성 평가하기.

제안 방법

  • LLM이 생성한 피드백를 챗지피티 API를 사용해 CS1 실습 과제 4개에 대해 자동 생성하였으며, 프롬프트에 학생의 코드를 포함하거나 포함하지 않은 경우로 나누어 진행하였다.
  • 쇼트의 형성적 피드백 지침을 기반으로 설문 조사 실시하여 피드백 품질에 대한 인식 평가.
  • 개방형 설문 응답에 대한 주제 분석을 수행하여 피드백 선호도 및 개선 제안의 이유를 이해.
  • 2023년 여름, 미국의 공립 대학에 소속된 58명의 컴퓨터 과학 전공 학부생으로부터 데이터 수집.
  • 정량적 분석을 통해 형성적 피드백으로 간주한 학생 비율을 평가하였으며, 주관적 기준으로 70% 기준을 설정.
  • 개방형 질문에 대한 응답 분석을 통해 피드백 어조 선호도 분석 수행.

실험 결과

연구 질문

  • RQ1쇼트의 지침에 따르면 학생들은 LLM이 생성한 피드백를 얼마나 형성적으로 인식하는가?
  • RQ2학생들은 프롬프트에 자신의 코드가 포함된 경우와 포함되지 않은 경우의 피드백를 어떤 기준으로 비교 평가하는가? (인식된 품질과 유용성 측면에서)
  • RQ3학생들은 LLM이 생성한 피드백의 명확성, 구체성, 수정 지시의 정확성을 향상시키기 위해 어떤 구체적인 개선 사항을 제안하는가?
  • RQ4성과 수준(예: 만점 vs. 낮은 점수)에 따라 학생들의 피드백 선호도는 어떻게 다름?
  • RQ5피드백 어조는 학생들의 인식에 어떤 역할을 하는가? 긍정적 어조와 비판적 어조 중 선호도가 다원적인가?

주요 결과

  • 70% 이상의 학생들이 LLM이 생성한 피드백를 쇼트의 기준에 부합하는 효과적인 형성적 피드백으로 인식하였다.
  • 학생들은 프롬프트에 자신의 코드가 포함된 피드백을 강하게 선호하였으며, 더 구체적이고 명확하며 수정 지시가 강화된 피드백로 인식하였다.
  • 학생들은 항상 더 구체적이고 명확하며 예시가 풍부한 피드백을 요청하였으며, 특히 개선을 위한 가이드로 사용할 수 있는 정확한 코드 스니펫이 포함된 피드백을 요구하였다.
  • 어조 선호도에 차이가 있었으며, 117명 중 3명은 긍정적이고 격려하는 어조를 선호하였고, 5명은 더 비판적이고 오류 중심의 어조를 선호하였다.
  • 만점 받은 학생들은 교과서를 초월한 피드백에 더 관심을 보였고, 낮은 점수를 받은 학생들은 외부 학습 자료를 찾는 데 더 관심을 가졌다.
  • 학생들은 LLM이 맥락과 사고 방식을 충분히 이해하지 못하는 한계를 지적하였으며, 학생 개개인의 필요를 더 잘 이해할 수 있도록 모델의 인지 능력 향상이 필요하다고 제안하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.