Skip to main content
QUICK REVIEW

[논문 리뷰] AI-enhanced Auto-correction of Programming Exercises: How Effective is GPT-3.5?

Imen Azaiz, Oliver Deckarm|arXiv (Cornell University)|2023. 10. 24.
Artificial Intelligence in Healthcare and Education참고 문헌 26인용 수 4
한 줄 요약

이 연구는 GPT-3.5가 초급 프로그래밍 과제에 대해 개인화된 피드백을 생성하는 데 효과적인지 분석하기 위해 실제 학생 제출물을 분석한다. GPT-3.5는 73%의 경우에서 정확성을 올바르게 식별하고, 그 중 59%의 경우에서 고품질의 피드백을 제공하지만, 종종 오류를 잘못 식별하거나 과제 지침을 위반하는 수정을 제안하는 경우가 있다.

ABSTRACT

Timely formative feedback is considered as one of the most important drivers for effective learning. Delivering timely and individualized feedback is particularly challenging in large classes in higher education. Recently Large Language Models such as GPT-3 became available to the public that showed promising results on various tasks such as code generation and code explanation. This paper investigates the potential of AI in providing personalized code correction and generating feedback. Based on existing student submissions of two different real-world assignments, the correctness of the AI-aided e-assessment as well as the characteristics such as fault localization, correctness of hints, and code style suggestions of the generated feedback are investigated. The results show that 73 % of the submissions were correctly identified as either correct or incorrect. In 59 % of these cases, GPT-3.5 also successfully generated effective and high-quality feedback. Additionally, GPT-3.5 exhibited weaknesses in its evaluation, including localization of errors that were not the actual errors, or even hallucinated errors. Implications and potential new usage scenarios are discussed.

연구 동기 및 목표

  • 대규모 고등교육 환경에서 GPT-3.5가 프로그래밍 과제 제출물에 대해 개인화되고 고급 수준의 피드백을 효과적으로 제공할 수 있는지 조사하기 위해.
  • GPT-3.5가 학생의 코드가 기능적으로 정확한지 또는 잘못된지를 판단하는 정확도를 평가하기 위해.
  • GPT-3.5가 생성한 피드백의 품질과 특성, 즉 오류 위치 특정, 힌트의 관련성, 코드 스타일 제안, 과제 지침과의 일치 여부 등을 평가하기 위해.
  • 기존 전자 평가 시스템과 비교했을 때 GPT-3.5가 자동 피드백을 제공하는 데서 보이는 강점과 약점을 규명하기 위해.
  • 형성 평가를 위한 맥락에서 LLM을 프로그래밍 교육 워크플로우에 통합할 때의 실용적 영향과 한계를 탐색하기 위해.

제안 방법

  • LMU 뮌헨의 첫 학기 프로그래밍 과제 두 개에서 실제 학생 제출물을 수집하였다.
  • 각 제출물과 과제 지침을 일관된 프롬프트 구조를 사용한 프롬프트 기반 인터페이스를 통해 GPT-3.5에 제출하였다.
  • 응답 변동성을 줄이기 위해 각 제출물에 대해 세 번의 독립적인 GPT-3.5 추론을 수행하고 결과를 통합하였다.
  • 신뢰성을 확보하기 위해 두 연구자가 반복적 논의를 통해 개발한 코드 체계를 사용해 GPT-3.5의 응답을 수동으로 분류하였다.
  • 정확성, 오류 위치 특정, 힌트의 관련성, 지침 준수 여부, 개인화 정도 등을 기준으로 피드백 품질을 평가하였다.
  • 정답 레이블과 과제 요구사항에 기반해 GPT-3.5의 출력을 비교하여 정확도와 일관성 수준을 측정하였다.

실험 결과

연구 질문

  • RQ1RQ1: GPT-3.5는 학생 제출물의 정확성을 어느 정도 잘 판단하는가?
  • RQ2RQ2: GPT-3.5가 생성한 피드백는 길이, 힌트의 품질, 과제 지침 준수 여부, 오류 위치 특정, 코드 수정 여부, 개인화 정도 측면에서 어떻게 특징지어질 수 있는가?
  • RQ3RQ3: GPT-3.5는 프로그래밍 과제에 대해 개인화된 피드백과 코드 수정을 제공할 때 어떤 강점과 약점을 보이는가?

주요 결과

  • GPT-3.5는 73%의 경우에서 학생 제출물의 정확성을 정확히 식별하였으며, 잘못된 제출물을 식별하는 데서는 정확도가 더 높았다.
  • 정확도가 올바르게 평가된 59%의 경우에서 GPT-3.5는 정확한 오류 위치 특정과 실행 가능한 제안을 포함해 효과적이고 고품질의 피드백을 생성하였다.
  • GPT-3.5는 종종 오류를 잘못 위치 지정하거나 존재하지 않는 문제에 대해 수정을 제안하거나, 실제로 존재하는 버그를 간과하는 경우가 있었다. 특히 문자 대/소문자 표기와 같은 미세한 요소에서 그러한 경향이 두드러졌다.
  • 모델은 종종 과제 지침을 위반하는 피드백을 제공했으며, 예를 들어 요구되는 동작 방식이나 출력 형식을 변경하는 수정을 제안하는 경우가 있었다.
  • GPT-3.5는 기능적 논리에 집중하면서도, 정확한 알고리즘 내에서의 문법 오류를 인식하지 못하는 경우가 있었고, 이러한 오류를 종종 간과했다.
  • 한계가 있음에도 불구하고, GPT-3.5는 수업 조교들이 빠르게 오류를 식별하고 피드백 초안을 작성할 수 있도록 하는 프리-평가 도구로서 잠재력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.