Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating ChatGPT and GPT-4 for Visual Programming

Adish Singla|arXiv (Cornell University)|2023. 07. 30.
Software Engineering ResearchComputer Science인용 수 3
한 줄 요약

이 연구는 GPT-4와 ChatGPT(GPT-3.5)가 Hour of Code와 Karel의 시각 프로그래밍 작업에서 실행 추적, 해법 합성, 작업 합성 능력을 평가한다. GPT-4가 ChatGPT보다 향상되었음에도 불구하고, 두 모델 모두 시각 프로그래밍에 필수적인 공간적 사고, 논리적 사고, 프로그래밍 능력을 통합하는 데 빈약한 성능을 보이며, 현재의 생성형 AI가 K-8 교육 환경에서 시각 프로그래밍에 미치는 영향에 상당한 한계가 있음을 시사한다.

ABSTRACT

Generative AI and large language models have the potential to drastically improve the landscape of computing education by automatically generating personalized feedback and content. Recent works have studied the capabilities of these models for different programming education scenarios; however, these works considered only text-based programming, in particular, Python programming. Consequently, they leave open the question of how well these models would perform in visual programming domains popularly used for K-8 programming education. The main research question we study is: Do state-of-the-art generative models show advanced capabilities in visual programming on par with their capabilities in text-based Python programming? In our work, we evaluate two models, ChatGPT (based on GPT-3.5) and GPT-4, in visual programming domains for various scenarios and assess performance using expert-based annotations. In particular, we base our evaluation using reference tasks from the domains of Hour of Code: Maze Challenge by Code-dot-org and Karel. Our results show that these models perform poorly and struggle to combine spatial, logical, and programming skills crucial for visual programming. These results also provide exciting directions for future work on developing techniques to improve the performance of generative models in visual programming.

연구 동기 및 목표

  • 최신 생성형 AI 모델인 GPT-4와 ChatGPT가 텍스트 기반 파이썬 프로그래밍에서와 동일한 성능을 내는지 조사하기 위해.
  • 이러한 모델이 시각 프로그래밍 도메인 내에서 세 가지 핵심 교육 시나리오인 실행 추적, 해법 합성, 작업 합성에서의 능력을 평가하기 위해.
  • 전문가 기반 주석을 사용하여 성능을 평가하고, 시각 프로그래밍을 위한 다중모odal 추론에 필요한 격차를 파악하기 위해.
  • K-8 컴퓨팅 교육에서 시각 프로그래밍을 위한 생성형 모델 향상에 기초를 마련하기 위해.

제안 방법

  • 실행 추적, 해법 합성, 작업 합성의 세 가지 시나리오에서 ChatGPT(GPT-3.5)와 GPT-4를 평가하였다.
  • 코드 크기, 깊이, 구조의 복잡도가 다양하게 설정된 두 도메인에서 10개의 기준 작업을 선택하였다: Hour of Code: Maze Challenge (HoCMaze)와 Karel.
  • 이진 메트릭을 사용하여 출력 품질을 전문가 기반 주석으로 평가하였다: LayoutCorrect, TaskSolvedByCode, TaskSolvedByEdittedCode, TaskSolvable, Overall.
  • 각 시나리오에 맞는 프롬프트를 설계하여 입력 코드와 작업 사양을 자리표시자로 처리함으로써 평가 간 일관성을 확보하였다.
  • 10개의 인스턴스에 걸쳐 결과를 집계하고, 각 메트릭의 성능을 백분율로 보고하였으며, 인간 평가자가 출력 결과를 검증하였다.
  • 작은 코드 수정을 고려하여 실제 교육 상황을 반영하기 위해 유연한 해법 가능성 기준(TaskSolvable)을 사용하였다.

실험 결과

연구 질문

  • RQ1최신 생성형 모델인 GPT-4와 ChatGPT는 텍스트 기반 프로그래밍에서와 동일한 성능을 내는가?
  • RQ2이 모델들은 시각 프로그램에 대해 올바른 실행 추적을 얼마나 잘 생성하는가?
  • RQ3이 모델들은 주어진 시각 프로그래밍 작업에 대해 유효한 해법을 합성할 수 있는가?
  • RQ4이 모델들은 주어진 해법 코드를 바탕으로 새로운, 해결 가능한 시각 프로그래밍 작업을 생성할 수 있는가?

주요 결과

  • GPT-4는 작업 합성에서 20.0%의 Overall 점수를 기록했고, ChatGPT는 10.0%를 기록하여 명백한 향상이 있었지만 여전히 빈약한 성능을 보였다.
  • GPT-4는 LayoutCorrect에서 90.0%, TaskSolvable에서 80.0%를 기록했지만, TaskSolvedByCode에서는 0.0%를 기록하여 입력 코드로 해결되지 않는 정확한 구조적 작업을 생성하는 것으로 나타났다.
  • 두 모델 모두 복잡한 작업, 예를 들어 HoCMaze:18과 Karel:Stairway에서 공간적 사고, 논리적 구조, 프로그래밍 논리의 통합에 있어 심각한 어려움을 겪었다.
  • 입력 코드로 올바르게 해결 가능한 작업을 생성하지 못했으며, 두 모델 모두 TaskSolvedByCode에서 0.0%의 성공률 기록을 보였다.
  • GPT-4는 LayoutCorrect(90.0% 대비 70.0%)와 TaskSolvable(80.0% 대비 50.0%)에서 ChatGPT보다 뚜렷한 향상을 보였지만, 기능적 정확성에서는 그렇지 않았다.
  • 예시를 통해 GPT-4가 벽의 위치나 목표 위치를 잘못 설정하여 입력 코드가 실패하게 만드는 작업을 생성하는 것으로 나타났다. 이는 구조는 올바르지만 기능적으로는 잘못된 경우를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.