Skip to main content
QUICK REVIEW

[논문 리뷰] Analyzing ChatGPT's Aptitude in an Introductory Computer Engineering Course

Sanjay Deshpande, Jakub Szefer|arXiv (Cornell University)|2023. 03. 13.
Artificial Intelligence in Healthcare and Education인용 수 5
한 줄 요약

이 연구는 야후 대학교의 기초 컴퓨터 공학 수업에서 GPT-3를 ChatGPT 및 OpenAI API를 통해 평가하며, 퀴즈, 과제, 시험 및 랩 과제 등 다양한 평가 유형에서의 성능을 분석한다. 개념적이고 단답형 질문에 대해서는 정확하고 인간처럼 들리는 답변을 생성하지만, 다이어그램 기반, 시각적, 실습 기반 구성 요소에서는 실패하여 현재 구현된 방식으로는 수업을 통과할 수 없다.

ABSTRACT

ChatGPT has recently gathered attention from the general public and academia as a tool that is able to generate plausible and human-sounding text answers to various questions. One potential use, or abuse, of ChatGPT is in answering various questions or even generating whole essays and research papers in an academic or classroom setting. While recent works have explored the use of ChatGPT in the context of humanities, business school, or medical school, this work explores how ChatGPT performs in the context of an introductory computer engineering course. This work assesses ChatGPT's aptitude in answering quizzes, homework, exam, and laboratory questions in an introductory-level computer engineering course. This work finds that ChatGPT can do well on questions asking about generic concepts. However, predictably, as a text-only tool, it cannot handle questions with diagrams or figures, nor can it generate diagrams and figures. Further, also clearly, the tool cannot do hands-on lab experiments, breadboard assembly, etc., but can generate plausible answers to some laboratory manual questions. One of the key observations presented in this work is that the ChatGPT tool could not be used to pass all components of the course. Nevertheless, it does well on quizzes and short-answer questions. On the other hand, plausible, human-sounding answers could confuse students when generating incorrect but still plausible answers.

연구 동기 및 목표

  • 학부 수준의 컴퓨터 공학 수업에서 ChatGPT가 다양한 평가 유형에 대해 정확한 해결책을 생성하는 데 효과적인지 평가하는 것.
  • GPT-3와 같은 텍스트 중심의 대규모 언어 모델이 컴퓨터 공학 교육에서 흔히 사용되는 시각적 및 다이어그램 기반 구성 요소를 다룰 수 있는 데에 한계가 있음을 규명하는 것.
  • 실제 수업 환경에서 ChatGPT가 학업적 부정행위나 학습 지원 수단으로 사용될 수 있는지 평가하는 것.
  • 진술표, 논리 게이트, 상태 기계 등 기술적 다이어그램을 해석하고 생성할 수 있도록 LLM을 향한 향상 방안을 제안하는 것.
  • 해결책의 질과 생성 속도를 균형 있게 평가하기 위해 '분당 정확도' 지표를 도입하고 적용하는 것.

제안 방법

  • 퀴즈, 과제, 시험 및 랩 과제 등 수업 질문에 대해 GPT-3 Davinci 모델을 사용한 OpenAI API를 활용해 응답을 생성했다.
  • 재현 가능성을 확보하기 위해 JSON 형식으로 저장된 결과를 확보하기 위해 커스텀 파이썬 기반 솔루션 생성기로 모델 출력을 수집하고 분석했다.
  • 해결책의 정확성과 생성 속도를 균형 있게 평가하는 데 사용된 신규 개발된 '분당 정확도' 지표를 평가에 적용했다.
  • 정확성, 완전성, 타당성에 중점을 두고 모델 출력을 표준 학생 제출물과 비교했다.
  • max_tokens와 같은 API 파라미터가 출력 품질에 미치는 영향을 탐색했으며, 값이 너무 낮을 경우 잘린 결과가 발생하는 것으로 확인했다.
  • 반복적으로 발생하는 문제들—읽을 수 없는 ASCII 아트, 잘못된 또는 손상된 이미지 링크, 맥락에 따라 잘못 해석되는 현상—을 식별했다.

실험 결과

연구 질문

  • RQ1ChatGPT는 기초 컴퓨터 공학 수업의 퀴즈, 과제, 시험 및 랩 질문에 대해 정확하고 타당한 답변을 생성할 수 있는가?
  • RQ2다이어그램이나 실습 기반 구성 요소가 필요한 평가 유형에서 ChatGPT의 성능은 어떻게 변할까? 특히 그러한 요소가 포함된 평가 유형에서의 성능 변화를 분석한다.
  • RQ3ChatGPT의 출력물이 얼마나 정확한 학생의 작업처럼 보일 수 있는가? 이는 학업적 비정상 행위를 가능하게 할 수 있는가?
  • RQ4현재 텍스트 중심의 LLM이 컴퓨터 공학 교육에서 필수적인 시각적 및 다이어그램 기반 콘텐츠를 다룰 수 있는 데에 있어 핵심적인 한계는 무엇인가?
  • RQ5기술적 공학 수업에서 학생의 작업을 효과적으로 지원하거나 대체할 수 있도록 LLM이 개선되어야 할 사항은 무엇인가?

주요 결과

  • ChatGPT는 단답형 및 개념적 퀴즈 질문에서 잘 수행되었으며, 종종 정확하고 인간처럼 들리는 응답을 생성했다.
  • 모델은 진술표, 논리 게이트 회로도, 상태 기계 다이어그램, 웨이브폼 다이어그램 등의 다이어그램을 해석하거나 생성하지 못했다.
  • 시각적 추론이 필요한 질문에 대해 모델은 때로 읽을 수 없는 ASCII 아트나 잘못된 이미지 링크를 생성했다.
  • 비록 설득력 있는 설명을 생성했지만, 브레드보드나 회로 조립과 같은 실습 기반 랩 과제를 수행할 수는 없었다.
  • 이 평가를 위해 OpenAI API를 사용한 비용은 약 $2.14였으며, GPT-3 Davinci 모델을 1,000 토큰당 $0.12의 가격으로 사용했다.
  • 분당 정확도 지표는 GPT-3가 생성한 해결책이 학생의 작업보다 정확도가 낮지만, 속도는 수십만 배 빠르게 생성되는 것으로 나타나, 속도와 정확도 사이의 상충 관계를 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.