Skip to main content
QUICK REVIEW

[논문 리뷰] Performance of the Pre-Trained Large Language Model GPT-4 on Automated Short Answer Grading

Gerd Kortemeyer|arXiv (Cornell University)|2023. 09. 17.
Topic Modeling인용 수 5
한 줄 요약

이 연구는 피인자 조정 없이 GPT-4가 SciEntsBank 및 Beetle 데이터셋에서 자동 단답항목 채점(Automatic Short Answer Grading, ASAG) 성능을 평가한다. GPT-4는 이전의 수작업으로 설계된 모델과 유사한 성능을 보였지만, 전문화된 작업에 맞춰 훈련된 LLM보다는 뒤처졌다. 그러나 기준 답변이 없이도 정확하게 채점할 수 있는 강력한 제로샷 능력을 보였다.

ABSTRACT

Automated Short Answer Grading (ASAG) has been an active area of machine-learning research for over a decade. It promises to let educators grade and give feedback on free-form responses in large-enrollment courses in spite of limited availability of human graders. Over the years, carefully trained models have achieved increasingly higher levels of performance. More recently, pre-trained Large Language Models (LLMs) emerged as a commodity, and an intriguing question is how a general-purpose tool without additional training compares to specialized models. We studied the performance of GPT-4 on the standard benchmark 2-way and 3-way datasets SciEntsBank and Beetle, where in addition to the standard task of grading the alignment of the student answer with a reference answer, we also investigated withholding the reference answer. We found that overall, the performance of the pre-trained general-purpose GPT-4 LLM is comparable to hand-engineered models, but worse than pre-trained LLMs that had specialized training.

연구 동기 및 목표

  • 피인자 조정 없이 GPT-4의 제로샷 성능을 자동 단답항목 채점(ASAG)에서 평가하는 것.
  • 표준 벤치마크에서 GPT-4의 ASAG 성능을 전문화된 작업에 맞춰 훈련된 모델과 비교하는 것.
  • GPT-4가 기준 답변에 접근할 수 없을 때도 학생의 답변을 정확히 채점할 수 있는지 조사하는 것.
  • 일반 목적의 LLM을 대량 수강 과정에서 확장 가능하고 자동 피드백을 제공하는 상용 솔루션으로 사용할 수 있는지 평가하는 것.

제안 방법

  • GPT-4는 OpenAI API를 통해 SemEval-2013의 표준 채점 기준을 사용해 SciEntsBank 및 Beetle 데이터셋의 학생 답변을 채점하도록 프롬프트를 제공했다.
  • 프롬프트 조건을 두 가지로 나누어 기준 답변이 제공된 경우와 제공되지 않은 경우를 각각 평가하여 제로샷 채점 능력을 분석했다.
  • 채점은 'ID'와 'correctness' 컬럼을 포함한 구조화된 CSV 형식으로 수행되었으며, 답변은 '정답', '모순', 또는 '오답'으로 레이블링되었다.
  • 성능 평가는 2분류 및 3분류 작업 모두에서 정밀도, 재현율, F1 점수를 사용하여 평가했다.
  • 연구는 데이터셋의 테스트 세트 데이터만 사용했으며 훈련 데이터는 기각했고, 계산 비용이 크기 때문에 추론를 한 번만 수행했다.

실험 결과

연구 질문

  • RQ1GPT-4는 피인자 조정 없이 전문화된 작업에 맞춰 훈련된 모델과 비교해 ASAG 과제에서 어떻게 성능을 내는가?
  • RQ2GPT-4는 기준 답변에 접근할 수 없을 때도 제로샷 환경에서 학생의 답변을 정확히 채점할 수 있는가?
  • RQ3GPT-4의 성능은 일반 과학(SciEntsBank)과 전기/전자 공학(Beetle)과 같은 다양한 교육 분야에서 다를까?
  • RQ4GPT-4의 성능는 지난 10년간 개발된 수작업으로 설계된 모델과 딥러닝 기반 ASAG 모델과 비교해 어떻게 되는가?

주요 결과

  • 기준 답변이 제공된 경우, GPT-4는 2분류 SciEntsBank 데이터셋에서 F1 점수 0.73을, 3분류 Beetle 데이터셋에서 F1 점수 0.65를 기록했다.
  • 기준 답변이 없는 2분류 Beetle 데이터셋에서 GPT-4는 F1 점수 0.74를 기록하여 강력한 제로샷 능력을 입증했다.
  • GPT-4의 성능는 이전의 수작업으로 설계된 모델과 유사했지만, BERT 및 RoBERTa와 같은 전문화된 미세조정된 LLM보다는 항상 뒤져 있었다.
  • 모델는 기준 답변이 없이도 정답과 오답을 정확히 식별하는 데 있어 강건한 성능를 보였으며, 특히 SciEntsBank 데이터셋에서 두드러졌다.
  • GPT-4는 데이터셋에 대해 훈련된 흔적을 보이지 않았다. 예를 들어, Johnny 및 windows 시나리오의 특정 세부 정보를 인식하지 못해 데이터 泄露가 발생하지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.