Skip to main content
QUICK REVIEW

[논문 리뷰] Is GPT-4 a reliable rater? Evaluating Consistency in GPT-4 Text Ratings

Veronika Hackl, Alexandra Elena Müller|arXiv (Cornell University)|2023. 08. 03.
Explainable Artificial Intelligence (XAI)참고 문헌 26인용 수 4
한 줄 요약

이 연구는 고등교육 매크로경제학 과제에서 GPT-4가 구조화된 프롬프트를 사용하여 내용과 스타일을 반복 평가할 때 학생 답변에 대한 평가 일관성을 평가한다. GPT-4는 높은 상호 평가자 간 신뢰도(ICC 0.94–0.99)를 보이며 내용과 스타일을 효과적으로 구분했으며, 스타일 재구성 시 내용 평가가 안정되고 스타일 평가가 감소함으로써 강력하고 일관된 평가 능력을 보였다.

ABSTRACT

This study investigates the consistency of feedback ratings generated by OpenAI's GPT-4, a state-of-the-art artificial intelligence language model, across multiple iterations, time spans and stylistic variations. The model rated responses to tasks within the Higher Education (HE) subject domain of macroeconomics in terms of their content and style. Statistical analysis was conducted in order to learn more about the interrater reliability, consistency of the ratings across iterations and the correlation between ratings in terms of content and style. The results revealed a high interrater reliability with ICC scores ranging between 0.94 and 0.99 for different timespans, suggesting that GPT-4 is capable of generating consistent ratings across repetitions with a clear prompt. Style and content ratings show a high correlation of 0.87. When applying a non-adequate style the average content ratings remained constant, while style ratings decreased, which indicates that the large language model (LLM) effectively distinguishes between these two criteria during evaluation. The prompt used in this study is furthermore presented and explained. Further research is necessary to assess the robustness and reliability of AI models in various use cases.

연구 동기 및 목표

  • 고등교육 맥락에서 반복 평가, 시간 간격, 스타일 변형에 따른 GPT-4의 텍스트 평가 일관성을 평가하기 위해.
  • 형성 평가에서 GPT-4가 내용 및 스타일 차원에 대해 평가자로서 신뢰성 있는지 평가하기 위해.
  • GPT-4가 서면 답변에서 내용 품질과 스타일 품질을 신뢰성 있게 구분할 수 있는지 분석하기 위해.
  • BMBF 자금 지원 프로젝트인 DeepWrite의 실제 교육 상황과 같은 환경에 AI 기반 피드백 통합의 기초를 마련하기 위해.
  • 평가 안정성과 상관관계 분석을 통해 향후 프롬프트 엔지니어링 및 교육 평가 분야의 AI 통합을 안내하기 위해.

제안 방법

  • GPT-4는 표준화된 세부 프롬프트를 사용하여 매크로경제학 과제에서 학생 답변의 내용과 스타일을 두 가지 차원으로 평가하도록 유도하였다.
  • 동일한 답변의 재구성된 버전을 사용하여 시간 간격을 두고 여러 시점에서 평가를 수집하여 일관성 여부를 테스트하였다.
  • 반복 평가 간 상호 평가자 간 신뢰도를 측정하기 위해 분산분석의 일관성 계수(ICC)를 계산하였다.
  • 내용 평가와 스타일 평가 간 상관관계를 평가하기 위해 피어슨 상관계수를 산출하였다.
  • GPT-4의 점수 부여 행동에서 편향 또는 경향을 탐지하기 위해 평가 분포의 왜곡도를 분석하였다.
  • 통계 분석에는 다양한 시간 간격과 답변 유형 간 ICC 값 비교를 포함하여 안정성 평가를 수행하였다.
Figure 1: Flowchart: Generated texts
Figure 1: Flowchart: Generated texts

실험 결과

연구 질문

  • RQ1GPT-4의 평가는 동일한 답변에 대해 시간이 지남에 따라 반복 평가 시 얼마나 일관성 있는가?
  • RQ2GPT-4는 학생 글쓰기에서 내용 품질과 스타일 품질을 어느 정도 신뢰성 있게 구분할 수 있는가?
  • RQ3응답 스타일의 변형은 GPT-4의 내용 평가 및 스타일 평가에 어떤 영향을 미치는가?
  • RQ4다양한 시간 간격과 답변 유형 간 GPT-4 평가의 상호 평가자 간 신뢰도(ICC)는 어느 정도인가?
  • RQ5점수 분포의 왜곡도가 나타내는 바에 따르면 GPT-4의 평가에 체계적인 편향이 존재하는가?

주요 결과

  • GPT-4는 다양한 시간 간격 동안 ICC 점수 0.94에서 0.99 사이로 매우 높은 상호 평가자 간 신뢰도를 보이며 반복 평가에서 강력한 일관성을 보였다.
  • 내용 평가와 스타일 평가 간 상관계수는 0.87로 높아 두 요소가 관련되어 있음에도 불구하고 서로 다른 기준으로 평가되고 있음을 시사한다.
  • 스タイル이 부적절한 방식으로 재구성된 답변에서는 내용 평가가 유지되었고, 스타일 평가가 감소함으로써 GPT-4가 내용과 스타일을 효과적으로 분리 평가할 수 있음을 확인하였다.
  • 내용 평가에는 약간의 우측 왜곡(평균 왜곡도 ≈ 0.10)이 관찰되어 평균적으로 더 관대하거나 높은 내용 점수 경향이 있음을 시사한다.
  • 스타일 평가에는 좌측 왜곡(평균 왜곡도 ≈ -0.03)이 관찰되어 스타일 평가에 더 엄격하거나 보수적인 기준이 적용되고 있음을 나타낸다.
  • 몇 주 간격의 시간 간격을 두고 평가를 비교할 경우 ICC 값이 낮아졌으며, 이는 장기간 간격에서 일관성이 약간 떨어지나, 여전히 높은 신뢰도 범위 내에 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.