Skip to main content
QUICK REVIEW

[논문 리뷰] Assessing the societal influence of academic research with ChatGPT: Impact case study evaluations

Kayvan Kousha, Mike Thelwall|arXiv (Cornell University)|2024. 10. 25.
Artificial Intelligence in Healthcare and EducationMedicine인용 수 3
한 줄 요약

이 연구는 영국의 REF2021에서 수집한 6,220개의 영향 사례 연구(Impact Case Studies, ICS)를 GPT-4o-mini를 사용하여 분석함으로써, ChatGPT가 학술 연구의 사회적 영향을 효과적으로 평가할 수 있는지 평가한다. 입력으로 제목과 요약만 제공하고 평가 지침을 수정한 결과, 전문가 평가 점수와 높은 상관관계(r = 0.56)를 보였으며, 특히 심리학 및 스포츠 과학 분야에서 두드러진 성과를 보여, ChatGPT가 영향 평가의 보조 도구로의 가능성을 입증한다.

ABSTRACT

Academics and departments are sometimes judged by how their research has benefitted society. For example, the UK Research Excellence Framework (REF) assesses Impact Case Studies (ICS), which are five-page evidence-based claims of societal impacts. This study investigates whether ChatGPT can evaluate societal impact claims and therefore potentially support expert human assessors. For this, various parts of 6,220 public ICS from REF2021 were fed to ChatGPT 4o-mini along with the REF2021 evaluation guidelines, comparing the results with published departmental average ICS scores. The results suggest that the optimal strategy for high correlations with expert scores is to input the title and summary of an ICS but not the remaining text, and to modify the original REF guidelines to encourage a stricter evaluation. The scores generated by this approach correlated positively with departmental average scores in all 34 Units of Assessment (UoAs), with values between 0.18 (Economics and Econometrics) and 0.56 (Psychology, Psychiatry and Neuroscience). At the departmental level, the corresponding correlations were higher, reaching 0.71 for Sport and Exercise Sciences, Leisure and Tourism. Thus, ChatGPT-based ICS evaluations are simple and viable to support or cross-check expert judgments, although their value varies substantially between fields.

연구 동기 및 목표

  • 대규모 언어 모델인 ChatGPT가 전문 평가자들의 보조 도구로써 학술 연구의 사회적 영향을 평가할 수 있는지 조사하는 것.
  • 전문가가 부여한 영향 점수와의 일치도를 극대화하기 위한 최적의 입력 구성(예: 제목, 요약, 전문 문서)을 규명하는 것.
  • 평가 지침의 수정이 모델 성능 및 공식 부서 점수와의 상관관계에 미치는 영향을 평가하는 것.
  • 영국의 연구 우수성 프레임워크(REP)에 속한 34개의 평가 단위(Unit of Assessment, UoA) 간 분야별 성능 차이를 분석하는 것.

제안 방법

  • 영국의 REF2021 데이터베이스에서 6,220개의 공개된 영향 사례 연구(Impact Case Studies, ICS)를 확보하였다.
  • 각 ICS의 제목과 요약만 GPT-4o-mini에 입력하고, 공식 REF2021 평가 지침의 수정된 버전을 함께 제공하였다.
  • 모델이 보다 엄격하고 일관성 있게 평가하도록 하기 위해 REF2021 지침을 수정하였다.
  • 모델이 산출한 점수를 모든 34개의 평가 단위(Unit of Assessment, UoA)에서 공개된 부서 평균 ICS 점수와 비교하였다.
  • 모델 점수와 전문가 점수 간 피어슨 상관계수를 계산하였으며, 이는 평가 단위 및 부서 수준에서 모두 수행되었다.
  • 분야별 성능 차이를 분석하여 높은 성능 및 낮은 성능을 보이는 학문 분야를 특정하였다.

실험 결과

연구 질문

  • RQ1영향 사례 연구의 제목과 요약만 제공할 경우, ChatGPT는 학술 연구의 사회적 영향을 정확하게 평가할 수 있는가?
  • RQ2REF2021 평가 지침을 수정하면 ChatGPT가 산출한 점수와 전문가가 부여한 점수 간 상관관계에 어떤 영향을 미치는가?
  • RQ3다양한 학문 분야에서 ChatGPT가 산출한 영향 점수와 공식 부서 평균 점수 간 일치 수준은 어떠한가?
  • RQ4영국의 연구 우수성 프레임워크(REP)의 34개 평가 단위(UoA) 간 모델 성능은 어떻게 변동하는가?
  • RQ5ChatGPT는 연구 평가의 전문가 영향 평가 과정에서 얼마나 신뢰할 수 있는 보조 도구로 활용될 수 있는가?

주요 결과

  • 모델가 산출한 점수와 전문가 점수 간 상관관계가 가장 높은 결과는 각 영향 사례 연구의 제목과 요약만 입력했을 때였으며, 심리학, 정신의학 및 신경과학 분야에서 상관계수 r = 0.56를 기록하였다.
  • 상관계수는 경제학 및 경제통계 분야에서 0.18에서부터 심리학, 정신의학 및 신경과학 분야에서 0.56까지 변동하여 분야 간 성능 차이가 뚜렷하게 나타났다.
  • 부서 수준에서 가장 높은 상관계수는 스포츠 및 운동과학, 레저 및 관광 분야에서 0.71에 도달하여 특정 분야에서 모델과 전문가 간 높은 일치도를 보였다.
  • REF2021 지침을 보다 엄격한 평가를 유도하도록 수정함으로써 모델의 일관성과 전문가 판단과의 일치도가 향상되었다.
  • 모델은 모든 34개의 평가 단위에서 일관된 성능을 보였으며, 모든 분야에서 양의 상관관계를 보여 광범위한 적용 가능성을 시사했다.
  • 결과적으로 ChatGPT는 연구 평가의 전문가 영향 평가 과정에서 실용적이고 확장 가능한 보조 도구로 활용될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.