Skip to main content
QUICK REVIEW

[논문 리뷰] Large Language Models are Not Yet Human-Level Evaluators for Abstractive Summarization

Chenhui Shen, Liying Cheng|arXiv (Cornell University)|2023. 05. 22.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 추상적 요약에 대한 자동 평가자로 대규모 언어 모델(Large Language Models, LLMs)인 ChatGPT와 GPT-4를 평가하며, 기존의 전통적 메트릭보다 성능은 뛰어나지만, 후보 요약 및 차원에 따라 편향되며 인간 평가와의 상관관계가 향상될수록 감소하는 경향으로 인해 일관성 없고 신뢰할 수 없다는 것을 발견했다. 특히 고성능 요약에 대해서는 더욱 그러하다.

ABSTRACT

With the recent undeniable advancement in reasoning abilities in large language models (LLMs) like ChatGPT and GPT-4, there is a growing trend for using LLMs on various tasks. One area where LLMs can be employed is as an alternative evaluation metric for complex generative tasks, which generally demands expensive human judges to complement the traditional automatic metrics for various evaluation dimensions such as fluency and consistency. In this work, we conduct extensive analysis to investigate the stability and reliability of LLMs as automatic evaluators for abstractive summarization. We found that while ChatGPT and GPT-4 outperform the commonly used automatic metrics, they are not ready as human replacements due to significant limitations. That is, LLM evaluators rate each candidate system inconsistently and are dimension-dependent. They also struggle to compare candidates with close performance and become more unreliable with higher-quality summaries by obtaining a lower correlation with humans. In other words, with better abstractive summarization systems being introduced at a fast pace, LLMs may result in misleading and unreliable evaluations.

연구 동기 및 목표

  • LLM이 추상적 요약 시스템 평가에서 인간 평가자들을 신뢰성 있게 대체할 수 있는지 평가하는 것.
  • 다양한 요약 시스템과 평가 차원에서 LLM 기반 평가의 안정성과 일관성 여부를 조사하는 것.
  • LLM 평가자가 고성능 요약 모델들을 구분하는 데에 한계가 있는지 파악하는 것.
  • 인간 검증이 필요하기 전에 신뢰할 수 없는 LLM 평가를 탐지할 수 있는 실용적이고 일시적인 프레임워크를 제안하는 것.

제안 방법

  • 이중 인간 평가 방식을 사용: 리커트 척도 평가(직접 이유 제시 후 평가 및 다중 선택 질문 유도)와 헤드-투-헤드(H2H) 비교.
  • ChatGPT와 GPT-4를 사용해 12개의 추상적 요약 시스템 각각에 대해 100개의 요약 생성 결과를 평가하여 점수와 선호도를 도출.
  • 유창성, 논리성, 일관성, 관련성 등의 차원에서 LLM 점수와 평균 인간 전문가 평가 간 상관관계를 계산.
  • 요약 품질 향상에 따라 LLM의 신뢰도가 어떻게 변화하는지 평가하기 위해 메타상관관계 지표를 도입.
  • 이해관계자 간 일치도를 활용한 신뢰도 검사 프로세스 제안: RTS(이유 제시 후 평가)와 MCQ(다중 선택 질문) 방법 간 일치도가 낮을수록 평가의 신뢰성이 떨어질 수 있음을 시사.
  • 모든 LLM 생성 결과와 코드를 https://github.com/DAMO-NLP-SG/LLM_summeval 에 공개하여 재현 가능성을 확보.

실험 결과

연구 질문

  • RQ1LLM 기반 평가자가 다양한 추상적 요약 시스템에서 인간 평가와의 상관관계 측면에서 어떻게 평가되는가?
  • RQ2LLM 평가자가 동일한 시스템을 다양한 평가 차원에서 평가할 때 얼마나 일관성 있는가?
  • RQ3고품질 요약과 저품질 요약을 비교할 경우 LLM 평가자의 성능은 어떻게 변화하는가?
  • RQ4이유 제시 후 평가(RTS)와 다중 선택 질문(MCQ) 유도 전략 간 일치도가 LLM 평가 신뢰도의 신뢰할 만한 지표가 될 수 있는가?
  • RQ5LLM 평가에 체계적인 편향이 존재하는가? 특히 후보 요약이나 평가 차원에 따라 달라지는가?

주요 결과

  • LLM 평가자(ChatGPT 및 GPT-4)는 ROUGE나 BARTScore와 같은 기존 자동 메트릭보다 인간 평가와의 상관관계에서 뛰어난 성능을 보였다.
  • LLM 평가자가 서로 다른 후보 요약 시스템을 평가할 때 심각한 일관성 부족을 보이며, 이는 후보에 따라 편향되는 경향이 있음을 시사한다.
  • LLM 평가 결과는 평가 차원에 따라 달라지며, 유창성, 논리성, 일관성 등 각 차원에서 인간 평가와의 일치 수준이 다르게 나타난다.
  • 요약 품질이 향상될수록 LLM 평가자가 인간 평가와의 상관관계가 감소하는 현상이 관찰되며, 이를 '부정적 메타상관관계'라고 명명한다.
  • 이유 제시 후 평가(RTS)와 다중 선택 질문(MCQ) 전략 간 일치도는 평가의 신뢰도와 관련이 있으며, 낮은 일치도는 인간 검증이 필요함을 시사한다.
  • RTS와 MCQ 간 일치도를 활용한 제안된 신뢰도 검사 방법은 관련성 차원에서는 효과적이지 않으며, 유의미한 상관관계가 발견되지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.