Skip to main content
QUICK REVIEW

[논문 리뷰] A Closer Look into Automatic Evaluation Using Large Language Models

Cheng-Han Chiang, Hung-yi Lee|arXiv (Cornell University)|2023. 10. 09.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 LLM 기반 자동 평가에서의 설계 선택 사항을 조사하며, LLM Evaluation (Chiang와 Lee, 2023)와 G-Eval (Liu 등, 2023)을 비교한다. 연구 결과, LLM에게 수치 평점만 출력하도록 강요하는 것은 인간 평가와의 상관관계를 해칠 뿐 아니라, 이성적 설명(자기 설명)을 요구할 경우 상당한 수준의 일치도 향상됨을 확인하였다. 본 연구는 두 개의 메타평가 데이터셋에서 최신 기준(SOTA) 상관관계를 달성하였으며, GPT-4를 사용한 이전 결과를 초월하였다.

ABSTRACT

Using large language models (LLMs) to evaluate text quality has recently gained popularity. Some prior works explore the idea of using LLMs for evaluation, while they differ in some details of the evaluation process. In this paper, we analyze LLM evaluation (Chiang and Lee, 2023) and G-Eval (Liu et al., 2023), and we discuss how those details in the evaluation process change how well the ratings given by LLMs correlate with human ratings. We find that the auto Chain-of-Thought (CoT) used in G-Eval does not always make G-Eval more aligned with human ratings. We also show that forcing the LLM to output only a numeric rating, as in G-Eval, is suboptimal. Last, we reveal that asking the LLM to explain its own ratings consistently improves the correlation between the ChatGPT and human ratings and pushes state-of-the-art (SoTA) correlations on two meta-evaluation datasets.

연구 동기 및 목표

  • LLM 기반 자동 평가에서 인간 평가와의 일치도를 향상시키는 데 핵심이 되는 설계 요소를 특정하는 것.
  • 특히 자동 Chain-of-Thought (CoT)과 출력 형식의 차이가 평가 성능에 미치는 영향을 비교하는 것.
  • LLM의 출력을 수치 평점으로만 제한하는 것이 인간 중심 평가에 최적인지 확인하는 것.
  • 기존의 메타평가 기준 벤치마크에서 LLM 평가와 인간 평가 간 상관관계를 최신 기준(SOTA)으로 향상시키는 것.

제안 방법

  • SummEval(요약)과 Topical-Chat(대화) 두 개의 메타평가 데이터셋에서 분석 실험을 수행한다.
  • 두 가지 프롬프팅 전략을 비교한다: LLM Evaluation(자유형 평점 질문)와 G-Eval(수치 평점 전용 출력 프롬프트).
  • 평가 단계에서 자동 Chain-of-Thought (CoT) 생성의 영향을 평가하며, 인간이 작성한 기준과 LLM이 생성한 기준을 대조한다.
  • LLM 평가와 인간 애너테이션 간의 일치도를 측정하기 위해 피어슨 상관계수와 켄달의 타우를 사용한다.
  • 다양한 출력 형식을 테스트한다: '점수 전용', '평가-설명', '분석-평가'를 통해 이성화 효과를 평가한다.
  • 추론에 GPT-3.5-turbo와 GPT-4를 활용하며, 표본당 평균 20개의 평가를 평균화하여 분산을 줄인다.

실험 결과

연구 질문

  • RQ1자기 생성 Chain-of-Thought (CoT)이 인간 평가와의 상관관계에서 인간이 작성한 평가 단계보다 향상되는가?
  • RQ2LLM의 출력을 수치 평점으로만 제한하는 것이 인간 중심 평가에 최적인가?
  • RQ3LLM이 자신의 평가 근거를 설명하도록 요구하는(이성화) 것이 인간 평가와의 상관관계를 향상시키는가?
  • RQ4제안된 프롬프팅 전략이 SummEval과 Topical-Chat과 같은 메타평가 기준 벤치마크에서 최신 기준(SOTA) 상관관계를 달성할 수 있는가?
  • RQ5다양한 출력 형식(예: '평가-설명' 대비 '점수 전용')이 LLM 기반 평가의 신뢰성과 인간 일치도에 어떤 영향을 미치는가?

주요 결과

  • 자기 생성 Chain-of-Thought (CoT)은 인간 평가와의 상관관계를 일관되게 향상시키지 못하며, 일부 사례에서는 일치도를 감소시키기도 한다.
  • LLM에게 수치 평점만 출력하도록 강요하는 것은 최적의 전략이 아니며, 인간 평가와의 상관관계를 낮춘다.
  • LLM이 자신의 평가를 스스로 설명하도록 요구함으로써 평가의 이성화가 인간 평가와의 상관관계를 크게 향상시킨다.
  • 제안된 방법은 SummEval과 Topical-Chat 양쪽 모두에서 최신 기준(SOTA) 상관관계를 달성하였으며, 일부 결과는 GPT-4를 사용한 이전 SOTA를 초월하였다.
  • '평가-설명' 출력 형식은 인간 애너테이션과의 상관관계 측면에서 '점수 전용'과 '분석-평가'를 모두 뛰어넘어 일관되게 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.