Skip to main content
QUICK REVIEW

[논문 리뷰] Are Large Language Model-based Evaluators the Solution to Scaling Up Multilingual Evaluation?

Rishav Hada, Varun Gumma|arXiv (Cornell University)|2023. 09. 14.
Evaluation and Performance Assessment인용 수 7
한 줄 요약

이 논문은 GPT-4가 대규모 다국어 평가자로 기능할 수 있는지 여부를 조사하며, 8개 언어와 3개 작업에서 20,000개의 인간 평가를 기반으로 그 평가를 校정한다. GPT-4는 특히 자원이 적고 라틴 알파벳 외의 문자를 사용하는 언어에서 높은 점수를 향한 일관된 편향을 보이며, 이는 신뢰할 수 있는 다국어 평가를 위해 인간 평가 캘리브레이션의 필요성을 강조한다.

ABSTRACT

Large Language Models (LLMs) excel in various Natural Language Processing (NLP) tasks, yet their evaluation, particularly in languages beyond the top $20$, remains inadequate due to existing benchmarks and metrics limitations. Employing LLMs as evaluators to rank or score other models' outputs emerges as a viable solution, addressing the constraints tied to human annotators and established benchmarks. In this study, we explore the potential of LLM-based evaluators, specifically GPT-4 in enhancing multilingual evaluation by calibrating them against $20$K human judgments across three text-generation tasks, five metrics, and eight languages. Our analysis reveals a bias in GPT4-based evaluators towards higher scores, underscoring the necessity of calibration with native speaker judgments, especially in low-resource and non-Latin script languages, to ensure accurate evaluation of LLM performance across diverse languages.

연구 동기 및 목표

  • 영어 외의 언어로 확장하여 대규모 다국어 평가를 효과적으로 수행할 수 있도록 대규모 언어 모델(GPT-4 등)이 인간 평가자에 대한 의존도를 줄일 수 있는지 평가하는 것.
  • 특히 중국어, 일본어, 체코어와 같은 자원이 적고 라틴 알파벳 외의 문자를 사용하는 언어에서의 편향을 규명하고 정량화하는 것.
  • 다양한 언어와 평가 척도에서 LLM 기반 평가 일관성 향상을 위한 다양한 프롬프팅 전략의 효과를 평가하는 것.
  • 인간 평가 결과를 기반으로 LLM 평가자 캘리브레이션 프레임워크를 수립하여, 다양한 작업, 언어, 평가 차원에서 신뢰성 있고 일반화 가능한 평가를 확보하는 것.
  • 비영어 환경에서 인간 평가 캘리브레이션 없이 LLM 기반 평가자를 도입할 경우의 주의를 당부하며 향후 연구를 위한 최선의 실천 방안을 제시하는 것.

제안 방법

  • 3개의 텍스트 생성 작업(예: 요약, 번역, 대화)에서 8개 언어로 20,000개의 인간 평가 점수를 기반으로 GPT-4의 평가를 校정한다.
  • 다양한 언어에서 어법 적합성, 작업 수행도, 안전성, 논리적 일관성, 유창성 등을 평가하는 다차원 평가 프레임워크를 사용한다.
  • 다양한 프롬프팅 전략을 탐색: 단일 척도 프롬프팅 대비 다중 척도 프롬프팅, 소수 예시 제공, 상세 지침 세트 사용.
  • LLM 평가자와 인간 평가자 간의 일치도를 측정하기 위해 백분율 일치도(PA) 및 상관관계 지표(Spearman의 rho 등)를 사용하여 신뢰성 평가.
  • 지침 명확성 및 평가자 성격 설정이 자원이 적고 형태소가 복잡한 언어에서 평가 일관성에 미치는 영향을 평가한다.
  • 인간 평가 결과를 기반으로 LLM 출력을 보정하여 체계적 편향을 줄이는 캘리브레이션 프레임워크를 제안한다.
Figure 1: Pipeline of our experiments involving generation, evaluation, and calibration.
Figure 1: Pipeline of our experiments involving generation, evaluation, and calibration.

실험 결과

연구 질문

  • RQ1GPT-4는 자원이 적고 라틴 알파벳 외의 문자를 사용하는 언어를 포함한 다양한 언어에서 LLM 출력에 대한 신뢰할 수 있는 다국어 평가자로 기능할 수 있는가?
  • RQ2GPT-4와 같은 LLM 기반 평가자들이 높은 점수를 향한 편향을 보이는데, 이 편향은 언어 계열과 자원 수준에 따라 어떻게 달라지는가?
  • RQ3단일 척도 대비 다중 척도 프롬프팅, 소수 예시 제공 등의 다양한 프롬프팅 전략이 LLM 기반 평가의 일관성과 정확성에 어떤 영향을 미치는가?
  • RQ4상세 지침 세트와 평가자 성격 설정이 다국어 LLM 평가에서 편향을 줄이는 데 어떤 영향을 미치는가?
  • RQ5인간 평가 캘리브레이션은 언어적으로 복잡하거나 표현 빈도가 낮은 언어에서 LLM 평가 결과를 인간 공감에 얼마나 잘 맞출 수 있는가?

주요 결과

  • GPT-4 기반 평가자들은 중국어, 일본어와 같은 라틴 알파벳 외 문자를 사용하는 언어와 체코어와 같은 자원이 적은 언어에서 인간 평가자보다 높은 점수를 지속적으로 부여한다.
  • GPT-4와 인간 평가자 간의 백분율 일치도(PA)는 전반적으로 높았지만, 이는 인간 공감에 정확히 일치하는 것이 아니라 모델의 높은 점수 편향 때문이었다.
  • 한 번에 하나의 척도만 평가하는 것이 다중 척도를 한 번에 평가하는 것보다 더 신뢰할 수 있는 결과를 도출했지만, LLM 추론 호출 수가 증가하는 비용이 수반되었다.
  • 소수 예시나 더 상세한 지침을 제공해도 높은 점수 편향이 유의미하게 감소하지 않아, 이는 모델의 행동에 내재된 체계적 문제임을 시사한다.
  • 형태소가 풍부하고 문법이 복잡하거나 훈련 데이터 노출 범위가 제한된 언어에서 이 편향이 가장 두드러졌으며, 이는 LLM이 언어 다양성에 어려움을 겪음을 시사한다.
  • 연구는 LLM 기반 평가자를 비영어 및 자원이 적은 환경에서 인간 평가 캘리브레이션 없이 도입해서는 안 된다고 결론 내린다.
(a) PA by language: Full dataset
(a) PA by language: Full dataset

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.