Skip to main content
QUICK REVIEW

[논문 리뷰] An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4

Hui Huang, Bu, Xingyuan|arXiv (Cornell University)|2024. 03. 05.
Artificial Intelligence in Law인용 수 11
한 줄 요약

이 논문은 LLM 평가를 위한 미세 조정된 평가자 모델을 실증적으로 평가하고, 동일 도메인에서는 탁월하지만 작업별 특수성, 스킴에 과적합, 일반화 및 공정성 측면에서 GPT-4에 비해 저조하다는 것을 보여준다.

ABSTRACT

Recently, there has been a growing trend of utilizing Large Language Model (LLM) to evaluate the quality of other LLMs. Many studies have fine-tuned judge models based on open-source LLMs for evaluation. While the fine-tuned judge models are claimed to achieve comparable evaluation capability with GPT-4, in this work, we conduct an empirical study of LLM-as-a-Judge. Our findings indicate that although the fine-tuned judge models achieve high performance on in-domain test sets, even surpassing GPT-4, they underperform GPT-4 across several dimensions, including generalizability, fairness and adaptability. We also reveal that the fine-tuned judge model inherently operates as a task-specific classifier, consequently imposing the limitations.

연구 동기 및 목표

  • 여러 데이터셋과 스킴에 걸쳐 미세 조정된 평가자 모델의 평가 능력을 평가한다.
  • 정확도, 합의도, 그리고 공정성 측면에서 미세 조정된 평가자를 GPT-4와 비교한다.
  • 생성형(judges that generate)과 분류형(classification-style) 평가자의 성능 차이가 영향을 미치는지 조사한다.
  • 교차 스킴 평가하에서 미세 조정된 평가자의 일반화 가능성과 편향을 검토한다.

제안 방법

  • GPT-4의 데이터나 인간 주석 데이터를 사용하여 네 가지 오픈 소스 평가 모델(JudgeLM, PandaLM, Auto-J, Prometheus)을 미세 조정한다.
  • 동일한 데이터와 프롬프트를 사용하여 생성형(생성 스타일)과 분류형(회귀) 변형을 모두 학습한다.
  • JudgeLM-test, PandaLM-test, Auto-J-test, Prometheus-test, MT-bench, 및 LLMBar 편향 테스트를 포함한 도메인 내·교차 도메인 테스트 세트에서 평가한다.
  • 정확도, F1, 합의 및 피어슨 지표를 사용하여 GPT-4 및 기타 기준선과 비교한다.
  • 과적합 및 일반화 가능성을 평가하기 위해 평가자 간, 스킴 간 상관관계를 분석한다.

실험 결과

연구 질문

  • RQ1미세 조정된 평가자 모델이 도메인 내 평가 세트에서 GPT-4와 유사한 정확도를 달성하는가?
  • RQ2미세 조정된 평가자는 내재적으로 스킴 간 일반화가 제한된 작업 특화 분류기인가?
  • RQ3생성형 평가자와 분류형 평가자는 성능이나 편향에서 차이가 있는가?
  • RQ4GPT-4와 비교하여 교차 스킴 및 편향 평가 데이터셋에서 미세 조정된 평가자의 성능은 어떠한가?
  • RQ5자비해결? 잘못. Korean: '과잉 표현성이나 피상적 품질 등에 대한 편향 같은 어떤 편향이 미세 조정된 평가자에 영향을 미치며, 이것이 GPT-4와 어떻게 비교되는가?'

주요 결과

  • 미세 조정된 평가자는 도메인 내 테스트 세트에서 높은 정확도를 달성하지만 스킴 특유의 과적합으로 한계가 있다.
  • 동일 데이터로 학습될 때 분류형 평가자가 생성형 평가자와 유사하게 성능을 낸다.
  • 한 가지 평가 스킴에서 학습된 평가자는 다른 스킴에 적용될 때 성능이 저하되며, 이는 GPT-4처럼 강건하지 않다.
  • 교차 도메인 및 다회 MT-bench 평가에서 미세 조정된 평가자는 GPT-4보다 큰 격차로 성능이 떨어진다.
  • 미세 조정된 평가자는 형식성이나 장황성 같은 피상적 특성에 편향을 보이며, GPT-4와 달리 편향이 나타난다.
  • DeBERTa 기반 평가자가 LLM 기반 평가자보다 편향 테스트에서 더 나은 공정성을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.