Skip to main content
QUICK REVIEW

[논문 리뷰] How not to Lie with a Benchmark: Rearranging NLP Leaderboards

Tatiana Shavrina, Valentin Malykh|arXiv (Cornell University)|2021. 12. 02.
Explainable Artificial Intelligence (XAI)인용 수 4
한 줄 요약

이 논문은 NLP 벤치마크 점수를 평균화하는 데에 산술 평균을 사용하는 것에 도전하며, 정규화된 성능 지표를 평균화하는 데 더 적합한 기하평균과 조화평균을 제안한다. GLUE, SuperGLUE, XGLUE, XTREME에서 모델를 재순위 매기며, 인간 성능이 여전히 슈퍼리어하며 현재 최고 성능 모델들이 인간보다 1.5–2% 뒤처짐을 확인함으로써, 잘못된 평균화 방법으로 인해 표준 랭킹 순위에 편향이 존재함을 드러낸다.

ABSTRACT

Comparison with a human is an essential requirement for a benchmark for it to be a reliable measurement of model capabilities. Nevertheless, the methods for model comparison could have a fundamental flaw - the arithmetic mean of separate metrics is used for all tasks of different complexity, different size of test and training sets. In this paper, we examine popular NLP benchmarks' overall scoring methods and rearrange the models by geometric and harmonic mean (appropriate for averaging rates) according to their reported results. We analyze several popular benchmarks including GLUE, SuperGLUE, XGLUE, and XTREME. The analysis shows that e.g. human level on SuperGLUE is still not reached, and there is still room for improvement for the current models.

연구 동기 및 목표

  • NLP 벤치마크 점수의 근본적 결함을 규명하고 해결함: 다양한 복잡도, 스케일, 데이터 泄露 위험이 있는 작업들 간에 산술 평균을 사용하는 것.
  • 산술 평균이 특정 작업에서의 저성능을 제대로 처벌하지 못함으로써 모델 순위를 왜곡함을 입증함.
  • 기하평균과 조화평균를 다중 작업 벤치마크에서 정규화된 성능 점수를 평균화하는 데 더 적절한 집계 방법으로 제안하고 적용함.
  • GLUE, SuperGLUE, XGLUE, XTREME와 같은 주요 NLP 벤치마크에서 기하평균과 조화평균를 사용해 최고 성능 모델들을 재순위 매김함.
  • 공정하고 신뢰할 수 있는 NLP 모델 평가를 위해 벤치마크 평가 방식의 재설계를 촉구함.

제안 방법

  • 논문은 기하평균(GM)과 조화평균(HM)을 사용해 새로운 총점 점수를 계산하며, 각각 점수의 곱의 N제곱근과 N을 점수의 역수 합으로 나눈 값으로 정의된다.
  • GLUE, SuperGLUE, XGLUE, XTREME의 모든 작업에서 공개된 모델 점수에 이들 지표를 적용하며, 작업 수준의 성능 데이터를 유지한다.
  • 산술 평균(AM), 기하평균, 조화평균 기반 순위를 비교해 모델 순서의 변화를 탐지한다.
  • 정규화된 성능 점수의 통계적 성질—합계, 분산, 표준편차—를 평가해 상위 모델들의 일관성과 강건성을 분석한다.
  • XGLUE와 XTREME와 같은 다국어 벤치마크의 경우, 언어별로 먼저 평균을 내고 나서 전체 작업에 대해 다시 평균을 내는 이중 평균화 방식이 총점에 미치는 영향을 분석한다.
  • 다국어 벤치마크에서 인간 성능을 추정하며, 작업 간 인간 평가 방법의 이질성에 주목한다.

실험 결과

연구 질문

  • RQ1산술 평균을 기하평균 또는 조화평균로 대체할 경우, 표준 NLP 벤치마크에서 모델 순위에 어떤 영향을 미치는가?
  • RQ2더 적절한 평균화 방법을 사용했을 때, 현재의 SOTA 모델들이 인간 수준 성능에 얼마나 가까이 도달하거나 이를 초월하는가?
  • RQ3왜 산술 평균은 다중 작업 NLP 벤치마크에서 편향되고 오해의 소지가 있는 모델 비교를 초래하는가?
  • RQ4테스트 세트 크기의 차이, 데이터 泄露 위험, 작업의 노령도가 벤치마크 점수의 신뢰성에 어떤 영향을 미치는가?
  • RQ5기하평균이나 조화평균와 같은 대체 집계 방법이 다양한 NLP 작업 간 균형 잡힌 성능을 더 잘 반영할 수 있는가?

주요 결과

  • SuperGLUE에서 조화평균 및 기하평균 순위는 인간 성능을 1위로, DeBERTa와 T5+Meena 모델을 각각 2위와 3위로 순위 매기며, 인간보다 1.5–2% 뒤처짐.
  • GLUE에서 산술 평균 순위는 16위에 머물러 있는 모델이 기하평균과 조화평균 기반 순위에서는 상위 모델로 올라가며, 순위 왜곡이 심각함을 시사함.
  • SuperGLUE에서 인간 성능의 합계(894.40)와 분산(130.31)은 상위 모델보다 높으며, 이는 작업 간에 이질적이지만 전반적으로 슈퍼리어한 성능을 의미함.
  • 상위 3개 모델(DeBERTa, T5+Meena, McAlbert+DKM)은 인간보다 분산과 표준편차가 낮아 더 일관성 있고, 그러나 정점 성능는 떨어짐.
  • XGLUE에서 인간 수준 성능은 단일 언어 데이터에서 추정되지만, 실제로 인간 성능은 언어 간에 크게 다름을 보이며, 이는 벤치마크의 타당성을 떨어뜨림.
  • 본 연구는 현재의 벤치마크 평가 체계가 모델 능력 외에 평균화 방법의 선택에 크게 의존하는 '벤치마크 로또'를 만들어내며, 이는 모델 순위에 편향을 초래함을 드러냄.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.