Skip to main content
QUICK REVIEW

[논문 리뷰] CUGE: A Chinese Language Understanding and Generation Evaluation Benchmark

Yuan Yao, Qingxiu Dong|arXiv (Cornell University)|2021. 12. 27.
Topic Modeling인용 수 7
한 줄 요약

CUGE는 언어 능력, 작업, 데이터셋을 기반으로 하여 구조화된 계층적 벤치마크로, 기준선 대비 성능을 정규화하는 다수준 점수 전략을 통해 중국어 언어 이해 및 생성 능력을 평가하기 위한 종합적인 평가 체계이다. 실험 결과, 다양한 언어 능력 간에 뚜렷한 성능 격차가 존재함을 확인하였으며, 특정 작업에서는 뛰어난 성능을 보이는 모델들에도 불구하고 일반 목적의 언어 지능 향상 여건이 여전히 넉넉히 남아 있음을 시사한다.

ABSTRACT

Realizing general-purpose language intelligence has been a longstanding goal for natural language processing, where standard evaluation benchmarks play a fundamental and guiding role. We argue that for general-purpose language intelligence evaluation, the benchmark itself needs to be comprehensive and systematic. To this end, we propose CUGE, a Chinese Language Understanding and Generation Evaluation benchmark with the following features: (1) Hierarchical benchmark framework, where datasets are principally selected and organized with a language capability-task-dataset hierarchy. (2) Multi-level scoring strategy, where different levels of model performance are provided based on the hierarchical framework. To facilitate CUGE, we provide a public leaderboard that can be customized to support flexible model judging criteria. Evaluation results on representative pre-trained language models indicate ample room for improvement towards general-purpose language intelligence. CUGE is publicly available at cuge.baai.ac.cn.

연구 동기 및 목표

  • 일반 목적의 언어 지능 평가에 있어 평탄하고 데이터셋 중심의 벤치마크의 한계를 해결하기 위해.
  • 다양한 수준에서 인간의 언어 능력을 반영하는 중국어 NLP를 위한 체계적이고 종합적인 평가 프레임워크를 설계하기 위해.
  • 다양한 모델 평가 기준을 지원할 수 있는 유연하고 커스터마이징 가능한 평가 플랫폼과 공개 랭킹을 제공하기 위해.
  • 정규화된 점수 전략을 통해 데이터셋, 작업, 언어 능력 수준에서의 다수준 성능 분석을 가능하게 하기 위해.
  • 사전 훈련된 모델에서 언어 능력 간 진전의 불균형을 드러내어 향후 연구를 이끌기 위해.

제안 방법

  • CUGE는 인간의 언어 시험 교과서와 현재의 NLP 연구를 영감으로 받아 언어 능력, 작업, 데이터셋의 계층적 프레임워크 내에서 데이터셋을 구성한다.
  • 모델 성능을 표준 기준선(mT5-Small)에 비해 정규화하는 다수준 점수 전략을 적용하여 메트릭과 데이터셋의 변동성을 완화한다.
  • 벤치마크는 7개의 언어 능력, 18개의 작업, 21개의 대표적 데이터셋을 포함하며, 이해, 생성, 추론 능력의 포괄적 커버리지에 중점을 둔다.
  • 사용자가 특정 능력 또는 작업을 선택해 평가할 수 있는 커스터마이징 가능한 랭킹을 갖춘 공개 온라인 평가 플랫폼을 구축하였다.
  • 학술적 정직을 확보하기 위해 명예 원칙을 도입하고, 코드와 기법 보고서 공유를 통해 투명성을 장려한다.
  • 능력 수준의 성능 시각화를 지원하며, 향후 새로운 데이터셋과 평가 기능의 확장성도 보장한다.

실험 결과

연구 질문

  • RQ1어떻게 하면 인간의 언어 능력 전반을 반영할 수 있는 체계적인 중국어 언어 지능 평가 체계를 설계할 수 있는가?
  • RQ2현재의 사전 훈련된 모델들이 이해, 생성, 추론 등의 다양한 언어 능력에서 균형 잡힌 성능을 보이는가?
  • RQ3기준선에 비해 성능을 정규화하는 다수준 점수 전략이 모델 평가의 신뢰성과 해석 가능성 향상에 기여할 수 있는가?
  • RQ4통합된 계층적 벤치마크에서 다양한 언어 능력에 따라 모델 성능은 어떻게 변화하는가?
  • RQ5기존의 평탄하고 데이터셋 중심의 벤치마크는 일반 목적의 언어 지능의 복잡성을 얼마나 잘 반영할 수 있는가?

주요 결과

  • mT5-XXL은 mT5-Large 및 mT5-Small보다 뚜렷이 뛰어난 성능을 보이며, 모델 크기가 커질수록 대부분의 능력에서 성능 향상이 이루어짐을 입증한다.
  • CPM-2는 mT5-XXL보다 파arameter 수가 적음에도 불구하고 그를 능가하는 성능을 보이며, 향상된 사전 훈련 절차가 더 강력한 언어 능력을 낳을 수 있음을 시사한다.
  • 성능 향상은 언어 능력 간에 균형 잡히지 않으며, 다국어성 능력에서의 향상이 언어 생성 능력보다 더 두드러진다.
  • 계층적 프레임워크는 평탄한 벤치마크에서는 불가능한 모델 성능의 세부 분석을 가능하게 하여 능력별 약점들을 드러낸다.
  • 벤치마크는 일반 목적의 언어 지능 향상 여건이 여전히 크게 남아 있음을 드러내며, 특히 생성 및 논의 수준의 이해 능력 향상 여건이 두드러진다.
  • 커스터마이징 가능한 랭킹과 cuge.baai.ac.cn에서 제공하는 공개 플랫폼은 중국어 NLP 모델의 민감하고 투명하며 재현 가능한 평가를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.