[논문 리뷰] Holistic Evaluation of Language Models
HELM은 시나리오와 지표의 분류학을 활용하여 언어 모델에 대한 총체적 벤치마크를 도입하고, 16개의 핵심 시나리오에서 7개 지표와 7개의 타깃 평가를 포함하여 30개의 모델을 평가하며, 프롬프트, 완성물, 그리고 모듈식 툴킷을 공개합니다.
Language models (LMs) are becoming the foundation for almost all major language technologies, but their capabilities, limitations, and risks are not well understood. We present Holistic Evaluation of Language Models (HELM) to improve the transparency of language models. First, we taxonomize the vast space of potential scenarios (i.e. use cases) and metrics (i.e. desiderata) that are of interest for LMs. Then we select a broad subset based on coverage and feasibility, noting what's missing or underrepresented (e.g. question answering for neglected English dialects, metrics for trustworthiness). Second, we adopt a multi-metric approach: We measure 7 metrics (accuracy, calibration, robustness, fairness, bias, toxicity, and efficiency) for each of 16 core scenarios when possible (87.5% of the time). This ensures metrics beyond accuracy don't fall to the wayside, and that trade-offs are clearly exposed. We also perform 7 targeted evaluations, based on 26 targeted scenarios, to analyze specific aspects (e.g. reasoning, disinformation). Third, we conduct a large-scale evaluation of 30 prominent language models (spanning open, limited-access, and closed models) on all 42 scenarios, 21 of which were not previously used in mainstream LM evaluation. Prior to HELM, models on average were evaluated on just 17.9% of the core HELM scenarios, with some prominent models not sharing a single scenario in common. We improve this to 96.0%: now all 30 models have been densely benchmarked on the same core scenarios and metrics under standardized conditions. Our evaluation surfaces 25 top-level findings. For full transparency, we release all raw model prompts and completions publicly for further analysis, as well as a general modular toolkit. We intend for HELM to be a living benchmark for the community, continuously updated with new scenarios, metrics, and models.
연구 동기 및 목표
- 평가 시나리오와 지표의 분류학을 정의하여 설계 공간을 명시합니다.
- 누락된 범위에 대한 명시적 주의를 포함하여 광범위하고 실현 가능한 핵심 시나리오와 지표를 선택합니다.
- 정확도 이상의 상호작용을 드러내기 위해 시나리오 간 촘촘한 다중 지표 평가를 제공합니다.
- 모델 간의 직접적이고 공정한 비교를 가능하게 하기 위한 평가 조건을 표준화합니다.
- 커뮤니티 주도의 확장을 위한 공개 데이터, 프롬프트, 도구를 포함한 살아있는 벤치마크를 제공합니다.
제안 방법
- 시나리오(작업-도메인-언어)와 7개 지표 범주(정확도, 보정, 강건성, 공정성, 편향, 독성, 효율성)에 대한 상향식 분류체계를 개발합니다.
- 26개의 추가 시나리오에 대해 16개의 핵심 시나리오와 7개의 지표 각각을 적용하고 7개의 표적 평가를 포함합니다.
- 표준화된 프롬프팅(5-shot) 하에서 공개, 제한된 접근, 폐쇄 가족의 30개 주요 언어 모델을 벤치마크합니다.
- 원시 프롬프트와 완성물에의 공개 접근과 새로운 시나리오, 모델, 지표, 프롬프트 전략을 추가할 수 있는 모듈형 도구킷을 제공합니다.
- 시나리오, 지표, 모델 간의 상호작용을 드러내고 25개의 고수준 발견점을 식별하기 위해 결과를 분석합니다.

실험 결과
연구 질문
- RQ1현재의 언어 모델이 광범위하고 표준화된 핵심 시나리오와 지표 세트에서 어떤 성능을 보이는가?
- RQ2정확도, 보정, 강건성, 공정성, 편향, 독성, 효율성은 모델과 시나리오 간에 어떻게 상호작용하는가?
- RQ3모델 접근성(open vs closed)과 평가 결과 간의 트레이드오프와 의존성은 무엇인가?
- RQ4프롬프팅 선택과 적응 방법에 따라 모델 평가가 얼마나 민감한가?
- RQ5지식, 추론, 기억, 허위정보 등 특정 기술에 대한 표적 평가에서 어떤 통찰이 나타나는가?
주요 결과
- 지시 학습은 핵심 지표 전반에 걸쳐 이점을 보이며, 지시 학습된 모델은 크기에 비해 높은 정확도, 강건성 및 공정성을 달성합니다.
- 핵심 시나리오에서 오픈 모델과 비오픈 모델 간의 차이가 두드러지나, 시간이 지남에 따라 오픈 모델이 이 차이를 좁히고 있습니다.
- 정확도와 보정 간의 관계는 시나리오와 프롬프트 전략에 따라 달라집니다.
- 강건성과 공정성의 변화는 정확도와 상관관계가 있으며, 가장 정확한 모델이 항상 가장 강건하거나 공정한 것은 아닙니다.
- 여러 모델에서 인구통계 메타데이터를 통해 발화 다층에서의 성능 차이가 드러납니다.
- 일부 맥락에서 타깃 평가가 필요하지만, 코어 시나리오에서 편향 및 독성 생성은 일반적으로 낮으며 특정 맥락에서 비트가 큽니다.
- 일반적으로 일부 모델에서 정확도와 효율성 간의 무난한 트레이드오프가 보이나, 더 큰 모델이 항상 더 높은 정확도를 보이는 것은 아니며 정확도-효율성 파레토 경계에 위치한 모델도 있습니다.
- 질문 응답은 시나리오 간 이질성이 큰 편이며, 코어 QA 시나리오 중 text-davinci-002가 종종 가장 정확합니다.
- LM을 사용한 구절 순위 지정은 고전적 방법을 능가할 수 있지만 특정 설정에서 최첨단 미세조정 검색기에 뒤처질 수 있습니다.
- 메모리와 저작권 누출 위험은 모델의 정확도와 양의 상관관계가 있으며, 정확도가 높은 모델에서 더 두드러집니다.
- 지식 집약적 작업은 대형 모델이나 특별히 조정된 모델이 높은 성능을 보이며, 코드 중심 모델은 추론 작업에서 뛰어납니다.
- 프롬프트 형식과 적응은 결과에 큰 영향을 미치며, 모델 간 평가의 표준화 도전 과제를 강조합니다.
- 모델 계열 내에서 규모의 효과가 존재하지만, 교차 계열 비교에서는 일부 작고 잘 조정된 모델이 정확도 면에서 더 큰 모델과 맞먹는 경우가 있습니다.
- 정보 왜곡 생성 능력은 특정 프롬프에서 가장 큰 모델에서 가장 강하게 나타나며, 다른 프롬프에서는 혼합된 결과를 보입니다.
- 벤치마크는 기존 평가를 넘어 프롬프트 민감도와 다운스트림 행동과 같은 포괄적 통찰을 제공합니다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.