[論文レビュー] Holistic Evaluation of Language Models
HELMは、シナリオと指標の分類法を用いた言語モデルの全体的なベンチマークを導入し、16のコアシナリオを通じて7つの指標と7つのターゲット評価を含めて、30モデルを評価し、プロンプト、完了、モジュラーなツールキットを公開します。
Language models (LMs) are becoming the foundation for almost all major language technologies, but their capabilities, limitations, and risks are not well understood. We present Holistic Evaluation of Language Models (HELM) to improve the transparency of language models. First, we taxonomize the vast space of potential scenarios (i.e. use cases) and metrics (i.e. desiderata) that are of interest for LMs. Then we select a broad subset based on coverage and feasibility, noting what's missing or underrepresented (e.g. question answering for neglected English dialects, metrics for trustworthiness). Second, we adopt a multi-metric approach: We measure 7 metrics (accuracy, calibration, robustness, fairness, bias, toxicity, and efficiency) for each of 16 core scenarios when possible (87.5% of the time). This ensures metrics beyond accuracy don't fall to the wayside, and that trade-offs are clearly exposed. We also perform 7 targeted evaluations, based on 26 targeted scenarios, to analyze specific aspects (e.g. reasoning, disinformation). Third, we conduct a large-scale evaluation of 30 prominent language models (spanning open, limited-access, and closed models) on all 42 scenarios, 21 of which were not previously used in mainstream LM evaluation. Prior to HELM, models on average were evaluated on just 17.9% of the core HELM scenarios, with some prominent models not sharing a single scenario in common. We improve this to 96.0%: now all 30 models have been densely benchmarked on the same core scenarios and metrics under standardized conditions. Our evaluation surfaces 25 top-level findings. For full transparency, we release all raw model prompts and completions publicly for further analysis, as well as a general modular toolkit. We intend for HELM to be a living benchmark for the community, continuously updated with new scenarios, metrics, and models.
研究の動機と目的
- 設計空間を規定する言語モデル評価シナリオと指標の分類法を定義する。
- 不足しているカバーについての明示的な留保を付した、広範で実現可能なコアセットのシナリオと指標を選定する。
- 精度以外のトレードオフを明らかにするため、シナリオ横断の密な複数指標評価を提供する。
- モデル間の直接的で公正な比較を可能にするため、評価条件を標準化する。
- コミュニティ主導の拡張を可能にする、オープンデータ・プロンプト・ツールを備えた継続的に更新されるベンチマークを提供する。
提案手法
- シナリオ(タスク-ドメイン-言語)に関するトップダウンの分類法と、7つの指標カテゴリー(精度、キャリブレーション、ロバストネス、公平性、バイアス、毒性、効率)を開発する。
- 16のコアシナリオを各7指標で実装し、さらに26の追加シナリオで7つのターゲット評価を実施する。
- 標準化されたプロンプティング(5ショット)下で、オープン・限定アクセス・クローズド系の30の著名な言語モデルをベンチマークする。
- 生のプロンプトと完了に対する公開アクセスと、新しいシナリオ・モデル・指標・プロンプティング戦略を追加できるモジュラーなツールキットを提供する。
- シナリオ・指標・モデル間の相互作用を浮き彫りにするために結果を分析し、25件の高レベルの発見を特定する。

実験結果
リサーチクエスチョン
- RQ1現在の言語モデルが、広範で標準化されたコアシナリオと指標のセットに対してどの程度の性能を示すか?
- RQ2精度、キャリブレーション、ロバストネス、公平性、バイアス、毒性、効率は、モデルとシナリオを横断してどのように相互作用するか?
- RQ3モデルアクセス(オープン対クローズド)と評価結果とのトレードオフや依存関係は何か?
- RQ4プロンプト選択と適応手法に対するモデル評価はどれほど敏感か?
- RQ5知識・推論・記憶・偽情報拡散など、特定の技能に対するターゲット評価からどんな洞察が得られるか?
主な発見
- 指示チューニングはコア指標全体に現れ、指示チューニング済みモデルはサイズに対して高い精度・ロバストネス・公平性を達成する。
- コアシナリオにおけるオープンモデルと非オープンモデルの間には顕著なギャップが残るが、オープンモデルは時間とともにこのギャップを縮めている。
- キャリブレーションと精度の関係は、シナリオとプロンプティング戦略によって異なる。
- ロバストネスと公正性の撹乱は精度と相関する一方で、最も高精度なモデルが必ずしも最もロバストまたは公正とは限らないというトレードオフが存在する。
- 人口統計メタデータは、いくつかのモデルで方言やグループ間の性能格差を示している。
- バイアスと毒性の生成はコアシナリオでは概ね低いが、特定の文脈では非自明であり、ターゲット評価を必要とする。
- 精度と効率は全モデルで一様なトレードオフを示さない。より大きなモデルは精度を向上させる一方でコストが高く、精度-効率のパレート前線にあるモデルも存在する。
- 質問応答はシナリオを超えた大きなばらつきを示し、core QAシナリオの中ではtext-davinci-002がしばしば最も正確である。
- LMを用いたパッセージランキングの情報検索は古典的手法を上回ることがあるが、いくつかの設定では最先端のファインチューニング済みリトリーバには遅れをとることがある。
- Memoryと著作権漏洩リスクはモデルの精度と相関し、精度が高いモデルで顕著になる。
- 知識集約的タスクは高性能のためにより大規模な、または特別に調整されたモデルを好み、コード指向のモデルは推論タスクで卓越する。
- プロンプト形式と適応は結果に強く影響を与え、モデル間で評価を標準化する難しさを浮き彫りにする。
- モデルファミリー内にはスケーリング効果が存在するが、ファミリーを跨ぐ比較では、いくつかの小型でよく調整されたモデルが大規模モデルに匹敵する精度を示す。
- 特定のプロンプト下で最大級のモデルが偽情報生成能力が最も強い一方、他のプロンプトでは結果はまちまちである。
- このベンチマークは、従来の評価では含まれないプロンプティング感度や下流挙動を含む、先行評価を超えた包括的な洞察を明らかにする。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。