Skip to main content
QUICK REVIEW

[論文レビュー] LLMeBench: A Flexible Framework for Accelerating LLMs Benchmarking

Fahim Dalvi, Maram Hasanain|arXiv (Cornell University)|Aug 9, 2023
Mathematics, Computing, and Information Processing被引用数 4
ひとこと要約

LLMeBench は、多様な NLP タスクおよび言語における大規模言語モデル(LLM)のベンチマーキングを加速・簡素化するオープンソースでモジュラーなフレームワークです。ユーザーは、API を通じたカスタムモデルや評価指標、カスタムデータセットを簡単に統合でき、組み込みのキャッシュ機能、ゼロショットおよびフェイワショットプロンプティング、53 個のデータセットを用いた 11 言語で 31 タスクをカバーするサポートを備えています。

ABSTRACT

The recent development and success of Large Language Models (LLMs) necessitate an evaluation of their performance across diverse NLP tasks in different languages. Although several frameworks have been developed and made publicly available, their customization capabilities for specific tasks and datasets are often complex for different users. In this study, we introduce the LLMeBench framework, which can be seamlessly customized to evaluate LLMs for any NLP task, regardless of language. The framework features generic dataset loaders, several model providers, and pre-implements most standard evaluation metrics. It supports in-context learning with zero- and few-shot settings. A specific dataset and task can be evaluated for a given LLM in less than 20 lines of code while allowing full flexibility to extend the framework for custom datasets, models, or tasks. The framework has been tested on 31 unique NLP tasks using 53 publicly available datasets within 90 experimental setups, involving approximately 296K data points. We open-sourced LLMeBench for the community (https://github.com/qcri/LLMeBench/) and a video demonstrating the framework is available online. (https://youtu.be/9cC2m_abk3A)

研究の動機と目的

  • 多様な NLP タスクや低リソース言語で使用可能な、使いやすくカスタマイズ可能な LLM ベンチマーキングフレームワークの不足を解消すること。
  • カスタムタスク、データセット、モデルのプラグアンドプレイ統合を可能にすることで、LLM 評価のセットアップにかかる時間と複雑さを低減すること。
  • 最大マージン再levance(MMR)を用いた知的な例選択により、ゼロショットおよびフェイワショットプロンプティングの効率を高めること。
  • モデル出力を保存して再利用する効率的なキャッシュ機構により、コストと API コールのオーバーヘッドを最小限に抑えること。
  • ローカルデータセットの読み込みとオンプレミスでのモデル推論を可能にすることで、機微な分野におけるデータプライバシーを強化する、安全でプライベートな評価を促進すること。

提案手法

  • キー値辞書によるデータ伝達で接続される、4 つのコアコンponents(データセット、モデル、評価、アセット)からなるモジュラーなパイプラインアーキテクチャを採用。
  • ローカルまたはリモートのデータセットをサポートするカスタマイズ可能なデータローダーを採用し、データプライバシーと柔軟性を確保。
  • タスク固有のプロンプトを生成するプロンプト工学モジュールを実装し、ゼロショットおよびフェイワショット設定を両方サポート。
  • ユーザーが定義したトレーニングセットから、多様で代表的なフェイワショット例を自動的に選択するための最大マージン再levance(MMR)アルゴリズムを適用。
  • モデル出力を保存して再利用する恒久的キャッシュシステムを統合し、重複する API コールを防ぎ、遅延とコストを削減。
  • ログ記録、後処理、結果集約を含む、フル評価パイプラインをオchestrate するベンチマーキングドライバを提供。
Figure 1: The architecture of the LLMeBench framework. The dotted boxes represent the core implemented modules of the architecture. Customization for new tasks, datasets and models can be done on Dataset , Model , Evaluation , and Asset modules.
Figure 1: The architecture of the LLMeBench framework. The dotted boxes represent the core implemented modules of the architecture. Customization for new tasks, datasets and models can be done on Dataset , Model , Evaluation , and Asset modules.

実験結果

リサーチクエスチョン

  • RQ1低リソース言語や非英語 NLP タスクに取り組む研究者や実務家が、よりアクセスしやすくカスタマイズ可能な LLM ベンチマーキングをどのように実現できるか。
  • RQ2キャッシュ機構が API コールのオーバーヘッドをどの程度低減し、LLM 評価ワークフローの効率を向上させられるか。
  • RQ3MMR を用いたフェイワショット例選択戦略は、多様な NLP タスクにおいてフェイワショット学習のパフォーマンスをどの程度向上させるか。
  • RQ4統合されたモジュラーなフレームワークは、GPT や BLOOM などの多様なモデル、データセット、評価指標を、深いコード変更なしにシームレスに統合できるか。
  • RQ511 言語で 31 の事前定義済みタスクレシピと 53 個のデータセットをサポートするベンチマーキングフレームワークのスケーラビリティと再利用可能性はどの程度か。

主な発見

  • LLMeBench を用いることで、新しいカスタムデータセットの追加が 10 分未満で可能となり、新たな評価タスクのセットアップ時間の大幅な短縮が実現。
  • フレームワークは、31 個の固有の NLP タスクと 53 個の公開データセットを用い、合計 296,000 個のデータポイントを含む 90 の実験設定で厳密にテスト済み。
  • キャッシュ機構により、重複する API コールが効果的に防止され、大規模評価における時間とコストの両方が削減された。
  • MMR を用いたフェイワショット例選択法により、文脈内例の多様性と関連性が向上し、フェイワショット学習のパフォーマンスが向上。
  • 140 個の事前定義済みプロンプトを備え、プロンプト工学のコミュニティリソースとして機能。
  • LLMeBench は拡張性を考慮して設計されており、GPT や BLOOM などのモデルで検証済み。今後はオフラインおよびマルチ構成モデル推論のサポートを計画。
Figure 6: Summary and examples of the 53 datasets, 31 tasks, 3 models and metrics currently implemented and validated in LLMeBench.
Figure 6: Summary and examples of the 53 datasets, 31 tasks, 3 models and metrics currently implemented and validated in LLMeBench.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。