Skip to main content
QUICK REVIEW

[논문 리뷰] LLMeBench: A Flexible Framework for Accelerating LLMs Benchmarking

Fahim Dalvi, Maram Hasanain|arXiv (Cornell University)|2023. 08. 09.
Mathematics, Computing, and Information Processing인용 수 4
한 줄 요약

LLMeBench는 다양한 NLP 작업과 언어에서 대규모 언어 모델(Large Language Models, LLMs)의 벤치마크를 가속화하고 단순화하는 오픈소스이며 모듈러한 프레임워크입니다. 사용자는 API를 통해 커스터마이징된 데이터셋, 모델, 평가 지표를 쉽게 통합할 수 있으며, 내장된 캐싱, 제로-샷 및 희소-샷 프롬프팅, 53개의 데이터셋을 사용해 11개 언어에서 31개의 작업을 지원합니다.

ABSTRACT

The recent development and success of Large Language Models (LLMs) necessitate an evaluation of their performance across diverse NLP tasks in different languages. Although several frameworks have been developed and made publicly available, their customization capabilities for specific tasks and datasets are often complex for different users. In this study, we introduce the LLMeBench framework, which can be seamlessly customized to evaluate LLMs for any NLP task, regardless of language. The framework features generic dataset loaders, several model providers, and pre-implements most standard evaluation metrics. It supports in-context learning with zero- and few-shot settings. A specific dataset and task can be evaluated for a given LLM in less than 20 lines of code while allowing full flexibility to extend the framework for custom datasets, models, or tasks. The framework has been tested on 31 unique NLP tasks using 53 publicly available datasets within 90 experimental setups, involving approximately 296K data points. We open-sourced LLMeBench for the community (https://github.com/qcri/LLMeBench/) and a video demonstrating the framework is available online. (https://youtu.be/9cC2m_abk3A)

연구 동기 및 목표

  • 다양한 NLP 작업과 저자원 언어에서 LLM 벤치마크를 위한 사용자 친화적이고 커스터마이징 가능한 프레임워크의 부족을 보완합니다.
  • 사용자 정의 작업, 데이터셋, 모델의 플러그 앤 플레이 통합을 통해 LLM 평가 설정의 시간과 복잡성을 줄입니다.
  • 최대 경계 거리(MMR)를 활용한 지능적인 예제 선택을 통해 제로-샷 및 희소-샷 프롬프팅을 지원하여 희소-샷 학습의 효율성을 향상시킵니다.
  • 모델 출력을 저장하고 재사용하는 효율적인 캐싱 메커니즘을 통해 비용과 API 호출 오버헤드를 최소화합니다.
  • 로컬 데이터셋 로딩과 현장 내 모델 추론을 허용함으로써 보안성과 개인정보 보호를 강화하여 민감한 도메인에서의 평가를 가능하게 합니다.

제안 방법

  • 키-값 사전 전달 방식으로 연결된 네 가지 핵심 구성 요소(Dataset, Model, Evaluation, Asset 모듈)로 구성된 모듈러한 파이프라인 아키텍처를 사용합니다.
  • 로컬 또는 원격 데이터셋을 지원하는 사용자 정의 가능한 데이터 로더를 적용하여 데이터 프라이버시와 유연성을 확보합니다.
  • 작업에 맞는 프롬프트를 생성하는 프롬프트 엔지니어링 모듈을 구현하여 제로-샷 및 희소-샷 설정을 모두 지원합니다.
  • 사용자가 정의한 학습 세트에서 다양하고 대표적인 희소-샷 예제를 자동으로 선택하기 위해 최대 경계 거리(MMR) 알고리즘을 적용합니다.
  • 모델 출력을 저장하고 재사용하여 중복 API 호출을 방지하는 지속 가능한 캐싱 시스템을 통합하여 지연 시간과 비용을 감소시킵니다.
  • 로그 기록, 후처리, 결과 집계를 포함한 전체 평가 파이프라인을 조율하는 벤치마크 드라이버를 제공합니다.
Figure 1: The architecture of the LLMeBench framework. The dotted boxes represent the core implemented modules of the architecture. Customization for new tasks, datasets and models can be done on Dataset , Model , Evaluation , and Asset modules.
Figure 1: The architecture of the LLMeBench framework. The dotted boxes represent the core implemented modules of the architecture. Customization for new tasks, datasets and models can be done on Dataset , Model , Evaluation , and Asset modules.

실험 결과

연구 질문

  • RQ1저자원 또는 비영어 NLP 작업을 수행하는 연구자 및 실무자들이 사용하기 쉽게, 그리고 커스터마이징 가능한 LLM 벤치마크 방법은 어떻게 개선될 수 있는가?
  • RQ2캐싱 메커니즘이 API 호출 오버헤드를 얼마나 줄이고 LLM 평가 워크플로의 효율성을 향상시킬 수 있는가?
  • RQ3MMR 기반의 희소-샷 예제 선택 전략은 다양한 NLP 작업에서 희소-샷 학습 성능을 얼마나 효과적으로 향상시키는가?
  • RQ4심층적인 코드 수정 없이도 다양한 모델(GPT, BLOOM 등), 데이터셋, 평가 지표를 일관되게 통합할 수 있는 통합형 모듈러 프레임워크는 가능한가?
  • RQ511개 언어에서 31개의 사전 정의된 작업 레시피와 53개의 데이터셋을 지원하는 프레임워크의 확장성과 재사용 가능성은 어떠한가?

주요 결과

  • LLMeBench는 새로운 사용자 정의 데이터셋을 10분 이내로 추가할 수 있어 새로운 평가 작업의 설정 시간을 크게 단축시킵니다.
  • 프레임워크는 31개의 고유한 NLP 작업과 53개의 공개된 데이터셋을 포함해 총 296,000개의 데이터 포인트를 다루는 90개의 실험 설정에서 철저히 테스트되었습니다.
  • 캐싱 메커니즘이 중복된 API 호출을 효과적으로 방지하여 대규모 평가에서 시간과 비용을 줄였습니다.
  • MMR 기반의 희소-샷 예제 선택 방법은 문맥 내 예제의 다양성과 관련성을 향상시켜 희소-샷 학습 성능을 향상시켰습니다.
  • 프레임워크는 140개의 사전 정의된 프롬프트를 통해 제로-샷 및 희소-샷 프롬프팅을 지원하며, 프롬프트 엔지니어링 분야의 커뮤니티 자원으로 기능합니다.
  • LLMeBench는 확장성을 고려해 설계되었으며, GPT 및 BLOOM 등의 모델을 검증한 바 있으며, 향후 버전에서 오프라인 및 다중 구성 모델 추론 지원 계획이 수립되어 있습니다.
Figure 6: Summary and examples of the 53 datasets, 31 tasks, 3 models and metrics currently implemented and validated in LLMeBench.
Figure 6: Summary and examples of the 53 datasets, 31 tasks, 3 models and metrics currently implemented and validated in LLMeBench.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.