[논문 리뷰] TaskBench: Benchmarking Large Language Models for Task Automation
TaskBench는 작업 분해, 도구 호출, 매개변수 예측의 세 핵심 단계를 모델링하여 대규모 언어 모델(LM)의 작업 자동화 능력을 평가하기 위한 종합적인 벤치마크를 소개한다. Tool Graph를 활용한 백인struct 방법을 사용한 데이터 합성과 다중 지표 평가 프레임워크(TaskEval)를 통해 인간 평가와 높은 일치도(스피어만의 ρ = 0.89)를 보이며, 특히 매개변수 예측에서 GPT-4가 오픈소스 모델보다 뛰어난 성능을 보임(v-F1 = 71.14%).
In recent years, the remarkable progress of large language models (LLMs) has sparked interest in task automation, which involves decomposing complex tasks described by user instructions into sub-tasks and invoking external tools to execute them, playing a central role in autonomous agents. However, there is a lack of systematic and standardized benchmarks to promote the development of LLMs in task automation. To address this, we introduce TaskBench, a comprehensive framework to evaluate the capability of LLMs in task automation. Specifically, task automation can be divided into three critical stages: task decomposition, tool selection, and parameter prediction. To tackle the complexities inherent in these stages, we introduce the concept of Tool Graph to represent decomposed tasks and adopt a back-instruct method to generate high-quality user instructions. We propose TaskEval, a multi-faceted evaluation methodology that assesses LLM performance across these three stages. Our approach combines automated construction with rigorous human verification, ensuring high consistency with human evaluation. Experimental results demonstrate that TaskBench effectively reflects the capabilities of various LLMs in task automation. It provides insights into model performance across different task complexities and domains, pushing the boundaries of what current models can achieve. TaskBench offers a scalable, adaptable, and reliable benchmark for advancing LLM-based autonomous agents.
연구 동기 및 목표
- 표준화되고 체계적인 벤치마크가 부족한 현실 세계의 작업 자동화 시나리오에서 LLM을 평가할 수 있는 기반 마련 — 기존 NLP 작업을 넘어서 다단계 처리가 필요한 환경에서의 평가 필요성 해결.
- 외부 도구와 의존 관계를 포함하는 복잡한 다단계 작업 자동화 시나리오에 대해 고품질, 다각도 평가 데이터 수집의 과제 해결.
- 작업 분해, 도구 선택, 매개변수 예측의 전 과정을 포괄하는 신뢰할 수 있는 자동화 평가 프레임워크 개발.
- 자동화된 지표가 인간 판단과 얼마나 유사한지 검증하여 평가의 정밀도 확보 — 인간 순위와의 높은 상관관계(스피어만의 ρ = 0.89) 달성.
- 작업 자동화에서의 주요 성능 요인(예: 추론 능력, 지시 따르기 능력, 코드 미세조정, 정렬 기법 등) 규명.
제안 방법
- 도구와 그 의존 관계를 체계적으로 표현할 수 있는 도구 그래프(TG) 도입 — 작업 자동화 시나리오의 체계적 샘플링 가능.
- Tool Graph 내 정의된 하위 작업과 도구 호출 그래프에서 역으로 추론하여 실제 사용자 지시를 생성하는 백인스트럭션 방법 적용.
- 세 단계(작업 분해, 도구 호출, 매개변수 예측)에서 성능을 측정하는 다차원 평가 프레임워크인 TaskEval 설계 — 각각 n-F1, n-F1, v-F1 지표 사용.
- 자동 생성과 인간 검증을 조합한 하이브리드 데이터 수집 전략을 통해 고품질, 현실적인 평가 데이터 확보.
- TaskBench 점수와 인간 평가 순위 간 일치도 검증을 위해 통계적 지표(스피어만의 ρ 및 켄달의 τ) 적용.
- Hugging Face, 멀티미디어, 일상생활 API 등 세 도메인에서 GPT-4 및 오픈소스 모델(예: Code-Llama, Vicuna)을 포함한 다양한 LLM 평가.
실험 결과
연구 질문
- RQ1백인스트럭션과 도구 그래프를 활용한 자동 데이터 생성이 현실 세계의 복잡성을 반영하는 고정밀도, 현실적인 작업 자동화 지시를 얼마나 잘 생성할 수 있는가?
- RQ2기존 LLM이 작업 자동화의 세 핵심 단계(분해, 도구 호출, 매개변수 예측)에서 얼마나 잘 수행되는가?
- RQ3TaskBench 평가 결과가 실행 가능성과 문제 해결 능력 측면에서 인간 판단과 얼마나 유사한가?
- RQ4어떤 모델 특성(예: 코드 미세조정, 지시 튜닝, RLHF 정렬)이 작업 자동화에서 LLM 성능에 가장 큰 영향을 미치는가?
- RQ5GPT-4와 같은 전용 모델에 비해 오픈소스 LLM의 종합적 작업 자동화 능력은 어떠한가?
주요 결과
- TaskBench는 인간 평가와 강한 일치도를 보이며, 켄달의 τ = 0.89, 스피어만의 ρ = 0.78를 기록하여 신뢰할 수 있는 벤치마크로 입증됨.
- GPT-4는 모든 도메인에서 최고 성능 기록 — 일상생활 API에서 v-F1 점수 71.14%로 오픈소스 모델을 압도적으로 앞서며 성능 우월성 입증.
- 지시 따르기 데이터로 미세조정된 오픈소스 모델(Vicuna-13b, WizardLLM-13b)이 기본 Llama-2-13b보다 뛰어난 성능 보이며, 지시 튜닝의 중요성 입증.
- 코드 미세조정된 모델인 Code-Llama는 비코드 미세조정 모델 대비 v-F1 점수에서 12.76% 향상 — 코드 이해 능력 향상이 매개변수 예측에 기여함.
- 인간 정렬 기법(RLHF 등)을 적용한 모델는 더 나은 추론 능력과 일반화 능력을 보이며, 과적합을 줄이고 자동화 성능 향상.
- 오픈소스 LLM의 평균 v-F1 점수는 도메인 별로 Hugging Face(60.86%), 멀티미디어(72.31%), 일상생활(71.14%)로 나타나 매개변수 예측 정확도에서 지속적인 격차 존재.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.