[논문 리뷰] How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments
이 논문은 γ-Bench를 도입하여 여덟 가지 고전적인 게임 이론 게임을 활용한 다인 다라운드 평가 프레임워크로, 여러 모델에 걸친 LLM 의사결정, 견고성, 일반화 가능성 및 개선 전략을 평가합니다.
Decision-making is a complex process requiring diverse abilities, making it an excellent framework for evaluating Large Language Models (LLMs). Researchers have examined LLMs' decision-making through the lens of Game Theory. However, existing evaluation mainly focus on two-player scenarios where an LLM competes against another. Additionally, previous benchmarks suffer from test set leakage due to their static design. We introduce GAMA($γ$)-Bench, a new framework for evaluating LLMs' Gaming Ability in Multi-Agent environments. It includes eight classical game theory scenarios and a dynamic scoring scheme specially designed to quantitatively assess LLMs' performance. $γ$-Bench allows flexible game settings and adapts the scoring system to different game parameters, enabling comprehensive evaluation of robustness, generalizability, and strategies for improvement. Our results indicate that GPT-3.5 demonstrates strong robustness but limited generalizability, which can be enhanced using methods like Chain-of-Thought. We also evaluate 13 LLMs from 6 model families, including GPT-3.5, GPT-4, Gemini, LLaMA-3.1, Mixtral, and Qwen-2. Gemini-1.5-Pro outperforms others, scoring of $69.8$ out of $100$, followed by LLaMA-3.1-70B ($65.9$) and Mixtral-8x22B ($62.4$). Our code and experimental results are publicly available at https://github.com/CUHK-ARISE/GAMABench.
연구 동기 및 목표
- 다중 에이전트 환경에서 게임 이론을 사용하여 LLM의 의사결정을 평가합니다.
- 다인 다라운드 게임에서 LLM의 견고성, 일반화 가능성 및 개선 전략을 정량화합니다.
- 공개 가능한 벤치마크와 여러 모델(GPT-3.5, GPT-4, Gemini Pro) 간의 분석을 제공합니다.
제안 방법
- γ-Bench 프레임워크를 협력, 배신, 순차로 분류된 여덟 가지 고전적 다에이전트 게임으로 정의합니다.
- 각 게임에서의 성과를 정량화하는 스코어링 방식(개별 게임 점수 및 총합 점수)을 구현합니다.
- 다중 에이전트, 다라운드 설정에서 LLM과 사람을 평가하며, 재시작, 온도, 프롬프트에 대한 견고성 검사를 포함합니다.
- 의사결정 성능에 대한 체인 오브 thought(Chain-of-Thought) 프롬프트와 지시적 프롬프트의 영향을 조사합니다.
- 다양한 LLM(GPT-3.5 변형들, GPT-4, Gemini Pro)을 비교하고 리더보드 형식의 결과를 보고합니다.
실험 결과
연구 질문
- RQ1LLMs는 Nash 균형 및 사회적 복지에 대해 협력적, 배신적, 순차적 다에이전트 게임에서 어떻게 성능을 보이나요?
- RQ2실행 간, 온도, 프롬프트 템플릿에 따라 LLM 의사결정의 견고성은 어떠한가요?
- RQ3추론 개선(예: Chain-of-Thought)이나 보상이 LLM 의 의사결정에 어떤 이점을 주나요?
- RQ4다른 게임 설정과 라운드에서 LLM이 얼마나 일반화되고, 다양한 모델이 γ-Bench에서 어떻게 순위가 매겨지나요?
주요 결과
- GPT-4는 일반적으로 γ-Bench에서 다른 모델을 능가하며 리더보드 점수는 72.5입니다.
- GPT-3.5(0613, 1106, 0125)는 반복을 거치며 지능이 향상되지만 일반화 가능성은 여전히 제한적입니다.
- 협력적 게임은 명시적 커뮤니케이션 없이도 LLM의 자발적 협력 가능성을 보여줍니다.
- 게임 유형에 따라 성능이 다르게 나타나며, 대부분의 게임에서 견고성은 높지만 특정 순차적 게임에서 낮습니다.
- Chain-of-Thought 프롬프트는 일부 작업에서 성능을 향상시킬 수 있으며, 특히 Average의 2/3 추정에서 두드러집니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.