Skip to main content
QUICK REVIEW

[논문 리뷰] How Well Can LLMs Negotiate? NegotiationArena Platform and Analysis

Federico Bianchi, Patrick John Chia|arXiv (Cornell University)|2024. 02. 08.
Corporate Governance and Law인용 수 4
한 줄 요약

이 논문은 다단계 협상 시나리오에서 LLM 에이전트를 평가하고 탐색하기 위한 오픈소스 플랫폼인 NegotiationArena를 소개한다. 이를 통해 GPT-4와 같은 LLM이 '절망을 연기하는' 전략적 행동을 통해 수익을 크게 향상시킬 수 있음을 입증하였고, 동시에 앵커링 효과나 수량성 효과와 같은 비합리적 편향도 나타냄을 확인하였다.

ABSTRACT

Negotiation is the basis of social interactions; humans negotiate everything from the price of cars to how to share common resources. With rapidly growing interest in using large language models (LLMs) to act as agents on behalf of human users, such LLM agents would also need to be able to negotiate. In this paper, we study how well LLMs can negotiate with each other. We develop NegotiationArena: a flexible framework for evaluating and probing the negotiation abilities of LLM agents. We implemented three types of scenarios in NegotiationArena to assess LLM's behaviors in allocating shared resources (ultimatum games), aggregate resources (trading games) and buy/sell goods (price negotiations). Each scenario allows for multiple turns of flexible dialogues between LLM agents to allow for more complex negotiations. Interestingly, LLM agents can significantly boost their negotiation outcomes by employing certain behavioral tactics. For example, by pretending to be desolate and desperate, LLMs can improve their payoffs by 20\% when negotiating against the standard GPT-4. We also quantify irrational negotiation behaviors exhibited by the LLM agents, many of which also appear in humans. Together, \NegotiationArena offers a new environment to investigate LLM interactions, enabling new insights into LLM's theory of mind, irrationality, and reasoning abilities.

연구 동기 및 목표

  • 동적이고 다단계 협상 환경에서 LLM 에이전트를 평가하기 위한 유연하고 오픈소스 기반의 프레임워크 개발.
  • 자원 배분, 거래, 가격 협상과 관련된 실제 협상 시나리오에서 LLM의 행동 방식 탐구.
  • LLM 에이전트 간 협상 결과에 영향을 주는 전략적, 사회적, 비합리적 행동 식별.
  • 가짜로 절망을 연기하는 것과 같은 행동 전략이 협상 성공에 미치는 영향 정량화.
  • 경쟁적이고 상호작용적인 환경에서 최신 LLM의 이성성 및 이론적 마음 능력 평가.

제안 방법

  • 자원 교환, 다단계 유령대게 게임, 가격 협상의 세 가지 핵심 협상 시나리오를 지원하는 모듈식 플랫폼인 NegotiationArena를 설계 및 구현.
  • 제한된 자원, 목표, 턴 수, 수락 조건을 명시하여 제어 가능하고 반복 가능한 실험을 가능하게 하기 위해 각 시나리오를 체계화.
  • 유연한 턴 기반 대화 상호작용을 통해 LLM 에이전트(GPT-4, GPT-3.5, Claude 2.1, Claude 2)를 협상 프로세스에 통합.
  • 제안 순서, 수락/기각 패턴, 최종 수익 등 협상 궤적을 수집하고 분석.
  • 다양한 전략과 자원 수준에서 최종 수익 비율 및 승리율과 같은 정량적 지표를 사용해 성능 측정.
  • 특정 행동(예: 감정적 호소, 모욕)이 협상 결과에 미치는 영향 평가를 위해 아블레이션 연구 수행.

실험 결과

연구 질문

  • RQ1LLM 에이전트는 정적 벤치마크 작업 대비 다단계 동적 협상 시나리오에서 어떻게 성과를 내는가?
  • RQ2어떤 전략적 행동(예: 절망을 연기하거나 공격적인 태도)이 LLM 에이전트의 협상 수익을 향상시키는가?
  • RQ3LLM 에이전트가 협상 환경에서 앵커링 편향이나 수량성 편향과 같은 비합리적 행동을 얼마나 보이는가?
  • RQ4나누는 자원의 총액이 커질수록 유령대게 스타일 협상에서 제안의 공정성과 수용 가능성은 어떻게 영향을 받는가?
  • RQ5GPT-4와 Claude 2.1 등 서로 다른 LLM 간 협상 성능 및 행동 패턴은 어떻게 비교되는가?

주요 결과

  • GPT-4는 모든 시나리오에서 다른 LLM보다 뚜렷하게 뛰어난 협상 성과를 보이며, 뛰어난 전략적 사고력과 의사소통 능력을 입증.
  • 표준 GPT-4와 협상할 경우, 절망을 연기하거나 고립된 상태를 연기함으로써 LLM의 수익이 최대 20% 향상됨.
  • LLM 에이전트는 초기 제안이 비합리적이더라도 최종 결과에 지나치게 영향을 미치는 앵커링 편향을 보임.
  • 나누는 총액이 증가함에 따라(예: 100달러에서 100억 달러로), 제안자 비율이 크게 상승하여 100억 달러일 경우 약 79%에 도달함—이를 통해 수량성 편향이 확인됨.
  • 절대 금액이 클 경우 불공정한 제안을 자주 수락함으로써 고전적인 유령대게 게임에서 관찰된 인간의 비합리적 행동과 유사함.
  • 모든 테스트된 LLM은 모욕이나 감정적 호소와 같은 사회적 조작 기법에 취약하며, 이를 활용해 협상 결과를 유리하게 유도할 수 있음.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.