Skip to main content
QUICK REVIEW

[논문 리뷰] STRIDE: A Tool-Assisted LLM Agent Framework for Strategic and Interactive Decision-Making

Chuanhao Li, Runhan Yang|arXiv (Cornell University)|2024. 05. 25.
Multi-Agent Systems and Negotiation인용 수 4
한 줄 요약

이 논문은 전략적이고 상호작용적인 의사결정을 복잡한 환경(예: 협상 및 게임 이론)에서 향상시키기 위해 구조적 추론, 기억, 전용 도구를 통합한 도구 보강된 LLM 에이전트 프레임워크인 STRIDE를 소개한다. Minimax와 알파-베타 가지치기 알고리즘을 통합하고 LLM을 사용해 다단계 계획을 조율함으로써, STRIDE는 틱택토와 커넥트-N과 같은 게임에서 기본 LLM보다 뛰어난 성능을 보이며, 제로샷 체인오브스포크 모델 대비 90% 승리율을 기록한다.

ABSTRACT

Large Language Models (LLMs) like GPT-4 have revolutionized natural language processing, showing remarkable linguistic proficiency and reasoning capabilities. However, their application in strategic multi-agent decision-making environments is hampered by significant limitations including poor mathematical reasoning, difficulty in following instructions, and a tendency to generate incorrect information. These deficiencies hinder their performance in strategic and interactive tasks that demand adherence to nuanced game rules, long-term planning, exploration in unknown environments, and anticipation of opponents' moves. To overcome these obstacles, this paper presents a novel LLM agent framework equipped with memory and specialized tools to enhance their strategic decision-making capabilities. We deploy the tools in a number of economically important environments, in particular bilateral bargaining and multi-agent and dynamic mechanism design. We employ quantitative metrics to assess the framework's performance in various strategic decision-making problems. Our findings establish that our enhanced framework significantly improves the strategic decision-making capability of LLMs. While we highlight the inherent limitations of current LLM models, we demonstrate the improvements through targeted enhancements, suggesting a promising direction for future developments in LLM applications for interactive environments.

연구 동기 및 목표

  • 게임 이론 및 메커니즘 설계와 같은 전략적, 상호작용적, 장기적 의사결정 과제에서 LLM의 한계를 해결하기 위해.
  • 외부 도구와 기억을 통합해 LLM의 수학적 추론, 지시 수행 능력, 환상 문제를 보완하기 위해.
  • 백워드 인덕션과 알고리즘 시뮬레이션을 통한 구조적 다단계 추론을 가능하게 하는 프레임워크를 개발하기 위해.
  • 이중 협상, 동적 메커니즘 설계, 순차적 게임과 같은 경제적으로 관련성이 있는 분야에서 프레임워크를 평가하기 위해.
  • 표준 프롬프팅이 실패하는 전략적 환경에서 도구 보강된 LLM 에이전트가 거의 최적의 성능을 달성할 수 있음을 입증하기 위해.

제안 방법

  • STRIDE는 계획, 도구 사용, 반성 등을 포함하는 구조적 사고 시퀀스를 조율하기 위해 컨트롤러 LLM을 사용하며, 이로써 다단계 추론을 가능하게 한다.
  • 프레임워크는 브레드스스프래이스 트리의 Minimax 알고리즘과 알파-베타 가지치기를 시뮬레이션하기 위해 CalculateScores 및 GetScores와 같은 운영 도구를 통합한다.
  • 백워드 인덕션과 워킹 메모리를 활용해 게임 상태의 계산된 점수를 저장하고 검색함으로써 최적의 수를 선택할 수 있도록 한다.
  • 가상의 알고리즘인 값 반복, 상한 신뢰도 값 반복, 백워드 인덕션을 다양한 전략적 환경에서 모방하도록 설계되어 있다.
  • 알려진 동역학 모델과 미리 알려지지 않은 환경 모델을 모두 지원하며, 동역학이 알려진 경우 계획과 도구 지원 시뮬레이션을 동적으로 전환한다.
  • 마르코프 결정 과정, 동적 메커니즘 설계, 협상 게임 등 특정 과제에 맞춰 조정된 프롬프트를 사용해 프레임워크를 평가한다.

실험 결과

연구 질문

  • RQ1도구 보강과 기억을 갖춘 LLM 에이전트가 전략적 의사결정 과제에서 표준 프롬프팅보다 뛰어난 성능을 보일 수 있는가?
  • RQ2순차적 협상과 같은 장기적 계획 수립과 상대방 모델링이 요구되는 환경에서 STRIDE 프레임워크의 효과는 어떠한가?
  • RQ3LLM이 도구 보조 추론을 통해 Minimax와 알파-베타 가지치기와 같은 복잡한 알고리즘을 어느 정도 정확하게 시뮬레이션할 수 있는가?
  • RQ4기억과 구조적 도구 사용 통합이 제로샷 체인오브스포크 프롬프팅 대비 틱택토와 커넥트-N과 같은 게임에서 성능 향상에 기여하는가?
  • RQ5이 프레임워크는 동적 메커니즘 설계와 이중 협상과 같은 다양한 전략적 도메인으로 일반화 가능한가?

주요 결과

  • 틱택토에서 STRIDE는 제로샷 체인오브스포크 모델 대비 90% 승리율을 기록했으며, 코드를 사용한 제로샷 체인오브스포크 대비 80% 승리율을 기록했다.
  • 몬테카를로 트리 탐색(MCTS)을 사용하는 RAFA와의 대결에서 STRIDE는 50%의 승리율을 기록해 전문 에이전트 대비 우수한 성능을 보였다.
  • 커넥트-3에서 STRIDE는 30%의 승리율을 기록했으며, 이는 제로샷 CoT(60% 승리)와 제로샷 CoT에 코드를 추가한 경우(90% 승리)보다 뚜렷하게 높은 전략적 일관성을 보여준다.
  • 커넥트-4에서 STRIDE는 50%의 승리율을 기록했으며, 이는 기본 제로샷 CoT에 코드를 사용한 경우와 동일했고, 비기기 결과에서 제로샷 CoT(10% 비기기) 대비 훨씬 뛰어난 성능을 보였다.
  • 10회의 실행에서 STRIDE는 틱택토에서 80%의 비기기 비율을 기록해 대칭 게임에서 높은 안정성과 거의 최적의 성능을 보였다.
  • 마르코프 결정 과정, 동적 메커니즘 설계, 협상 게임 등 여러 전략적 도메인에서 일관된 성능을 보였으며, 기본 LLM 대비 측정 가능한 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.