[論文レビュー] How Well Can LLMs Negotiate? NegotiationArena Platform and Analysis
本論文では、マルチターン交渉シナリオにおけるLLMエージェントの評価およびプローブを可能にするオープンソースプラットフォーム、NegotiationArenaを紹介する。GPT-4のようなLLMが、虚偽の絶望を装うなどの戦略的行動を通じて報酬を著しく向上させることを示している一方で、アンカーリングや数量効果といった非合理的なバイアスも示している。
Negotiation is the basis of social interactions; humans negotiate everything from the price of cars to how to share common resources. With rapidly growing interest in using large language models (LLMs) to act as agents on behalf of human users, such LLM agents would also need to be able to negotiate. In this paper, we study how well LLMs can negotiate with each other. We develop NegotiationArena: a flexible framework for evaluating and probing the negotiation abilities of LLM agents. We implemented three types of scenarios in NegotiationArena to assess LLM's behaviors in allocating shared resources (ultimatum games), aggregate resources (trading games) and buy/sell goods (price negotiations). Each scenario allows for multiple turns of flexible dialogues between LLM agents to allow for more complex negotiations. Interestingly, LLM agents can significantly boost their negotiation outcomes by employing certain behavioral tactics. For example, by pretending to be desolate and desperate, LLMs can improve their payoffs by 20\% when negotiating against the standard GPT-4. We also quantify irrational negotiation behaviors exhibited by the LLM agents, many of which also appear in humans. Together, \NegotiationArena offers a new environment to investigate LLM interactions, enabling new insights into LLM's theory of mind, irrationality, and reasoning abilities.
研究の動機と目的
- 動的でマルチターンの交渉設定におけるLLMエージェントを評価するための柔軟でオープンソースのフレームワークを開発すること。
- リソース配分、取引、価格交渉を含む現実世界の交渉シナリオにおけるLLMの行動を調査すること。
- LLMエージェントの交渉結果に影響を与える戦略的・社会的・非合理的な行動を同定すること。
- 虚偽の絶望を装うなどの行動戦術が交渉成功に与える影響を定量化すること。
- 競争的で相互作用的な環境における最先端のLLMの合理性とマインド理論能力を評価すること。
提案手法
- リソース交換、マルチターンアンチティマムゲーム、価格交渉の3つのコアな交渉シナリオをサポートするモジュラーなプラットフォーム、NegotiationArenaを設計および実装すること。
- 制御可能で繰り返し可能な実験が可能となるよう、初期リソース、目標、ターン制限、受容条件を明確に定義すること。
- 柔軟なターンベースの対話インタラクションを用いて、LLMエージェント(GPT-4、GPT-3.5、Claude 2.1、Claude 2)を交渉フローに統合すること。
- 提案の順序、受容/拒否のパターン、最終報酬を含む交渉の軌跡を収集および分析すること。
- 異なる戦略やリソースレベルにおける最終報酬シェアや勝率といった定量的指標を用いてパフォーマンスを測定すること。
- 感情的な訴えや中傷といった特定の行動が交渉結果に与える影響を評価するためのアブレーションスタディを実施すること。
実験結果
リサーチクエスチョン
- RQ1LLMエージェントは、静的ベンチマークタスクと比較して、マルチターンで動的である交渉シナリオでどのように性能を発揮するか?
- RQ2虚偽の絶望や攻撃的行動といった戦略的行動は、LLMエージェントの報酬をどのように向上させるか?
- RQ3LLMエージェントは、アンカーリングバイアスや数量バイアスといった非合理的な行動を交渉設定でどの程度示すか?
- RQ4分配する金額の絶対的額が増加する(例:100ドルから100億ドルに)と、アンチティマム形式の交渉における公平性と提示の受容性にどのような影響を与えるか?
- RQ5GPT-4とClaude 2.1の例を含め、異なるLLM(例:GPT-4 vs. Claude 2.1)は交渉パフォーマンスと行動パターンでどのように比較されるか?
主な発見
- GPT-4は、すべてのシナリオにおいて他のLLMを一貫して上回る交渉結果を示し、優れた戦略的推論力とコミュニケーション能力を示している。
- 標準のGPT-4と交渉する際、虚偽の絶望や無気力さを装うことで、LLMの報酬が最大20%向上した。
- LLMエージェントはアンカーリングバイアスを示しており、非合理的であっても初期提示が最終結果に著しく影響を与える。
- 分配する金額が増加する(例:100ドルから100億ドルに)と、提示者のシェアは著しく上昇し、100億ドルではほぼ79%に達する。これは数量バイアスを示している。
- 絶対額が大きい場合、エージェントは不平等な提示を頻繁に受容しており、古典的アンチティマムゲームで観察された人間の非合理的行動と類似している。
- テストされたすべてのLLMは、中傷や感情的な訴えといった社会的操作戦術に対して脆弱であり、交渉結果を改善するために悪用可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。