[論文レビュー] Learnable Strategies for Bilateral Agent Negotiation over Multiple Issues
本稿では、ユーザーおよび相手の好みの不確実性下での複数課題交渉設定において、学習可能で適応的かつ解釈可能な二重交渉エージェントである ANESIA を提案する。ANESIA は、学習可能なパラメータを有する戦略テンプレートを用い、深層強化学習を用いて閾値効用を最適化し、確率的探索(ファイヤーフライアルゴリズム)を用いてユーザーのモデルを推定し、多目的最適化(NSGA-II)と多基準意思決定(TOPSIS)を統合して近似的にパレート最適な入札を生成する。ANESIA は、ANAC 競争の上位エージェントを、個々の福利と社会的福利の両面で上回った。
We present a novel bilateral negotiation model that allows a self-interested agent to learn how to negotiate over multiple issues in the presence of user preference uncertainty. The model relies upon interpretable strategy templates representing the tactics the agent should employ during the negotiation and learns template parameters to maximize the average utility received over multiple negotiations, thus resulting in optimal bid acceptance and generation. Our model also uses deep reinforcement learning to evaluate threshold utility values, for those tactics that require them, thereby deriving optimal utilities for every environment state. To handle user preference uncertainty, the model relies on a stochastic search to find user model that best agrees with a given partial preference profile. Multi-objective optimization and multi-criteria decision-making methods are applied at negotiation time to generate Pareto-optimal outcomes thereby increasing the number of successful (win-win) negotiations. Rigorous experimental evaluations show that the agent employing our model outperforms the winning agents of the 10th Automated Negotiating Agents Competition (ANAC'19) in terms of individual as well as social-welfare utilities.
研究の動機と目的
- ユーザーおよび相手の好みの不確実性下で、適応的で自己中心的な戦略を学習する交渉エージェントの開発。
- 学習可能なパラメータを有する戦略テンプレートに基づく解釈可能な交渉を可能にし、動的適応を実現。
- 部分的な好みプロファイルから確率的最適化を用いてユーザーのモデルを推定することで、ユーザー好みの不確実性に対処。
- 多目的最適化と多基準意思決定の統合により、近似的にパレート最適な入札を生成。
- 個々の福利と社会的福利の両面で、自動交渉コンペティションにおける最先端エージェントを上回ること。
提案手法
- ANESIA は、解釈可能で適応可能な戦略を表すパラメトリックな条件-行動ルール集合である戦略テンプレートを採用する。
- 入札受容および提案意思決定のための動的閾値効用を学習するために、エージェント・クリティック型の深層強化学習アーキテクチャを用いる。
- ファイヤーフライアルゴリズムに基づくメタヒューリスティクスを用いて、部分的な好みプロファイルからユーザーの効用モデルを推定し、不確実性下でも安定性を確保する。
- 多目的最適化(NSGA-II)により、近似的にパレート最適な交渉結果の集合を生成し、その後 TOPSIS を用いて順位付けと選択を実施する。
- これらのコンポーネントを統合することで、交渉中にリアルタイムで適応的かつ高利得な入札を生成する。
- モデルは、GENIUS ツールおよび ANAC トーナメント環境からのドメインを用いたシミュレーションで評価された。
実験結果
リサーチクエスチョン
- RQ1ユーザーおよび相手の好みの不確実性下でも、効果的で解釈可能な戦略を学習できる交渉エージェントは存在するか?
- RQ2深層強化学習とメタヒューリスティクスの統合は、複数課題交渉設定における交渉パフォーマンスをどのように向上させるか?
- RQ3ANESIA は、個々の福利と社会的福利の指標において、最先端エージェントをどの程度上回るか?
- RQ4NSGA-II と TOPSIS の組み合わせは、近似的にパレート最適な交渉結果を生成するのにどの程度有効か?
- RQ5未知の相手が登場する未確認の交渉シナリオにおいて、エージェントは高いパフォーマンスを維持できるか?
主な発見
- ANESIA は、複数のドメインにおいて、ANAC’17、ANAC’18、ANAC’19 の優勝エージェントを、個々の福利と社会的福利の両面で上回った。
- 10% の結果空間を有する Itex ドメインでは、ANESIA は社会的福利効用 0.75 を達成し、AgentGP(0.83)と FSEGA2019(0.96)を上回ったが、平均報酬は高かった。
- 5% の結果空間を有する Outfit ドメインでは、ANESIA は社会的福利効用 0.70 を達成し、AgentGP(0.69)と FSEGA2019(0.96)を上回り、0.74 の高い成功確率を達成した。
- ANESIA は高い適応性を示し、Itex ドメインで 0.75、Outfit ドメインで 0.74 の成功確率を達成し、未知の相手に対しても強固なパフォーマンスを維持した。
- アブレーションスタディの結果、ANESIA-rand(ランダム戦略)は Itex で 0.75、Outfit で 0.70 の成功確率を示し、完全な学習がなくても、コアアーキテクチャ自体が有効であることが示された。
- ファイヤーフライアルゴリズムによるユーザーのモデル推定と、TOPSIS による結果選択の統合により、利得が向上し、ウィンウィンの結果への収束が著しく向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。