Skip to main content
QUICK REVIEW

[论文解读] Learnable Strategies for Bilateral Agent Negotiation over Multiple Issues

Pallavi Bagga, Nicola Paoletti|arXiv (Cornell University)|Sep 17, 2020
Multi-Agent Systems and Negotiation被引用 6
一句话总结

该论文提出了一种可学习、自适应且可解释的双边协商代理 ANESIA,适用于用户与对手偏好不确定的多议题场景。ANESIA 使用带有可学习参数的策略模板,通过深度强化学习优化阈值效用,利用随机搜索(萤火虫算法)估计用户模型,并结合多目标优化(NSGA-II)与多准则决策方法(TOPSIS)生成近似帕累托最优的出价。ANESIA 在个体与社会福利效用方面均优于 ANAC 竞赛中的顶尖代理。

ABSTRACT

We present a novel bilateral negotiation model that allows a self-interested agent to learn how to negotiate over multiple issues in the presence of user preference uncertainty. The model relies upon interpretable strategy templates representing the tactics the agent should employ during the negotiation and learns template parameters to maximize the average utility received over multiple negotiations, thus resulting in optimal bid acceptance and generation. Our model also uses deep reinforcement learning to evaluate threshold utility values, for those tactics that require them, thereby deriving optimal utilities for every environment state. To handle user preference uncertainty, the model relies on a stochastic search to find user model that best agrees with a given partial preference profile. Multi-objective optimization and multi-criteria decision-making methods are applied at negotiation time to generate Pareto-optimal outcomes thereby increasing the number of successful (win-win) negotiations. Rigorous experimental evaluations show that the agent employing our model outperforms the winning agents of the 10th Automated Negotiating Agents Competition (ANAC'19) in terms of individual as well as social-welfare utilities.

研究动机与目标

  • 开发一种自适应的、自利的代理,能够在用户与对手偏好不确定的情况下学习协商策略。
  • 实现基于策略模板、具有可学习参数的可解释协商,以实现动态自适应。
  • 通过基于部分偏好配置的随机优化方法估计用户模型,以应对用户偏好不确定性。
  • 通过整合多目标优化与多准则决策方法,生成近似帕累托最优的出价。
  • 在自动化协商竞赛中,于个体与社会福利指标上超越最先进代理。

提出的方法

  • ANESIA 采用策略模板——即参数化、条件-动作规则集,表示可解释且可自适应的协商策略。
  • 采用演员-评论家深度强化学习架构,学习用于出价接受与提议决策的动态阈值效用。
  • 基于萤火虫算法的元启发式方法,从部分偏好配置中估计用户的效用模型,从而在不确定性下保持鲁棒性。
  • 多目标优化(NSGA-II)生成一组近似帕累托最优的协商结果,随后通过 TOPSIS 进行排序与选择。
  • 该代理整合上述组件,在协商过程中实时生成自适应且高效率的出价。
  • 模型在 GENIUS 工具与 ANAC 竞赛环境的多个领域中通过模拟进行评估。

实验结果

研究问题

  • RQ1协商代理是否能在用户与对手偏好不确定的情况下学习到有效且可解释的策略?
  • RQ2深度强化学习与元启发式方法的结合在多议题场景下如何提升协商性能?
  • RQ3ANESIA 在个体与社会福利指标上超越最先进代理的程度如何?
  • RQ4NSGA-II 与 TOPSIS 的结合在生成近似帕累托最优协商结果方面的有效性如何?
  • RQ5该代理在面对未知对手的未见协商场景中是否仍能保持优异表现?

主要发现

  • 在多个领域中,ANESIA 在个体与社会福利效用方面均优于 ANAC’17、ANAC’18 与 ANAC’19 的冠军代理。
  • 在 Itex 领域(仅 10% 的结果空间)中,ANESIA 的社会福利效用达到 0.75,高于 AgentGP(0.83)与 FSEGA2019(0.96),尽管平均奖励更高。
  • 在 Outfit 领域(仅 5% 的结果空间)中,ANESIA 的社会福利效用达到 0.70,优于 AgentGP(0.69)与 FSEGA2019(0.96),且成功率达到 0.74。
  • ANESIA 展现出强大的适应能力,在 Itex 领域与 Outfit 领域中分别实现了 0.75 与 0.74 的成功率,即使面对未知对手亦表现稳健。
  • 消融实验表明,ANESIA-rand(随机策略)在 Itex 中达到 0.75 的成功率,在 Outfit 中达到 0.70,表明即使未完全学习,其核心架构本身也具备有效性。
  • 将萤火虫算法用于用户模型估计、TOPSIS 用于结果选择,显著提升了效用并加速了双赢结果的收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。