Skip to main content
QUICK REVIEW

[论文解读] Decoupling Strategy and Generation in Negotiation Dialogues

He He, Derek Chen|arXiv (Cornell University)|Aug 29, 2018
Topic Modeling参考文献 30被引用 11
一句话总结

本文提出了一种模块化框架,通过使用粗粒度对话行为(例如,propose(price=50))将谈判对话中的策略与生成解耦,从而实现通过监督学习、强化学习或领域知识进行可控且可解释的策略学习,同时通过检索式生成保持上下文感知和多样性响应。该方法在开放域设置下使用真实物品时,相较于端到端模型,取得了更高的任务成功率和类人行为表现。

ABSTRACT

We consider negotiation settings in which two agents use natural language to bargain on goods. Agents need to decide on both high-level strategy (e.g., proposing \$50) and the execution of that strategy (e.g., generating "The bike is brand new. Selling for just \$50."). Recent work on negotiation trains neural models, but their end-to-end nature makes it hard to control their strategy, and reinforcement learning tends to lead to degenerate solutions. In this paper, we propose a modular approach based on coarse di- alogue acts (e.g., propose(price=50)) that decouples strategy and generation. We show that we can flexibly set the strategy using supervised learning, reinforcement learning, or domain-specific knowledge without degeneracy, while our retrieval-based generation can maintain context-awareness and produce diverse utterances. We test our approach on the recently proposed DEALORNODEAL game, and we also collect a richer dataset based on real items on Craigslist. Human evaluation shows that our systems achieve higher task success rate and more human-like negotiation behavior than previous approaches.

研究动机与目标

  • 为解决端到端神经模型在谈判对话中缺乏控制性和可解释性的问题。
  • 克服基于强化学习的对话系统中常见的退化行为(例如,重复或语法错误的语句)。
  • 实现灵活的策略学习——通过监督学习、强化学习或领域特定规则——而无需重新训练生成模块。
  • 收集并发布一个新的、基于Craigslist真实物品的现实主义谈判数据集(CraigslistBargain),用于开放域讨价还价。
  • 通过人类评估,在合成数据集(DealOrNoDeal)和真实世界数据集(CraigslistBargain)上评估该框架。

提出的方法

  • 该框架使用解析器将话语映射为粗粒度对话行为(例如,inform、propose、inquire),在不包含完整语义内容的情况下捕捉高层次的战略意图。
  • 对话管理器使用序列到序列模型基于解析后的对话历史生成下一个粗粒度对话行为,通过监督学习、强化学习或领域知识进行优化。
  • 检索式生成器基于预测的对话行为和完整的语句历史生成自然语言响应,确保上下文感知和多样性。
  • 该系统在两个数据集上进行训练和评估:DealOrNoDeal(合成)和CraigslistBargain(真实世界),并通过A/B测试进行人类评估。
  • 对话管理器采用不同的训练目标:RL_utility(坚持报价)、RL_length(提问并延迟报价)、RL_fairness(目标为中间价格),以及SL(监督学习)结合基于规则的后处理。
  • 粗粒度对话行为空间支持混合控制——例如,将学习到的策略与手工编码规则结合——从而提升策略的可解释性和鲁棒性。

实验结果

研究问题

  • RQ1与端到端模型相比,解耦策略与生成的模块化框架是否能提升谈判对话中的控制性和可解释性?
  • RQ2使用粗粒度对话行为作为战略核心是否能防止端到端强化学习中常见的退化行为?
  • RQ3不同的训练目标(监督学习、强化学习、领域规则)是否能产生不同且理想的谈判策略(例如,公平性、坚持性、灵活性)?
  • RQ4当基于粗粒度对话行为进行条件控制时,检索式生成器是否能保持上下文感知并生成多样且类人的响应?
  • RQ5在开放域、真实世界的谈判场景中,该系统在人类评估中的任务成功率和类人行为表现如何?

主要发现

  • RL_length(act) 模型在CraigslistBargain数据集上实现了42.4%的语句为问题,显著高于其他模型,表明其有效运用了询问策略。
  • RL_fairness(act) 模型学习到在列表价格和目标价格之间的中点附近提出报价,展示了谈判中的战略公平性。
  • RL_utility(act) 模型坚持其报价且拒绝妥协,导致协议率低且在人类评估中引发挫败感,凸显了固执策略的风险。
  • SL(act)+rule 模型通过加入手工编码的妥协规则,在两个数据集上均实现了高实用性与类人行为,优于纯强化学习或监督学习基线模型。
  • 即使仅使用监督学习,基于粗粒度对话行为训练的模型也产生了更多样化的语句并实现了更高的任务成功率,优于词级别模型。
  • 人类评估确认,所提出的模块化系统在任务成功率和类人谈判行为方面均优于以往的端到端方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。