Skip to main content
QUICK REVIEW

[论文解读] Will I Sound Like Me? Improving Persona Consistency in Dialogues through Pragmatic Self-Consciousness

Hyunwoo Kim, Byeongchang Kim|arXiv (Cornell University)|Apr 13, 2020
Topic Modeling参考文献 30被引用 4
一句话总结

本文提出了一种基于虚构听众的语用自我意识机制,通过理性言语行为框架实现对话智能体的自洽性。通过建模智能体自身在他人眼中的表现,该方法在无需额外标签或训练的情况下减少了矛盾,提升了人格一致性,在PersonaChat和对话NLI基准测试中优于基线模型。

ABSTRACT

We explore the task of improving persona consistency of dialogue agents. Recent models tackling consistency often train with additional Natural Language Inference (NLI) labels or attach trained extra modules to the generative agent for maintaining consistency. However, such additional labels and training can be demanding. Also, we find even the best-performing persona-based agents are insensitive to contradictory words. Inspired by social cognition and pragmatics, we endow existing dialogue agents with public self-consciousness on the fly through an imaginary listener. Our approach, based on the Rational Speech Acts framework (Frank and Goodman, 2012), can enforce dialogue agents to refrain from uttering contradiction. We further extend the framework by learning the distractor selection, which has been usually done manually or randomly. Results on Dialogue NLI (Welleck et al., 2019) and PersonaChat (Zhang et al., 2018) dataset show that our approach reduces contradiction and improves consistency of existing dialogue models. Moreover, we show that it can be generalized to improve context-consistency beyond persona in dialogues.

研究动机与目标

  • 为解决对话智能体中持续存在的个性不一致问题,特别是对矛盾话语的不敏感性。
  • 消除训练过程中对昂贵的NLI标签和辅助一致性模型的依赖。
  • 通过模拟虚构听众对智能体话语的感知,赋予对话智能体自我意识。
  • 将该方法推广至个性一致性之外,以提升对话中的一般性上下文一致性。
  • 开发可学习的干扰项选择机制和更优的世界先验更新策略,以提升推理性能。

提出的方法

  • 将理性言语行为(RSA)框架适配用于建模公开的自我意识,通过模拟虚构听众对智能体话语的感知。
  • 提出一种新型的听众更新规则,使用 $ L_0^t $ 而非 $ L_1^t $,以在多轮对话中保留累积的先验信息。
  • 提出一种可学习的干扰项选择机制(干扰项记忆),以替代人工或随机选择非目标人格候选。
  • 利用说话人理性度 $ \alpha $ 和听众理性度 $ \beta $ 来控制流畅性、一致性与人格遵循之间的平衡。
  • 将自洽推理集成到现有生成模型中,无需重新训练,实现正交化应用。
  • 采用贝叶斯推理过程,使智能体预测听众对其话语的解读,以指导一致的响应生成。

实验结果

研究问题

  • RQ1对话智能体是否能在不依赖NLI标签或额外训练组件的情况下实现更好的人格一致性?
  • RQ2通过虚构听众建模公开的自我意识,对对话生成中的一致性有何影响?
  • RQ3所提方法是否可推广至人格一致性之外,以提升对话中的一般性上下文一致性?
  • RQ4听众理性度 $ \beta $ 和说话人理性度 $ \alpha $ 对一致性与流畅性之间权衡有何影响?
  • RQ5可学习的干扰项选择机制在提升自洽推理鲁棒性方面效果如何?

主要发现

  • 所提方法显著减少了对话响应中的矛盾,尤其在对话NLI基准上表现突出,且无需任何额外标签或训练。
  • 自洽智能体在PersonaChat和对话NLI上的话语准确率均得到提升,GT准确率相比基线模型有显著提高。
  • 使用 $ L_0^t $ 进行世界先验更新,相比 $ L_1^t $ 更好地保留了累积的人格信息,从而实现更稳定和一致的推理过程。
  • 设置 $ \beta \leq 1 $ 可确保听众模型有效整合先验上下文,避免因短视更新导致性能下降。
  • 最优的 $ \alpha $ 值可实现人格内容与响应的平滑融合,而过高的 $ \alpha $ 会导致对人格片段的过度依赖及句法质量下降。
  • 该方法可推广至人格一致性之外,提升上下文感知对话生成中的一致性,展现出在对话连贯性方面的更广泛应用潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。