[论文解读] ProsocialDialog: A Prosocial Backbone for Conversational Agents
本文提出了 ProsocialDialog,一个大规模多轮对话数据集(58,000 个对话,331,000 条话语),用于训练对话智能体在面对不安全、不道德或具有毒性用户输入时,基于常识性社会规则准则(RoTs)表现出亲社会行为。通过人机协作框架,作者开发了 Canary(规则准则生成器)和 Prost(社会感知对话智能体),其在生成更安全、更符合社会规范的回应方面显著优于当前最先进模型,尤其在零样本设置下表现突出。
Most existing dialogue systems fail to respond properly to potentially unsafe user utterances by either ignoring or passively agreeing with them. To address this issue, we introduce ProsocialDialog, the first large-scale multi-turn dialogue dataset to teach conversational agents to respond to problematic content following social norms. Covering diverse unethical, problematic, biased, and toxic situations, ProsocialDialog contains responses that encourage prosocial behavior, grounded in commonsense social rules (i.e., rules-of-thumb, RoTs). Created via a human-AI collaborative framework, ProsocialDialog consists of 58K dialogues, with 331K utterances, 160K unique RoTs, and 497K dialogue safety labels accompanied by free-form rationales. With this dataset, we introduce a dialogue safety detection module, Canary, capable of generating RoTs given conversational context, and a socially-informed dialogue agent, Prost. Empirical results show that Prost generates more socially acceptable dialogues compared to other state-of-the-art language and dialogue models in both in-domain and out-of-domain settings. Additionally, Canary effectively guides conversational agents and off-the-shelf language models to generate significantly more prosocial responses. Our work highlights the promise and importance of creating and steering conversational AI to be socially responsible.
研究动机与目标
- 为解决缺乏大规模、多轮对话数据集,以教导对话智能体对不道德、有毒或有问题的用户输入做出适当回应的问题。
- 开发一种具有社会责任感的对话系统,使其在面对不安全内容时,不通过回避或认同,而是基于社会规范促进亲社会行为。
- 引入一种细粒度、基于理由的安全标签方案,以捕捉亲社会回应背后的推理过程。
- 创建一个可复用、可泛化的框架,以提升预训练语言模型的安全性和社会适宜性。
提出的方法
- 采用人机协作的数据收集流程:GPT-3 生成潜在不安全的用户话语,众包工作者基于规则准则(RoTs)提供亲社会回应。
- 构建大规模数据集(ProsocialDialog),包含 58,000 个对话、331,000 条话语、160,000 个唯一 RoTs,以及 497,000 个带有自由形式理由的安全标签。
- 开发 Canary,一个规则准则生成模型,能够从对话语境中推断出相关社会规则,以指导安全回应。
- 设计 Prost,一个对话智能体,通过上下文关联实现对 RoTs 的联合预测与亲社会回应的生成。
- 将 Canary 作为零样本安全模块,用于引导现成的大型语言模型生成更具亲社会性的输出。
- 结合自动指标(困惑度)与人工评估(参与度、尊重度、连贯性)来评估回应质量。
实验结果
研究问题
- RQ1基于社会规范的大规模多轮对话数据集能否提升对话智能体的安全性与亲社会行为?
- RQ2规则准则生成模型(Canary)在从语境中识别出社会适宜回应策略方面的有效性如何?
- RQ3基于规则准则的提示能否在零样本设置下显著提升预训练语言模型的亲社会性?
- RQ4亲社会对话智能体(Prost)在生成对问题输入的社会可接受回应方面,与最先进模型相比表现如何?
- RQ5带有理由的细粒度安全标签能否提升对话安全检测的可解释性与质量?
主要发现
- Prost 在域内与域外设置下均优于最先进模型,在一对一评估中整体人类偏好得分为 40.2%,显著高于基线模型。
- Canary 引导的提示使 GPT-3 的亲社会回应比例在人类偏好评估中提升了 27.3 个百分点(从 28.4% 提高至 55.7%)。
- 该模型在 ProsocialDialog 上的困惑度为 10.13,显著低于 InstructGPT 等基线模型(18.47),表明其回应更具流畅性与连贯性。
- 人工评估显示,Prost 生成的回应比微调后的 DialoGPT 更具尊重性、连贯性与参与度,亲社会性偏好得分为 28.3%,连贯性偏好得分为 24.1%。
- 与二元安全标签相比,该数据集的细粒度安全标签与理由可实现更好的可解释性,并支持对问题内容的更细致检测。
- 将 Canary 零样本应用于 GPT-3 后,亲社会回应的人类偏好率达到 55.7%,证明了基于规则准则提示在真实部署中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。