[论文解读] ClarifyDelphi: Reinforced Clarification Questions with Defeasibility Rewards for Social and Moral Situations
ClarifyDelphi 引入了一种强化学习框架,通过优化可废止性(defeasibility)来为社会和道德情境生成澄清问题——即那些潜在答案会导致最大分歧道德判断的问题。该系统基于 Delphi 模型输出的分歧程度设计奖励机制,生成的问题比强基线模型更具信息量和上下文相关性,展现出在激发具有道德意义的上下文信息方面更强的能力。
Context is everything, even in commonsense moral reasoning. Changing contexts can flip the moral judgment of an action; "Lying to a friend" is wrong in general, but may be morally acceptable if it is intended to protect their life. We present ClarifyDelphi, an interactive system that learns to ask clarification questions (e.g., why did you lie to your friend?) in order to elicit additional salient contexts of a social or moral situation. We posit that questions whose potential answers lead to diverging moral judgments are the most informative. Thus, we propose a reinforcement learning framework with a defeasibility reward that aims to maximize the divergence between moral judgments of hypothetical answers to a question. Human evaluation demonstrates that our system generates more relevant, informative and defeasible questions compared to competitive baselines. Our work is ultimately inspired by studies in cognitive science that have investigated the flexibility in moral cognition (i.e., the diverse contexts in which moral rules can be bent), and we hope that research in this direction can assist both cognitive and computational investigations of moral judgments.
研究动机与目标
- 通过使系统能够主动寻求缺失的上下文信息,解决现有模型在道德推理中缺乏上下文感知的问题。
- 将‘可废止性’定义并操作化为道德与社会推理中澄清问题的一种新颖相关性形式。
- 开发一种基于强化学习的问答生成系统,以优化生成可能引发可改变或逆转默认道德判断之上下文的问题。
- 创建并发布一个包含 33,000 个澄清问题的高质量、文化多元化的数据集,涵盖社会与道德情境。
- 证明澄清问题可通过实现可废止性更新,从而改善道德推理。
提出的方法
- 系统使用近端策略优化(Proximal Policy Optimization, PPO)训练策略网络,根据给定情境生成澄清问题。
- 奖励函数通过模拟假设性回答并测量 Delphi 对这些回答所分配的道德判断分歧程度,来评估每个生成问题的质量。
- 奖励计算为 Delphi 在不同假设回答上的判断概率分布之间的 KL 散度,以促进生成导致道德评估中高不确定或冲突的问题。
- 该方法利用预训练的回答生成模型来模拟对每个问题的合理回应,随后由 Delphi 对这些回应进行道德判断评分。
- 训练过程以在人类标注的澄清问题数据集上微调的监督策略初始化。
- 该框架设计为数据高效,仅需少量监督数据即可实现优异性能。
实验结果
研究问题
- RQ1基于可废止性奖励函数的强化学习能否生成比现有基线更具有信息量和上下文相关性的澄清问题?
- RQ2导致道德判断分歧(即具有可废止性)的问题在多大程度上能提升道德推理的准确性和细致程度?
- RQ3预训练一个有效的初始策略以生成澄清问题,需要多少监督数据?
- RQ4生成的澄清问题能否引发道德判断的可废止性更新,即基于新上下文改变原有判断?
- RQ5数据收集中的文化与人口背景如何影响模型输出的泛化能力?
主要发现
- 在人类评估中,ClarifyDelphi 的表现优于强基线模型,其生成的问题在相关性、信息量和可废止性方面均获得显著更高评分。
- 采用可废止性奖励的强化学习方法使问题质量相比监督基线提升了 15%-20%。
- 该方法仅需少量监督数据(如 5,000 个样本)即可实现优异性能,表明其具有高度数据效率。
- 生成的问题成功激发了能导致可废止性更新的上下文信息,即引发道德判断的改变,证明其具备化解模糊性的能力。
- 发布 δ-Clarify(33,000 个问题)和 δ-Clarify silver(生成的问题)为未来道德推理与问题生成研究提供了宝贵资源。
- 人类评估确认,ClarifyDelphi 生成的问题比现有方法更有可能揭示具有道德意义的上下文信息。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。