[论文解读] Deceptive Reinforcement Learning for Privacy-Preserving Planning
本文提出了两种基于欺骗的强化学习方法——基于模糊性的动作选择与基于非理性的动作加权选择,以在无模型强化学习中保护奖励函数的隐私。通过利用预训练的Q函数生成次优但模糊的轨迹,智能体能够欺骗天真意图识别系统和人类观察者,降低对真实奖励函数的推断准确性,同时仅造成适度的奖励损失。
In this paper, we study the problem of deceptive reinforcement learning to preserve the privacy of a reward function. Reinforcement learning is the problem of finding a behaviour policy based on rewards received from exploratory behaviour. A key ingredient in reinforcement learning is a reward function, which determines how much reward (negative or positive) is given and when. However, in some situations, we may want to keep a reward function private; that is, to make it difficult for an observer to determine the reward function used. We define the problem of privacy-preserving reinforcement learning, and present two models for solving it. These models are based on dissimulation -- a form of deception that `hides the truth'. We evaluate our models both computationally and via human behavioural experiments. Results show that the resulting policies are indeed deceptive, and that participants can determine the true reward function less reliably than that of an honest agent.
研究动机与目标
- 为解决在强化学习中保护隐私的挑战,隐藏真实奖励函数不被观察者知晓。
- 开发无模型、实用的欺骗机制,适用于标准强化学习框架,无需依赖基于模型的规划。
- 在计算和人类行为设置下评估欺骗的有效性。
- 探究欺骗对观察者推断准确率的影响,以及与期望奖励性能之间的权衡。
- 研究观察者复杂度与意识水平在欺骗有效性中的作用。
提出的方法
- 模糊性模型通过选择能最大化观察者对可能目标信念分布的熵的动作,增加对真实奖励函数的不确定性。
- 非理性模型通过加权和方式结合诚实动作与非理性动作,其中权重经调优以平衡欺骗性与性能。
- 两种模型均使用预训练的Q函数指导动作选择,使方法可在无模型强化学习中应用,而无需环境模型知识。
- 通过生成对除真实目标外所有目标均次优的轨迹来实现欺骗,使智能体的意图变得模糊。
- 使用一个天真意图识别系统评估模型,该系统基于观察到的路径估计目标的可能性。
- 通过69名参与者的实验,评估在具有3个或5个潜在目的地的路径规划任务中,欺骗在现实世界中的有效性。
实验结果
研究问题
- RQ1在强化学习中,欺骗能否有效隐藏真实奖励函数不被观察者识别?
- RQ2与基于非理性的模型相比,基于模糊性的模型在欺骗有效性和奖励效率方面表现如何?
- RQ3当观察欺骗性智能体与诚实智能体时,人类参与者在多大程度上能推断出真实奖励函数?
- RQ4观察者是否知晓欺骗可能发生(例如,知道欺骗是可能的),这如何影响其对欺骗的感知?
- RQ5在所提模型中,欺骗有效性与期望累积奖励之间的权衡关系如何?
主要发现
- 与诚实智能体相比,模糊性模型显著降低了人类参与者正确识别真实奖励函数的能力,尤其在五目标场景中更为明显。
- 非理性模型的欺骗效果强于模糊性模型,因为参与者在整个路径过程中更难正确推断出真实目标。
- 尽管存在欺骗,随着观察动作数量的增加,真实奖励函数的可识别性逐渐提高,表明更长的规划会降低隐私保护效果。
- 人类参与者的准确率低于天真意图识别模型,表明人类认知在推断最优路径方面效率较低。
- 诚实模型有时被参与者视为具有欺骗性,可能是因为其对策略行为存在假设,突显了欺骗检测中观察者的偏见。
- 非理性模型的奖励损失(即折扣期望奖励)高于模糊性模型,表明欺骗设计中存在性能与成本的权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。