[论文解读] Actor Critic with Differentially Private Critic
本文提出了一种差异隐私的演员-评论家强化学习框架,其中可信的生产者使用DP-LSL对策略进行私密评估并初始化评论家,从而实现对不可信消费者的样本高效迁移学习。该方法在保护敏感轨迹隐私的同时提升了下游任务的学习效率,实证结果表明即使在强隐私预算下也能实现更快收敛。
Reinforcement learning algorithms are known to be sample inefficient, and often performance on one task can be substantially improved by leveraging information (e.g., via pre-training) on other related tasks. In this work, we propose a technique to achieve such knowledge transfer in cases where agent trajectories contain sensitive or private information, such as in the healthcare domain. Our approach leverages a differentially private policy evaluation algorithm to initialize an actor-critic model and improve the effectiveness of learning in downstream tasks. We empirically show this technique increases sample efficiency in resource-constrained control problems while preserving the privacy of trajectories collected in an upstream task.
研究动机与目标
- 为在医疗等场景中代理轨迹包含敏感信息的强化学习任务,实现隐私保护的知识迁移。
- 通过利用上游数据中经过私化的价值函数初始化,解决强化学习中的样本效率低下问题。
- 设计一种生产者-消费者信任模型,其中可信的聚合者共享一个差异隐私的价值函数,以在下游不可信环境中启动学习。
- 评估差异隐私策略评估是否能有效初始化演员-评论家智能体,同时保持强隐私保障。
提出的方法
- 生产者使用DP-LSL(一种差异隐私的最小二乘回归算法)从私密轨迹数据库中估计状态值函数。
- DP-LSL的输出,即正则化最小二乘估计 $\hat{\theta}^\lambda_X$,用于初始化演员-评论家框架中评论家的参数 $\mathbf{w}$。
- 消费者使用私化的价值函数 $\hat{v}(s, \mathbf{w})$ 初始化其评论家,随后在其自身环境中执行标准的演员-评论家训练。
- 通过向DP-LSL估计过程添加校准噪声来实现差异隐私,隐私参数为 $\epsilon$ 和 $\delta = 1/m$。
- 该方法假设每条轨迹均为单个用户贡献,通过限制任一条轨迹对最终值函数估计的影响来保护隐私。
- 该方法在100状态的MDP和OpenAI Gym的Taxi-V2环境中进行了评估,对比了使用和不使用私化初始化的性能。
实验结果
研究问题
- RQ1能否使用差异隐私策略评估算法在演员-评论家强化学习框架中初始化评论家,同时保护训练轨迹的隐私?
- RQ2私化价值函数初始化是否能提升下游强化学习任务中的样本效率?
- RQ3隐私预算 $\epsilon$ 的变化如何影响消费者环境中转移策略的性能?
- RQ4即使隐私预算较紧,使用私化价值函数迁移是否仍具有可测量的优势?
主要发现
- 使用差异隐私评论家初始化的演员-评论家智能体在MDP-100和Taxi-V2环境中均实现了比非私化初始化更快的收敛速度。
- 在Taxi-V2环境中,使用私化初始化的智能体在10,000个回合内达到收敛,而未使用私化初始化的智能体则需15,000个回合。
- 将隐私预算 $\epsilon$ 改变两个数量级对性能影响可忽略,表明该方法对隐私-效用权衡具有鲁棒性。
- 该方法表明,即使加入DP噪声,转移的价值函数仍显著提升了样本效率,证明了私化知识迁移的有效性。
- 将生产者轨迹数量从10k增加到50k进一步提升了迁移性能,表明该方法在数据量增加时具有可扩展性。
- 结果证实,在数据有限且隐私受限的强化学习场景中,私化价值函数迁移能带来切实可行的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。