Skip to main content
QUICK REVIEW

[论文解读] SARSA(0) Reinforcement Learning over Fully Homomorphic Encryption

Ji-Hoon Suh, Takashi Tanaka|arXiv (Cornell University)|Feb 2, 2020
Smart Grid Security and Resilience参考文献 20被引用 4
一句话总结

本文提出了一种基于全同态加密(FHE)的隐私保护云环境强化学习框架,用于安全地将SARSA(0)值函数更新外包至云端。通过引入一种阻塞机制以应对FHE带来的延迟,该方法在平衡杆任务中实现了收敛,且精度损失极低(0.0063%),证明了在加密计算环境下实现私密离线控制综合的可行性。

ABSTRACT

We consider a cloud-based control architecture in which the local plants outsource the control synthesis task to the cloud. In particular, we consider a cloud-based reinforcement learning (RL), where updating the value function is outsourced to the cloud. To achieve confidentiality, we implement computations over Fully Homomorphic Encryption (FHE). We use a CKKS encryption scheme and a modified SARSA(0) reinforcement learning to incorporate the encryption-induced delays. We then give a convergence result for the delayed updated rule of SARSA(0) with a blocking mechanism. We finally present a numerical demonstration via implementing on a classical pole-balancing problem.

研究动机与目标

  • 在保护数据机密性的前提下,实现强化学习控制综合的云端安全外包。
  • 通过引入阻塞状态机制改进SARSA(0)算法,以应对FHE带来的加密延迟挑战。
  • 证明在CKKS FHE方案下实现SARSA(0)的可行性,且精度退化最小。
  • 为所提出的阻塞机制下的延迟更新规则提供收敛性分析。
  • 在经典控制问题(倒立摆)上评估该方法,以验证其实际适用性。

提出的方法

  • 通过引入阻塞状态机制,对SARSA(0)进行改进,以应对同态加密操作带来的延迟。
  • 采用CKKS FHE方案,实现对加密状态-动作值矩阵的近似算术运算。
  • 在客户端完成Q值的编码、加密与解密,云端执行同态运算。
  • 通过在加密数据上执行批量更新,包括同态加法、乘法、重线性化与重缩放。
  • 引入阻塞协议,防止过早更新,确保在计算延迟下仍能收敛。
  • 将该方法应用于经典平衡杆问题,以评估性能与精度。

实验结果

研究问题

  • RQ1能否使用全同态加密(FHE)安全地将SARSA(0)强化学习外包至云端?
  • RQ2FHE带来的延迟如何影响SARSA(0)的收敛性?是否可被缓解?
  • RQ3在SARSA(0)中使用CKKS加密时,Q值更新的精度损失是多少?
  • RQ4改进后的SARSA(0)引入阻塞状态后,能否在加密延迟更新下实现收敛?
  • RQ5所提出的框架是否适用于隐私敏感场景下的离线控制综合?

主要发现

  • 尽管存在加密延迟,引入阻塞状态的改进SARSA(0)仍实现了收敛,验证了理论收敛结果。
  • Q值更新的最大精度误差仅为0.0063%,表明对学习精度的影响可忽略不计。
  • 在给定的CKKS参数下,云端计算时间在最多4096次操作内保持稳定,表明可扩展至更大的状态-动作空间。
  • 客户端操作(尤其是编码与加密)占总同态操作时间的63%,凸显其为关键性能瓶颈。
  • 该方法在仿真中成功实现了平衡杆控制,证实了私密云端控制综合的可行性。
  • 该框架最适合用于离线或缓慢变化的控制综合场景,其中隐私至关重要且对实时性要求较低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。