Skip to main content
QUICK REVIEW

[논문 리뷰] SARSA(0) Reinforcement Learning over Fully Homomorphic Encryption

Ji-Hoon Suh, Takashi Tanaka|arXiv (Cornell University)|2020. 02. 02.
Smart Grid Security and Resilience참고 문헌 20인용 수 4
한 줄 요약

이 논문은 완전히 동형 암호화(FHE)를 사용하여 안전하게 암호화된 계산을 통해 클라우드 기반 강화학습의 SARSA(0) 가치 함수 업데이트를 외주할 수 있는 프라이버시 보장형 프레임워크를 제안한다. FHE로 인한 지연을 처리하기 위해 차단 메커니즘을 도입한 수정된 SARSA(0)를 통해, 지정된 정밀도 손실(0.0063%)로 최소한의 정밀도 손실을 동반하면서도 펜던트 균형 유지 작업에서 수렴을 달성하였으며, 이는 암호화된 계산을 통한 기밀성 유지가 가능한 오프라인 제어 합성의 실현 가능성을 입증한다.

ABSTRACT

We consider a cloud-based control architecture in which the local plants outsource the control synthesis task to the cloud. In particular, we consider a cloud-based reinforcement learning (RL), where updating the value function is outsourced to the cloud. To achieve confidentiality, we implement computations over Fully Homomorphic Encryption (FHE). We use a CKKS encryption scheme and a modified SARSA(0) reinforcement learning to incorporate the encryption-induced delays. We then give a convergence result for the delayed updated rule of SARSA(0) with a blocking mechanism. We finally present a numerical demonstration via implementing on a classical pole-balancing problem.

연구 동기 및 목표

  • 데이터 기밀성을 유지하면서 강화학습 제어 합성을 클라우드에 안전하게 외주할 수 있도록 하는 것.
  • FHE로 인한 암호화 지연 문제를 해결하기 위해 SARSA(0) 알고리즘을 차단 상태 메커니즘으로 수정하는 것.
  • CKKS FHE 체계를 사용하여 SARSA(0)를 최소한의 정밀도 저하로 구현할 수 있음을 입증하는 것.
  • 제안된 차단 메커니즘 하에서 지연된 업데이트 규칙의 수렴 분석을 수행하는 것.
  • 전통적인 제어 문제(역퍼레드럼)에서 방법을 평가하여 실용적 적용 가능성을 검증하는 것.

제안 방법

  • 동형 암호화 연산으로 인한 지연을 처리하기 위해 차단 상태 메커니즘을 적용한 수정된 SARSA(0).
  • 암호화된 상태-행동 가치 행렬에서 근사 산술을 가능하게 하기 위해 CKKS FHE 체계를 사용.
  • 클라이언트 측에서 Q-값의 인코딩, 암호화 및 복호화를 구현하고, 클라우드 측에서 동형 연산을 수행.
  • 암호화된 데이터를 대상으로 동형 덧셈, 곱셈, 재선형화 및 스케일링을 사용한 배치 업데이트를 수행.
  • 조기 업데이트를 방지하고 지연된 계산 하에서도 수렴을 보장하기 위해 차단 프로토콜을 도입.
  • 성능 및 정밀도 평가를 위해 전통적인 펜던트 균형 문제에 방법을 적용.

실험 결과

연구 질문

  • RQ1완전히 동형 암호화를 사용하여 SARSA(0) 강화학습을 클라우드에 안전하게 외주할 수 있는가?
  • RQ2FHE로 인한 지연이 SARSA(0)의 수렴에 어떤 영향을 미치며, 이를 완화할 수 있는가?
  • RQ3SARSA(0)에서 CKKS 암호화를 사용할 경우 Q-값 업데이트의 정밀도 손실은 어느 정도인가?
  • RQ4차단 상태를 갖춘 수정된 SARSA(0)가 지연된 암호화된 업데이트 하에서도 수렴을 달성할 수 있는가?
  • RQ5제안된 프레임워크는 기밀성에 민감한 응용 분야에서 오프라인 제어 합성에 적합한가?

주요 결과

  • 암호화로 인한 지연이 있음에도 불구하고, 차단 상태를 갖춘 수정된 SARSA(0)는 수렴을 달성하였으며, 이는 이론적 수렴 결과의 타당성을 입증한다.
  • Q-값 업데이트에서 발생하는 최대 정밀도 오차는 단지 0.0063%에 불과하여 학습 정확도에 미치는 영향이 극히 미미하다.
  • 제공된 CKKS 파rameter 하에서 클라우드 측 계산 시간은 최대 4096개의 연산까지 안정을 유지하여 더 큰 상태-행동 공간에 대한 확장 가능성을 보였다.
  • 클라이언트 측 작업—특히 인코딩 및 암호화—가 전체 동형 연산 시간의 63%를 차지하여 주요 성능 저하 요소로 규명되었다.
  • 시뮬레이션을 통해 성공적인 펜던트 균형 유지가 달성되어 기밀성 유지가 가능한 클라우드 기반 제어 합성의 실현 가능성을 확인하였다.
  • 이 프레임워크는 기밀성이 중요한 분야에서 오프라인 또는 변화가 느린 제어 합성에 가장 적합하며, 실시간 제약 조건이 느슨한 환경에서 유리하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.