Skip to main content
QUICK REVIEW

[논문 리뷰] How to Teach AI to Play Bell Non-Local Games: Reinforcement Learning

Kishor Bharti, Tobias Haug|arXiv (Cornell University)|2019. 12. 23.
Computability, Logic, AI Algorithms참고 문헌 1인용 수 10
한 줄 요약

이 논문은 비국소 게임에서 벨 부등식을 위반하기 위한 양자 전략을 최적화하기 위해 강화학습(RL) 프레임워크를 제안한다. 하이브리드 양자-고전적 변분 회로를 사용해 양자 상태와 측정 설정을 매개변수화하며, RL 에이전트는 벨 연산자의 기대값을 최대화하도록 학습한다. 이로 인해 전통적인 볼록 최적화가 실패하는 비볼록 상황에서도 근사 최대 수준의 양자 위반을 달성한다.

ABSTRACT

Motivated by the recent success of reinforcement learning in games such as Go and Dota2, we formulate Bell non-local games as a reinforcement learning problem. Such a formulation helps us to explore Bell non-locality in a range of scenarios. The measurement settings and the quantum states are selected by the learner randomly in the beginning. Still, eventually, it starts understanding the underlying patterns and discovers an optimal (or near-optimal) quantum configuration corresponding to the task at hand. We provide a proof of principle approach to learning quantum configurations for violating various Bell inequalities. The algorithm also works for non-convex optimization problems where convex methods fail, thus offering a possibility to explore optimal quantum configurations for Bell inequalities corresponding to large quantum networks. We also implement a hybrid quantum-classical variational algorithm with reinforcement learning.

연구 동기 및 목표

  • 비국소 게임에서 벨 부등식을 위반하는 데 최적의 양자 구성 요소를 발견하기 위한 강화학습 접근법을 개발하는 것.
  • 볼록 최적화 방법이 실패하는 양자 네트워크 환경에서의 비볼록 최적화 문제에 도전하는 것.
  • 매개변수화된 변분 회로를 통해 얽힌 양자 상태와 측정 설정을 동시에 최적화할 수 있도록 RL 에이전트를 가능하게 하는 것.
  • 특히 대규모 양자 네트워크에서 복잡한 양자 기초 문제에 대해 RL의 가능성을 탐색하는 것.
  • 사전 지식 없이도 근사 최적의 양자 전략을 찾는 데 있어 RL의 확장성과 강건성을 입증하는 것.

제안 방법

  • RL 에이전트는 벨 연산자의 기대값을 최대화하기 위해 프록시 정책 최적화(PPO)를 사용해 훈련된다. 이는 양자 상태 매개변수와 측정 설정을 선택하는 데 사용된다.
  • N- 큐비트 얽힌 상태를 매개변수화하기 위해, 조정 가능한 Y-로테이션과 고리 구조의 CNOT 게이트를 갖춘 하드웨어 효율적인 변분 양자 회로를 사용한다.
  • 에이전트는 제품 상태(|0⟩^⊗N)에서 시작하여 여러 훈련 에포크 동안 회로 매개변수를 조정함으로써 최적화 경로를 탐색한다.
  • 보상 신호는 희박하며, 각 훈련 에피소드의 끝에서 현재 설정에 대한 벨 연산자의 기대값으로 주어진다.
  • 탐색-이용 균형을 다루며, 에이전트가 높은 성능의 전략으로 수렴함에 따라 보상의 표준편차가 점차 감소한다.
  • 이 방법은 Tura 등(2014)에서 유도한 매개변수를 사용해 고전적 한계와 양자 위반 목표를 정의한 다중입자 벨 부등식에 적용된다.

실험 결과

연구 질문

  • RQ1강화학습은 비볼록 상황에서 벨 부등식을 위반하는 데 최적의 양자 전략을 발견할 수 있는가?
  • RQ2RL은 비국소 게임에서 양자 상태 준비와 측정 설정을 동시에 최적화하는 데 얼마나 효과적인가?
  • RQ3하이브리드 양자-고전적 RL 프레임워크는 다중입자 벨 시나리오에서 근사 최대 수준의 양자 위반을 달성할 수 있는가?
  • RQ4양자 벨 게임의 RL 기반 최적화에서 탐색-이용 균형은 어떻게 나타나는가?
  • RQ5복잡한 양자 네트워크 구성에서 RL은 볼록 최적화 방법을 얼마나 뛰어넘을 수 있는가?

주요 결과

  • RL 에이전트는 변분 양자 회로를 사용해 다중입자 벨 부등식의 고전적 한계를 성공적으로 위반한다.
  • 세 층의 변분 회로를 사용할 경우, 에이전트는 양자 최대 수준에 가까운 위반을 달성하여 회로 깊이에 따라 확장 가능성을 보여준다.
  • 두 층의 회로에서는 고전적 한계를 약간만 위반할 뿐이므로, 더 깊은 회로가 더 높은 비국소성을 지닌 더 얽힌 상태에 접근할 수 있음을 시사한다.
  • 훈련 과정에서 보상의 표준편차가 감소함에 따라 탐색이 줄어들고 안정된 고성능 정책으로 수렴하는 것으로 나타났다.
  • 이 방법은 비볼록 최적화 경로를 성공적으로 탐색했으며, 볼록 방법이 실패하는 상황에서 그들을 능가했다.
  • 이 방법은 강건하고 일반화 가능하며, 대규모 양자 네트워크와 NISQ 시대 장치에의 응용 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.