Skip to main content
QUICK REVIEW

[논문 리뷰] Discrete and Continuous Action Representation for Practical RL in Video Games

Olivier Delalleau, Maxim Peter|arXiv (Cornell University)|2019. 12. 23.
Human Pose and Action Recognition참고 문헌 26인용 수 39
한 줄 요약

논문은 Discrete, Continuous, 및 혼합(discrete-continuous) 행동을 처리할 수 있는 Soft Actor-Critic의 확장인 Hybrid SAC를 도입하고, 매개변수화된 행동 벤치마크와 상용 비디오 게임에서의 성능을 평가하며, SAC와 함께 정규화 흐름(normalizing flows)을 연구합니다.

ABSTRACT

While most current research in Reinforcement Learning (RL) focuses on improving the performance of the algorithms in controlled environments, the use of RL under constraints like those met in the video game industry is rarely studied. Operating under such constraints, we propose Hybrid SAC, an extension of the Soft Actor-Critic algorithm able to handle discrete, continuous and parameterized actions in a principled way. We show that Hybrid SAC can successfully solve a highspeed driving task in one of our games, and is competitive with the state-of-the-art on parameterized actions benchmark tasks. We also explore the impact of using normalizing flows to enrich the expressiveness of the policy at minimal computational cost, and identify a potential undesired effect of SAC when used with normalizing flows, that may be addressed by optimizing a different objective.

연구 동기 및 목표

  • 산업 환경에서 데이터 및 런타임 제약이 일반적인 비디오 게임 개발에 reinforcement learning의 활용을 촉진한다.
  • SAC 내에서 이산적, 연속적, 그리고 혼합 행동을 처리하는 실용적인 오프폴리시 알고리즘(Hybrid SAC)을 개발한다.
  • 현실적인 작업에서 정책 표현력과 학습에 대한 SAC 목표 하의 정규화 흐름의 영향을 평가한다.
  • 매개변수화된 행동 벤치마크에서 Hybrid SAC를 최첨단 방법과 비교한다.
  • industry의 관련성을 보여주기 위해 Ubisoft의 실제 게임 시나리오에 적용 가능성을 시연한다.]
  • method':['mixture( pi(a|s) 를 pi(a^d|s) 와 pi(a^c|s,a^d) 로 분해하는 일반적인 행동 표현을 제안하여 혼합 행동 유형을 수용한다.', 'SAC를 Hybrid SAC로 확장하여 이산 행동 분포와 이산 선택에 따른 연속 행동을 모두 학습하고, 크리틱이 이산 행동에 대한 Q-값을 예측하도록 한다.', '이산 부분의 탐험과 연속 부분의 탐험 사이의 균형을 맞추기 위해 alpha^d H(pi(a^d|s)) + alpha^c sum_{a^d} pi(a^d|s) H(pi(a^c|s,a^d)) 를 사용하는 가중 엔트로피 보너스를 적용한다.', '배우가 별개의 이산 분포와 연속 매개변수를 출력하거나 여러 구성 요소에 대해 공유 표현을 출력하는 네트워크 아키텍처를 제공한다.', '정책 매개변수화의 여러 실용적 구성을 탐구하고, 학습 단순화를 위해 이산 행동당 연속 구성 요소를 중복하는 것이 언제 유리한지 논의한다.', '가우시안 정책 위에 정규화 흐름을 적용해 표현력을 풍부하게 하되, SAC 목표 하에서 흐름의 KL 외의 대안적 목표가 필요함을 지적한다.'],
  • research_questions':['Hybrid SAC가 실무용 비디오 게임 작업에서 혼합 이산 및 연속 행동으로 정책을 효과적으로 학습할 수 있는가?','제안된 행동 분해가 순수 이산 또는 순수 연속 기준선과 비교해 데이터 효율성 및 학습 성능에 어떤 영향을 미치는가?','정규화 흐름이 практи SAC 성능을 개선하는가 아니면 저하시키는가? 어떤 목표 형식 하에서 그런가?','산업 유사 제약과 매개변수화된 행동 공간에 확장되기 위한 가장 적합한 아키텍처 및 매개변수화 선택은 무엇인가?','Hybrid SAC가 MP-DQN과 같은 최첨단 방법과 비교해 매개변수화된 행동 벤치마크에서 어떤 성과를 내는가?'],
  • key_findings':['Hybrid SAC가 매개변수화된 행동 벤치마크에서 경쟁력 있는 성능을 달성하며 Platform에서 MP-DQN과 일치하고 Goal에서 MP-DQN에 근접하며 HFO에서 다소 차이가 있다.','상용 게임에서 Hybrid SAC는 이산 핸드 브레이크와 연속 가속/조향을 복합한 고속 주행을 성공적으로 시연했다.','SAC에 정규화 흐름을 적용했을 때 Roboschool 벤치마크에서 가우시안 정책보다 일관되게 우수한 성능을 보이지 않으며, 흐름에 대해 KL 밖의 대안적 목표가 필요함을 시사한다.','이산 확률이 작아질 때 엔트로피 보너스가 연속 매개 변수의 붕괴를 초래할 수 있는 잠재적 문제를 확인했고, MP-DQN 결과와 일치하도록 이를 해결하기 위한 예비 시도가 이루어졌다.','정책 표현의 선택이 학습에 큰 영향을 미치며, 이산 행동당 연속 매개변수를 중복해 주는 것이 이산 집합이 관리 가능한 경우 학습에 도움이 될 수 있다.'],
  • table_headers':['Method', 'Platform (Return)', 'Goal (P(Goal))', 'HFO (P(Goal))'],
  • table_rows':[[
  • MP-DQN
  • 0.987 ± 0.039
  • 0.789 ± 0.070
  • 0.913 ± 0.070

제안 방법

  • MP-DQN (no MC)
  • -
  • -
  • 0.509 ± 0.110

실험 결과

연구 질문

  • RQ1Hybrid SAC
  • RQ20.981 ± 0.013
  • RQ30.728 ± 0.047
  • RQ40.639 ± 0.141

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.