Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Parameter Optimization Using Genetic Algorithm in Deep Reinforcement Learning for Robotic Manipulation Tasks

Adarsh Sehgal, Nick Ward|arXiv (Cornell University)|2022. 04. 07.
Reinforcement Learning in Robotics인용 수 9
한 줄 요약

이 논문은 로봇 조작 작업에서 딥 디터미니스틱 정책 기반 강화학습(DDPG+HER)을 위한 유전 알고리즘(GA) 기반의 새로운 초파rameter 최적화 프레임워크를 제안한다. 학습률, 탐색 노이즈, 타겟 네트워크 갱신 비율과 같은 핵심 초파rameter들을 자동으로 조정함으로써, GA+DDPG+HER 방법은 학습 시간을 최대 57% 감소시키고, 여섯 개인 시뮬레이션된 작업과 한 개인 실제 로봇 작업에서 샘플 효율성을 크게 향상시킨다. 모든 비교에서 기준 방법보다 뛰어난 성능을 보였다.

ABSTRACT

Learning agents can make use of Reinforcement Learning (RL) to decide their actions by using a reward function. However, the learning process is greatly influenced by the elect of values of the hyperparameters used in the learning algorithm. This work proposed a Deep Deterministic Policy Gradient (DDPG) and Hindsight Experience Replay (HER) based method, which makes use of the Genetic Algorithm (GA) to fine-tune the hyperparameters' values. This method (GA+DDPG+HER) experimented on six robotic manipulation tasks: FetchReach; FetchSlide; FetchPush; FetchPickAndPlace; DoorOpening; and AuboReach. Analysis of these results demonstrated a significant increase in performance and a decrease in learning time. Also, we compare and provide evidence that GA+DDPG+HER is better than the existing methods.

연구 동기 및 목표

  • 로봇 조작 작업에서 딥 강화학습(DRL)의 초파라미터 민감성 문제를 해결하기 위해, 설정이 최적화되지 않으면 학습 속도가 크게 저하됨을 고려한다.
  • 수동적 또는 히ュ리스틱한 조정에 의존하는 것을 줄이기 위해 자동화되고 재사용 가능한 초파라미터 튜닝 방법을 개발한다.
  • 유전 알고리즘(GA)이 다양한 로봇 작업에서 DDPG+HER의 초파라미터를 최적화하는 데 효과적인지 평가한다.
  • 기존 방법과의 비교를 통해 GA+DDPG+HER가 시뮬레이션 및 실제 환경 모두에서 일관된 성능 향상을 보임을 입증한다.
  • 오픈소스 코드를 제공하고, 표준 OpenAI Gym 환경과 자체 제작한 Aubo-i5 로봇 조작 작업 환경에서 방법을 검증한다.

제안 방법

  • 초파라미터 공간을 탐색하기 위해 유전 알고리즘(GA)을 사용하며, 각 해답을 이진 인코딩된 초파라미터로 구성된 염색체로 표현한다.
  • GA는 부모 선택에 순위 기반 선택을 사용하고, 후손 생성에 균일한 교배를 적용하며, 다양성을 유지하기 위해 플립 돌연변이를 사용한다.
  • 각 염색체의 적합도는 DDPG+HER 에이전트를 작업에서 훈련시켜 85% 성공률에 도달하는 데 필요한 에포크 수를 측정함으로써 평가된다.
  • 알고리즘은 세대에 걸쳐 인구 집단을 반복적으로 진화시키며, 학습 시간을 최소화하는 초파라미터 조합을 선호한다.
  • 최적화된 초파라미터로 할 수 있는 항목은 할인 인자(γ), 폴락-평균 계수(τ), 액터 및 크리틱 학습률, 탐색 비율(ϵ), 행동 노이즈 표준편차(η)이다.
  • 이 방법은 여섯 개인 시뮬레이션 환경(FetchReach, FetchSlide 등)과 한 개인 실제 로봇인 Aubo-i5 로봇 환경에서 테스트되었으며, 열 번의 훈련 런 동안 성능을 측정하였다.

실험 결과

연구 질문

  • RQ1유전 알고리즘이 로봇 조작 작업에서 DDPG+HER의 초파라미터를 효과적으로 최적화하여 학습 속도를 향상시킬 수 있는가?
  • RQ2GA+DDPG+HER는 기본 초파라미터 설정과 다른 최적화 방법과 비교해 학습 속도와 성능 측면에서 어떻게 다른가?
  • RQ3자동 초파라미터 튜닝이 목표 성공률에 도달하기 위해 필요한 훈련 에포크 수를 얼마나 줄일 수 있는가?
  • RQ4최적화된 초파라미터 세트는 시뮬레이션 및 실제 환경을 포함한 다양한 로봇 조작 작업에 일반화되는가?
  • RQ5GA 기반 튜닝 과정은 향후 DRL 훈련 세션에서 재사용 가능하고 계산적으로 효율적인가?

주요 결과

  • GA+DDPG+HER 방법은 기본 초파라미터 대비 85% 성공률에 도달하기 위한 훈련 에포크 수를 최대 57% 감소시켰다.
  • 이 방법은 FetchReach-v1 환경에서 네 가지 다른 접근법보다 일관되게 뛰어난 성능을 보였으며, 샘플 효율성과 더 빠른 수렴을 입증했다.
  • 에이전트의 성공률은 초파라미터 값, 특히 폴락-평균 계수 τ에 매우 민감했으며, 다양한 설정에서 비선형적인 성능 변화가 관찰되었다.
  • 최적화된 초파라미터를 사용한 후속 경험 재편성(HER)은 희박한 보상 환경에서도 효과적인 학습을 가능하게 하여, 보상 함수 설계에 비해 뛰어난 성능을 보였다.
  • GA로 최적화된 초파라미터는 여섯 개인 시뮬레이션된 로봇 작업과 한 개인 실제 로봇 조작 작업(Aubo-i5 로봇) 모두에서 이식 가능하고 효과적이었다.
  • 이 방법은 안정성과 강건성을 보였으며, GA 최적화된 초파라미터를 사용한 열 번의 독립적인 훈련 런 모두에서 일관된 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.