Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Objective Deep Q-Learning with Subsumption Architecture

Tomasz Tajmajer|arXiv (Cornell University)|2017. 04. 21.
Visual Attention and Saliency Detection인용 수 7
한 줄 요약

이 논문은 브룩스의 서브서머션 아키텍처에서 영감을 얻은 신호 억압을 통한 조율 방식을 사용하여 개별 목표를 위한 별도의 딥 Q 네트워크(DQN)를 사용하는 다목적 강화학습 프레임워크를 제안한다. 이 방법은 모듈식이고 교체 가능한 행동 모듈을 가능하게 하며, 이를 통해 단일 행동을 공동으로 생성함으로써 단일 DQN에 비해 성능이 유사한 결과를 달성하면서도, 별도의 학습과 동적 목표 우선순위 설정을 지원한다. 이는 2차원 시각 환경에서 이루어진다.

ABSTRACT

In this work we present a method for using Deep Q-Networks (DQNs) in multi-objective tasks. Deep Q-Networks provide remarkable performance in single objective tasks learning from high-level visual perception. However, in many scenarios (e.g in robotics), the agent needs to pursue multiple objectives simultaneously. We propose an architecture in which separate DQNs are used to control the agent's behaviour with respect to particular objectives. In this architecture we use signal suppression, known from the (Brooks) subsumption architecture, to combine outputs of several DQNs into a single action. Our architecture enables the decomposition of the agent's behaviour into controllable and replaceable sub-behaviours learned by distinct modules. To evaluate our solution we used a game-like simulator in which an agent - provided with high-level visual input - pursues multiple objectives in a 2D world. Our solution provides benefits of modularity, while its performance is comparable to the monolithic approach.

연구 동기 및 목표

  • 복잡하고 시각적으로 rich한 환경에서 동시에 여러 목표를 추구하는 에이전트를 훈련시키는 과제를 해결하기 위해.
  • 다목적 작업을 독립적이고 학습 가능한 DQN 모듈로 분해함으로써 모듈식 행동 설계를 가능하게 하기 위해.
  • 통합된 DQN 접근 방식과 비교해 높은 성능를 유지하면서도 유지보수성과 적응성을 향상시키기 위해.
  • 서브서머션 아키텍처에서 유래한 신호 억압을 통합하여 동시에 작동하는 목표 간의 충돌을 해결하기 위해.

제안 방법

  • 아키텍처는 각각 특정 목표를 최적화하도록 훈련되는 별도의 독립적 DQN을 사용한다.
  • 각 DQN은 고수준의 시각 입력을 처리하고 해당 목표에 맞는 행동 벡터를 출력한다.
  • 더 높은 우선순위의 DQN 출력을 우선시하기 위해 신호 억압이 적용된다. 이는 낮은 우선순위의 행동을 효과적으로 제거한다.
  • 최종 행동은 우선순위 기반 병합 메커니즘을 통해 선택되며, 높은 우선순위의 행동이 활성화되어 있을 경우 낮은 우선순위의 행동이 억압된다.
  • 개별 DQN 모듈의 활성화 또는 비활성화를 통해 목표의 동적 재구성 기능을 지원한다.
  • 이 접근 방식은 연속적인 시각 관측과 동시에 여러 목표를 가진 2D 게임 유사 시뮬레이터에서 평가된다.

실험 결과

연구 질문

  • RQ1신호 억압을 통한 모듈식 DQN 아키텍처가 시각적 강화학습 환경에서 여러 목표를 효과적으로 관리할 수 있는가?
  • RQ2제안된 다목적 DQN의 성능가 장기적인 DQN과 같은 환경에서 비교해 볼 때 어떻게 되는가?
  • RQ3개별 행동 모듈가 전체 에이전트 성능에 영향을 주지 않고 교체하거나 재구성할 수 있는 정도는 어느 정도인가?
  • RQ4서브서머션 아키텍처에서 유래한 신호 억압이 여러 DQN에서 유도된 충돌하는 행동들을 얼마나 잘 조율하는가?
  • RQ5모듈성은 학습 효율성을 희생시키지 않으면서도 다목적 정책의 해석 가능성과 유지보수성을 향상시키는가?

주요 결과

  • 제안된 아키텍처는 다목적 2D 시뮬레이터에서 단일 DQN과 유사한 성능을 달성한다.
  • 모듈식 행동 설계는 전체 시스템을 다시 훈련하지 않고도 개별 목표의 독립적 훈련과 교체를 가능하게 한다.
  • 신호 억압은 높은 수준의 목표를 우선시함으로써 행동 충돌을 효과적으로 해결하며, 계층적 제어를 모방한다.
  • 모듈의 활성화를 동적으로 제어함으로써 목표 우선순위의 변화에 대해 뛰어난 내성적 특성을 보인다.
  • 개별 DQN으로 분해함으로써 학습된 행동의 해석 가능성을 향상시키면서도 경쟁적인 학습 효율성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.