Skip to main content
QUICK REVIEW

[논문 리뷰] DREAM Architecture: a Developmental Approach to Open-Ended Learning in Robotics

Stéphane Doncieux, Nicolas Bredèche|arXiv (Cornell University)|2020. 05. 13.
Reinforcement Learning in Robotics인용 수 10
한 줄 요약

DREAM 아키텍처는 운영과 학습 외에 제3의 학습 사이클인 재기술회로를 도입함으로써 개발로봇 프레임워크를 제안한다. 이는 개방형, 과제에 종속되지 않은 학습을 위한 자율적 상태 표현 생성 및 적응을 가능하게 한다. 내재적 동기부여, 전이 학습, 수면 유사 오프라인 재생을 통합함으로써 DREAM은 연속적인 실세계 환경에서 안정적인 세계 모델 학습과 효율적인 정책 확보를 가능하게 하며, 결과적으로 내비게이션 과제에서 더 높은 내구성과 표현 적응성 향상을 보였다.

ABSTRACT

Robots are still limited to controlled conditions, that the robot designer knows with enough details to endow the robot with the appropriate models or behaviors. Learning algorithms add some flexibility with the ability to discover the appropriate behavior given either some demonstrations or a reward to guide its exploration with a reinforcement learning algorithm. Reinforcement learning algorithms rely on the definition of state and action spaces that define reachable behaviors. Their adaptation capability critically depends on the representations of these spaces: small and discrete spaces result in fast learning while large and continuous spaces are challenging and either require a long training period or prevent the robot from converging to an appropriate behavior. Beside the operational cycle of policy execution and the learning cycle, which works at a slower time scale to acquire new policies, we introduce the redescription cycle, a third cycle working at an even slower time scale to generate or adapt the required representations to the robot, its environment and the task. We introduce the challenges raised by this cycle and we present DREAM (Deferred Restructuring of Experience in Autonomous Machines), a developmental cognitive architecture to bootstrap this redescription process stage by stage, build new state representations with appropriate motivations, and transfer the acquired knowledge across domains or tasks or even across robots. We describe results obtained so far with this approach and end up with a discussion of the questions it raises in Neuroscience.

연구 동기 및 목표

  • 사전에 프로그래밍된 상태 또는 동작 표현 없이도 미지의 환경에서 뜻하지 않은 과제를 해결할 수 있도록 로봇을 지원하는 데 도전한다.
  • 기존 강화학습의 한계를 극복하기 위해 동적으로 상태 표현을 생성하거나 적응시키는 재기술회로를 도입함으로써 기존의 강화학습을 개선한다.
  • 공유 가능한, 학습 가능한 표현을 통해 과제 및 로봇 간 지식 전이를 가능하게 한다.
  • 인간의 인지 발달과 유사한 발달 과정을 모델링하며, 표현의 재기술과 오프라인 학습을 포함한다.
  • 로봇공학과 신경과학을 연결하여 수면 관련 재생과 해마 기능이 실세계 학습에 미치는 영향을 시험하는 가설을 검증한다.

제안 방법

  • 운영(정책 실행), 학습(정책 최적화), 재기술회로(표현 생성/적응)의 세 사이클 프레임워크를 도입하며, 시간 스케일이 점차 느려지는 순서로 작동한다.
  • 외부 보상이 없을 경우 탐색과 표현 발견을 유도하기 위해 내재적 동기부여 메커니즘을 활용한다.
  • 이전에 확보한 지식을 과제 및 환경 간 공유함으로써 샘플 복잡도를 감소시키기 위해 전이 학습을 사용한다.
  • 지난 경험을 무작위 순서로 반복 재생함으로써 연속적인 상태 공간에서의 학습 안정성을 높이며, 수면 중 해마 기능을 모방한다.
  • 반복적인 추상화를 통해 저수준의 감각운동 데이터를 고수준의 과제 관련 표현으로 변환하기 위해 표현의 재기술회로를 적용한다.
  • 개발 단계를 거쳐 점진적으로 인지 능력을 발전시킬 수 있도록 모듈형이고 종단 간 아키텍처를 통합한다.

실험 결과

연구 질문

  • RQ1환경이나 과제에 대한 사전 지식 없이도 로봇이 새로운 과제를 위해 자율적으로 상태 표현을 생성하거나 적응시킬 수 있는가?
  • RQ2시간적 상관관계로 인해 온라인 학습이 방해받는 연속적이고 고차원적인 상태 공간에서 세계 모델 학습이 어떻게 안정적으로 이루어질 수 있는가?
  • RQ3내재적 동기부여와 오프라인 재생 과정이 과제 및 로봇 간 재사용 가능하고 전이 가능한 지식을 어떻게 지원하는가?
  • RQ4로봇의 발달 과정이 인간과 유사한 표현의 재기술과 인지 발달을 어느 정도 모방할 수 있는가?
  • RQ5수면 유사 오프라인 과정이 실세계 로봇 시스템에서 강화학습의 안정성과 기반 형성에 어떤 역할을 하는가?

주요 결과

  • 경험을 랜덤 순서로 오프라인 재생함으로써 연속적인 상태 공간 내비게이션에서 세계 모델의 안정성과 일관성이 크게 향상되었으며, 온라인 학습에서 발생하는 시간적 상관관계 문제를 해결했다.
  • 재기술회로 덕분에 원시적인 감각운동 데이터가 고수준의 과제 관련 표현으로 변환되어 정책 학습 속도와 효율성이 향상되었다.
  • 내재적 동기부여 메커니즘이 정보가 많은 상태로의 탐색을 유도하여, 유용한 표현과 행동의 발견을 가속화했다.
  • 과제 간 전이 학습을 통해 실제 환경에서 필요한 샘플 수가 감소하여 학습된 표현의 재사용 가능성을 입증했다.
  • 수면 유사 재생 과정이 가치 함수 학습과 세계 모델 확보를 지원함으로써 영장류의 해마 기능에 제안된 기능을 모방하는 것으로 나타났다.
  • 이 아키텍처는 실세계 로봇 과제에서 뛰어난 성능을 보였으며, 적응성과 샘플 효율성 측면에서 순수 종단 간 또는 시뮬레이션 전용 접근 방식보다 뛰어났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.