Skip to main content
QUICK REVIEW

[논문 리뷰] Environment Generation for Zero-Shot Compositional Reinforcement Learning

İzzeddin Gür, Natasha Jaques|arXiv (Cornell University)|2022. 01. 21.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 강화학습(Reinforcement Learning, RL) 에이전트의 능력 수준에 맞춰 점차 복잡도가 높아지는 조합적 작업 커리큘럼을 자동으로 생성하는 Compositional Design of Environments (CoDE) 를 제안한다. 다목적 보상 함수를 활용하여 유감 기반 안정화와 작업 난이도 조정을 실현함으로써, CoDE 는 기존 기준보다 4배 높은 성공률를 달성하며, 예측 불가능한 실세계 웹 탐색 작업으로의 제로샷 일반화를 가능하게 한다.

ABSTRACT

Many real-world problems are compositional - solving them requires completing interdependent sub-tasks, either in series or in parallel, that can be represented as a dependency graph. Deep reinforcement learning (RL) agents often struggle to learn such complex tasks due to the long time horizons and sparse rewards. To address this problem, we present Compositional Design of Environments (CoDE), which trains a Generator agent to automatically build a series of compositional tasks tailored to the RL agent's current skill level. This automatic curriculum not only enables the agent to learn more complex tasks than it could have otherwise, but also selects tasks where the agent's performance is weak, enhancing its robustness and ability to generalize zero-shot to unseen tasks at test-time. We analyze why current environment generation techniques are insufficient for the problem of generating compositional tasks, and propose a new algorithm that addresses these issues. Our results assess learning and generalization across multiple compositional tasks, including the real-world problem of learning to navigate and interact with web pages. We learn to generate environments composed of multiple pages or rooms, and train RL agents capable of completing wide-range of complex tasks in those environments. We contribute two new benchmark frameworks for generating compositional tasks, compositional MiniGrid and gMiniWoB for web navigation.CoDE yields 4x higher success rate than the strongest baseline, and demonstrates strong performance of real websites learned on 3500 primitive tasks.

연구 동기 및 목표

  • 웹 탐색 및 양식 채우기와 같은 복잡하고 조합적인 실세계 작업 간 일반화를 가능하게 하기 위한 도전 과제를 해결하기 위해.
  • 기존의 커리큘럼 학습과 도메인 랜덤라이제이션의 한계를 극복하기 위해, 작업 난이도가 에이전트의 숙련도와 일치하지 않는 조합적 작업 설정 환경에서의 문제를 해결하기 위해.
  • 계층적이고 의존성 기반의 작업 구조를 지원하는 도메인에 종속되지 않은 확장 가능한 환경 생성 프레임워크를 개발하기 위해.
  • 성능 약점에 맞춰 커리큘럼을 통해 훈련함으로써, 새로운 작업에 대해 제로샷 일반화를 가능하게 하기 위해.
  • 조합적 작업 학습 평가를 위한 두 가지 오픈소스 벤치마크—compositional MiniGrid 와 gMiniWoB —을 도입하기 위해.

제안 방법

  • 에이전트 집단 간의 유감을 최대화하는 다목적 보상 함수를 사용하여, 학습 안정화와 국소 최적값 회피를 위한 생성 에이전트를 훈련시킨다.
  • 학습자들의 현재 성능에 따라 동적으로 난이도를 조절하는 난이도 유도 요소를 통합하여, 성공 시 난이도를 증가시키고 실패 시 낮춘다.
  • 조합적 작업를 종속성 그래프로 모델링하기 위해 페트리 네트(Petri Nets) 형식을 사용하여, 원소로부터 체계적이고 계층적인 작업 생성을 가능하게 한다.
  • 이동 바, 양식 필드, 제품 캐러셀과 같은 재사용 가능한 원소로부터 환경를 조립하는 도메인에 종속되지 않은 생성 아키텍처를 통해 확장성 있고 다양한 환경 생성을 가능하게 한다.
  • 점차 늘어나는 활성 및 수동 원소의 수를 통해 커리큘럼 학습을 지원하며, 시간이 지남에 따라 더 복잡하고 관련성이 높은 원소로 전환한다.
  • 실제 웹사이트 기반으로 약 ~10^31개의 가능한 환경 공간에서 훈련함으로써, 다양한 현실적인 작업 구조에 노출되도록 한다.

실험 결과

연구 질문

  • RQ1생성 에이전트가 에이전트의 능력 수준 변화에 맞춰 적응적인 조합적 작업 커리큘럼을 자동으로 구성할 수 있는가?
  • RQ2유감 추정과 난이도 조정을 통합한 다목적 보상 함수는 조합적 RL 환경에서 학습 안정성과 성능 향상에 어떻게 기여하는가?
  • RQ3CoDE 를 통해 훈련된 RL 에이전트는 새로운 실세계 웹 탐색 작업으로의 제로샷 일반화를 어느 정도 달성할 수 있는가?
  • RQ4페트리 네트로 모델링된 작업 구조(topology)는 체계적이고 일반화 가능한 작업 학습을 어떻게 가능하게 하는가?
  • RQ5제안된 벤치마크—compositional MiniGrid 와 gMiniWoB —는 기존 벤치마크와 비교해 복잡성과 현실성 측면에서 어떻게 다른가?

주요 결과

  • CoDE 는 다양한 조합적 작업에서 가장 강력한 기준보다 4배 높은 성공률를 기록하여 뚜렷한 성능 향상을 입증한다.
  • 환경의 복잡도가 증가함에 따라 CoDE 에이전트는 일관된 성능을 유지하지만, 커리큘럼 학습(CL)과 도메인 랜덤라이제이션(DR) 기준은 난이도가 일치하지 않아 성능이 저하된다.
  • 실세계 웹사이트에서 CoDE 는 로그인 작업에서 62%의 성공률, 쇼핑 작업에서 44%의 성공률를 기록하며, 지불 작업에서는 9%로 성능이 저하되는데, 이는 원소의 분포 편향 때문임을 반영한다.
  • 100배 더 큰 원소 집합을 사용하여 약 10^31개의 가능한 환경 공간으로 확장 가능함으로써, 현실적인 웹 탐색 훈련을 가능하게 한다.
  • 분포의 변화가 있음에도 불구하고 CoDE 에이전트는 MiniWoB 의 수동으로 설계된 원소로 일반화하여 주소 입력 작업에서 90%의 성공률, 단순 텍스트 입력 작업에서는 0%의 성공률를 기록하며 선택적 일반화를 보여준다.
  • 이 방법을 통해 단일 RL 에이전트가 여러 페이지와 복잡한 워크플로우를 포함한 다양한 작업—예를 들어, 양식 채우기 및 탐색—을 마스터하고, 새로운 웹사이트에 대해 제로샷 배포가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.