Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Reinforcement Learning with Natural Language Constraints

Tsung-Yen Yang, Michael Y. Hu|arXiv (Cornell University)|2020. 10. 11.
Reinforcement Learning in Robotics참고 문헌 63인용 수 7
한 줄 요약

이 논문은 자연어 제약 조건을 이해하여 훈련 중 안전성을 향상시키는 모듈러한 강화학습 에이전트인 POLCO를 제안한다. 제약 조건 해석과 정책 학습을 분리함으로써 POLCO는 새로운 HazardWorld 벤치마크에서 기존 기준 대비 최대 11배 높은 보상과 1.8배 적은 제약 위반을 달성하며, 새로운 작업에 대해 미리 보지 않은 제약 조건을 효과적으로 전이함을 보여준다.

ABSTRACT

While safe reinforcement learning (RL) holds great promise for many practical applications like robotics or autonomous cars, current approaches require specifying constraints in mathematical form. Such specifications demand domain expertise, limiting the adoption of safe RL. In this paper, we propose learning to interpret natural language constraints for safe RL. To this end, we first introduce HazardWorld, a new multi-task benchmark that requires an agent to optimize reward while not violating constraints specified in free-form text. We then develop an agent with a modular architecture that can interpret and adhere to such textual constraints while learning new tasks. Our model consists of (1) a constraint interpreter that encodes textual constraints into spatial and temporal representations of forbidden states, and (2) a policy network that uses these representations to produce a policy achieving minimal constraint violations during training. Across different domains in HazardWorld, we show that our method achieves higher rewards (up to11x) and fewer constraint violations (by 1.8x) compared to existing approaches. However, in terms of absolute performance, HazardWorld still poses significant challenges for agents to learn efficiently, motivating the need for future work.

연구 동기 및 목표

  • 수학적 형태로 안전 제약 조건을 명시하는 데 어려움이 있으며, 이는 도메인 전문 지식이 필요하고 안전한 RL의 실세계 적용을 제한한다.
  • 형식적인 논리나 수식이 아닌 자유형 자연어로 표현된 안전 제약 조건을 학습하고 전이할 수 있도록 에이전트를 가능하게 한다.
  • 제약 조건 이해와 보상 최적화를 분리하는 모듈러 아키텍처를 개발하여 다양한 작업 간에 재사용할 수 있도록 한다.
  • 그리드 월드와 로봇 환경에서 자연어 제약 조건을 갖춘 안전한 RL 평가를 위한 벤치마크인 HazardWorld를 구축한다.
  • 다른 보상 함수를 가진 새로운 작업에 대해 제약 조건 이해를 일반화할 수 있으며, 위반 수를 최소화할 수 있음을 입증한다.

제안 방법

  • 자연어 제약 조건을 포함한 그리드 월드와 로봇 환경을 갖춘 다중 작업 벤치마크인 HazardWorld를 도입한다.
  • 자연어 제약 조건을 공간적 및 시간적 금지 상태 표현으로 인코딩하는 제약 조건 해석기로 구성된 모듈러 에이전트 아키텍처를 설계한다.
  • 상태 관측치와 제약 조건 표현을 조합하여 제약 위반을 최소화하는 행동을 생성하는 정책 네트워크를 사용한다.
  • 제약 조건 이해와 일반화를 향상시키기 위해 마스크된 표현 학습 기법(M_B)과 제약 조건 임베딩(h_C)을 활용한다.
  • 안전 훈련 중 인간이 애너테이션한 제약 조건-상태 매핑을 이용한 지도 신호를 사용해 제약 조건 해석기를 엔드 투 엔드로 훈련시킨다.
  • 사전 훈련된 제약 조건 해석기를 재사용하고, 미세조정된 정책 네트워크를 사용해 새로운 작업으로의 제로샷 전이를 가능하게 한다.

실험 결과

연구 질문

  • RQ1강화학습 에이전트는 수학적 명시 없이도 훈련 중 자유형 자연어 제약 조건을 이해하고 준수할 수 있는가?
  • RQ2다른 보상 함수를 가진 새로운 작업으로 제약 조건 이해를 전이할 때, 모듈러 에이전트 아키텍처는 얼마나 낮은 제약 위반을 유지할 수 있는가?
  • RQ3정책 학습에서 제약 조건 표현을 분리함으로써 안전한 강화학습의 일반화와 성능 향상에 얼마나 기여하는가?
  • RQ4기존의 안전한 RL 기준 대비 복잡한 다중 제약 조건(예: 관계적 및 순차적)에 대해 모델의 성능은 어떠한가?
  • RQ5제안된 아키텍처의 어떤 구성 요소(M_B, h_C 등)가 제약 조건 준수와 성능에 가장 중요한가?

주요 결과

  • POLCO는 HazardWorld-grid에서 기준 방법 대비 최대 11배 높은 누적 보상을 달성하여, 안전 제약 조건 하에서 뛰어난 학습 효율성을 보였다.
  • POLCO는 기준 대비 제약 위반을 최대 1.8배 감소시켜 자연어 기반 안전 규칙 준수 능력이 뛰어나다는 것을 입증했다.
  • 제거 실험 결과, 제약 조건 임베딩(h_C) 또는 마스크(M_B)를 제거할 경우 제약 위반 수가 66.67% 증가하여 정확한 제약 조건 이해에 이들이 필수적임을 입증했다.
  • 예산, 관계, 순차적 제약 조건 등 다양한 유형의 제약 조건에서 높은 성능를 유지하며, 복잡한 텍스트 기반 제약 조건에 대한 강건한 일반화 능력을 보였다.
  • 특히 순차적 및 관계적 제약 조건에서 다른 방법들이 안전성과 성능의 균형을 이루지 못하는 상황에서도 POLCO는 보상과 제약 준수 양면에서 모든 기준을 압도했다.
  • 훈련 시 사용한 보상 함수와 동일한 조건에서도 평가 시 새로운 제약 조건에 대해 더 나은 일반화 성능를 보였으며, 이는 모듈러 설계의 효과성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.