Skip to main content
QUICK REVIEW

[논문 리뷰] Robot Representation and Reasoning with Knowledge from Reinforcement Learning

Keting Lu, Shiqi Zhang|arXiv (Cornell University)|2018. 09. 28.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 모델기반 강화학습과 논리적-확률적 지식 표현을 통합하는 새로운 KRR-RL 프레임워크를 제안한다. 이는 인간이 제공한 기술적 지식과 RL이 학습한 전이 확률을 통합하여 로봇이 환경에 맞는 작업 특화 계획 모델을 런타임에 동적으로 구성할 수 있도록 한다. 이 방법은 새로운 환경 조건 하에서 탐색 및 배달 작업의 성공률을 크게 향상시키며, 기준 방법 대비 83.8%의 성공률을 달성하였다.

ABSTRACT

Reinforcement learning (RL) agents aim at learning by interacting with an environment, and are not designed for representing or reasoning with declarative knowledge. Knowledge representation and reasoning (KRR) paradigms are strong in declarative KRR tasks, but are ill-equipped to learn from such experiences. In this work, we integrate logical-probabilistic KRR with model-based RL, enabling agents to simultaneously reason with declarative knowledge and learn from interaction experiences. The knowledge from humans and RL is unified and used for dynamically computing task-specific planning models under potentially new environments. Experiments were conducted using a mobile robot working on dialog, navigation, and delivery tasks. Results show significant improvements, in comparison to existing model-based RL methods.

연구 동기 및 목표

  • 강화학습 에이전트가 인간 전문가로부터 제공된 기술적 지식을 효과적으로 활용하는 데에 한계가 있음을 해결한다.
  • 기존 KRR 시스템이 실제 상호작용 경험에서 학습할 수 없는 한계를 극복한다.
  • 로봇이 인간 지식과 RL로 학습한 세계 동역학을 동시에 활용하여 런타임에 효율적이고 작업 특화된 계획 모델을 동적으로 구성할 수 있도록 한다.
  • 다양한 설정에서의 지식 융합을 통해 새로운 또는 미리 보지 못한 환경 조건에서도 견고한 추론을 지원한다.
  • 이 프레임워크의 효과성을 이동형 로봇의 실제 작업, 즉 탐색, 대화, 배달 작업에서 입증한다.

제안 방법

  • P-log라는 논리적-확률적 KRR 언어를 사용하여 인간이 제공한 규칙와 RL로 학습한 전이 확률을 모두 표현하고 추론한다.
  • 모델기반 강화학습을 활용해 상호작용 경험에서 확률적 전이 모델을 학습한다.
  • 학습된 전이 확률을 KRR 모듈에 통합하여 런타임에 부분적인 세계 모델을 동적으로 생성한다.
  • 인간 지식과 RL로 학습한 동역학을 조합하여 작업 특화 계획 모델을 구성함으로써 효율적인 정책 계산을 가능하게 한다.
  • 인간-로봇 상호작용 중에 다차원(예: 물품, 사람, 위치 등)의 믿음 상태를 유지하고 업데이트함으로써 불확실성 하에서의 추론을 지원한다.
  • 다양한 학습된 환경 설정(예: 오전 vs. 정오)에서의 지식을 융합하여 통합된 전이 시스템을 구성함으로써 새로운 환경 설정으로의 일반화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1논리적-확률적 KRR는 모델기반 RL과 효과적으로 통합될 수 있는가? 이를 통해 로봇은 인간 지식과 학습된 동역학을 모두 활용해 추론할 수 있는가?
  • RQ2통합된 지식 기반(인간 지식과 RL 유래 지식)을 활용해 로봇이 런타임에 작업 특화 계획 모델을 어떻게 동적으로 생성할 수 있는가?
  • RQ3이 프레임워크는 새로운 또는 이전에 경험하지 못한 환경 조건(예: 알 수 없는 시간대)으로의 일반화에 얼마나 효과적인가?
  • RQ4KRR와 모델기반 RL의 통합은 탐색 및 인간 상호작용을 포함한 실제 로봇 작업에서 성능 향상에 기여하는가?
  • RQ5이전 지식과 확률적 추론을 활용함으로써 반복적인 확인과 같은 부득이하거나 위험한 행동을 줄일 수 있는가?

주요 결과

  • KRR-RL 프레임워크는 모델기반 RL을 통해 학습한 확률적 세계 동역학을 기술적, 논리적-확률적 형태로 표현하고 추론할 수 있도록 한다.
  • 인간 지식과 RL로 학습한 동역학의 통합은 런타임에 효율적이고 작업 특화된 계획 모델을 동적으로 구성할 수 있도록 한다.
  • 새로운 환경 일반화 작업에서 KRR-RL 에이전트는 탐색 작업에서 83.8%의 성공률을 달성하였으며, 이는 기준 에이전트의 26.8% 성공률에 비해 뚜렷이 높은 성능을 보였다.
  • 로봇은 기존 지식을 활용하여 불필요한 상호작용을 줄였다. 예를 들어, 학습된 동역학과 맥락에 기반해 배달 위치가 매우 높은 확률로 정해져 있을 경우, 다시 확인하지 않았다.
  • 인간-로봇 대화 중에 물품, 사람, 방 등 다차원 민감도의 믿음 상태가 정확하게 업데이트되었으며, 이는 불확실성 하에서도 견고한 추론 능력을 보여주었다.
  • 다양한 학습된 환경 설정에서의 지식 융합을 통해 로봇이 환경 조건(예: 시간대)을 확신하지 못하더라도 효과적인 정책 생성이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.