Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient, Safe, and Probably Approximately Complete Learning of Action Models

Roni Stern, Brendan Juba|arXiv (Cornell University)|2017. 05. 24.
Machine Learning and Algorithms인용 수 4
한 줄 요약

이 논문은 실행 실패가 허용되지 않는 환경에서, 오직 성공적인 트레이젝터리만을 사용하여 안전한 모델리스 계획을 위한 보수적인, 모델 기반 접근법을 제안한다. 행동은 사전 조건과 영향을 제한함으로써 학습된다. 실패 확률은 관측된 트레이젝터리 수에 따라 준선형적으로 감소함을 증명하였으며, 실행 실패 없이 타당하고 효율적이며, 거의 완전한 계획을 달성한다.

ABSTRACT

In this paper we explore the theoretical boundaries of planning in a setting where no model of the agent's actions is given. Instead of an action model, a set of successfully executed plans are given and the task is to generate a plan that is safe, i.e., guaranteed to achieve the goal without failing. To this end, we show how to learn a conservative model of the world in which actions are guaranteed to be applicable. This conservative model is then given to an off-the-shelf classical planner, resulting in a plan that is guaranteed to achieve the goal. However, this reduction from a model-free planning to a model-based planning is not complete: in some cases a plan will not be found even when such exists. We analyze the relation between the number of observed plans and the likelihood that our conservative approach will indeed fail to solve a solvable problem. Our analysis show that the number of trajectories needed scales gracefully.

연구 동기 및 목표

  • 실행 실패가 허용되지 않는 환경에서 사전 행동 모델이 없는 상황에서의 계획 문제를 해결한다.
  • 관측된 성공적인 트레이젝터리만을 사용하여 성공이 보장되는 계획을 생성하는 방법을 개발한다.
  • 실험 기반의 시도-오류 방식을 피하기 위해 보수적인 행동 모델을 학습함으로써 계획 과정의 효율성을 확보한다.
  • 관측된 트레이젝터리 수가 증가할수록 성공 가능성에 대한 이론적 보장을 제공한다.
  • 완전성을 포기함으로써 고비용 또는 제약 조건이 있는 실행 환경에서의 실용적 적용을 가능하게 하면서도, 타당성과 효율성을 유지한다.

제안 방법

  • 성공적인 트레이젝터리만을 관측하여 각 행동에 대한 가능한 사전 조건과 영향의 집합을 제한한다.
  • 모든 관측된 사전 조건과 영향을 포함하고 추가적인 가정을 하지 않는 보수적인 행동 모델을 구성한다.
  • 표준 계획 형식(예: SAS+)을 사용하여 학습된 보수적 모델을 고전적 계획 문제로 변환한다.
  • 학습된 보수적 모델에 대해 표준 고전 계획기(off-the-shelf classical planners)를 사용하여 실패 없이 보장되는 계획을 생성한다.
  • 관측된 트레이젝터리 수에 기반해 실패 가능성 분석을 위해 보통 약간의 정확도(PAC) 학습 프레임워크를 적용한다.
  • 약간의 가정 하에 관측된 트레이젝터리 수가 증가함에 따라 실패 확률이 준선형적으로 감소함을 증명한다.

실험 결과

연구 질문

  • RQ1실패 피드백 없이 오직 성공적인 트레이젝터리만을 사용하여 안전하고 보수적인 행동 모델을 학습할 수 있는가?
  • RQ2관측된 트레이젝터리 수가 유효한 계획을 성공적으로 찾는 확률에 어떤 영향을 미치는가?
  • RQ3완전성을 포기함으로써 효율성과 실행 실패를 피하면서도 타당한 계획을 달성할 수 있는가?
  • RQ4제안된 접근법의 성공 가능성에 대해 어떤 이론적 보장을 제공할 수 있는가?
  • RQ5양성 및 음성 예제를 모두 활용하는 기존의 모델 학습 방법과 비교해 볼 때 이 방법은 어떠한가?

주요 결과

  • 제안된 방법은 타당하다: 학습된 보수적 모델에서 생성된 계획은 원래의 모델리스 환경에서 반드시 성공한다.
  • 해당 방법은 효율적이다. 기존의 고전 계획기를 사용하여 컴iles된 보수적 행동 모델에 적용된다.
  • 계획을 찾지 못하는 것은 보수적 모델이 필요한 행동을 배제했을 경우에만 발생하며, 트레이젝터리 수가 증가함에 따라 그 가능성이 점점 줄어든다.
  • 도메인과 행동 구조에 대한 약간의 가정 하에, 관측된 트레이젝터리 수가 증가함에 따라 실패 확률이 준선형적으로 감소한다.
  • 기존의 방법이 실패 피드백이 필요하거나 계산적으로 비가역적인 반면, 본 방법은 모델리스 환경에서 사실상 완전성(PAC) 학습을 달성한다.
  • 정확한 모델이나 정책을 학습하는 데서 비가역성을 피하기 위해, 안전한 계획을 위한 충분한 모델만을 학습하는 데 집중함으로써 이를 회피한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.