Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Generalized Policies Without Supervision Using GNNs

Simon Ståhlberg, Blai Bonet|arXiv (Cornell University)|2022. 05. 12.
Topic Modeling인용 수 9
한 줄 요약

이 논문은 최적의 가치 함수나 레이블이 부여된 예시가 필요 없이 고전적 계획 도메인에서 일반화된 계획 정책을 학습하기 위해 자기지도 그래프 신경망(GNN) 기반 접근법을 제안한다. 전이 폐쇄와 역할 조합과 같은 유도 원소로 상태를 확장함으로써, 표준 가치 기반 강화학습이 NP-난해한 계획 설정에서 겪는 한계를 극복하고, Logistics 및 Spanner*와 같은 도메인에서 더 큰 테스트 인스턴스에 대해 거의 완벽한 일반화(최대 100%)를 달성한다. 이는 GNN의 층 수가 매우 적어도 가능하다.

ABSTRACT

We consider the problem of learning generalized policies for classical planning domains using graph neural networks from small instances represented in lifted STRIPS. The problem has been considered before but the proposed neural architectures are complex and the results are often mixed. In this work, we use a simple and general GNN architecture and aim at obtaining crisp experimental results and a deeper understanding: either the policy greedy in the learned value function achieves close to 100% generalization over instances larger than those used in training, or the failure must be understood, and possibly fixed, logically. For this, we exploit the relation established between the expressive power of GNNs and the $C_{2}$ fragment of first-order logic (namely, FOL with 2 variables and counting quantifiers). We find for example that domains with general policies that require more expressive features can be solved with GNNs once the states are extended with suitable "derived atoms" encoding role compositions and transitive closures that do not fit into $C_{2}$. The work follows the GNN approach for learning optimal general policies in a supervised fashion (Stahlberg, Bonet, Geffner, 2022); but the learned policies are no longer required to be optimal (which expands the scope, as many planning domains do not have general optimal policies) and are learned without supervision. Interestingly, value-based reinforcement learning methods that aim to produce optimal policies, do not always yield policies that generalize, as the goals of optimality and generality are in conflict in domains where optimal planning is NP-hard.

연구 동기 및 목표

  • 최적의 가치 함수나 감독된 가치 함수가 필요 없이 고전적 계획 도메인에서 일반화 정책을 학습하는 자기지도 GNN 기반 방법을 개발하는 것.
  • 최적 계획이 NP-난해한 도메인에서 표준 가치 기반 강화학습의 일반화 성능 격차를 해결하는 것.
  • GNN의 표현력이 C2 논리에 국한된 점을 감안할 때, 더 복잡한 계획 특징을 포착하기 위해 어떻게 확장할 수 있는지 탐구하는 것.
  • 유도 원소(예: 전이 폐쇄, 역할 조합)의 사용이 GNN의 표현력과 일부 계획 도메인에서 요구되는 비-C2 특징 간 격차를 메우는 데 얼마나 효과적인지 탐색하는 것.
  • 최적의 정책이 존재하지 않더라도, 비최적의 자기지도 GNN 정책이 감독 또는 표준 RL 접근법보다 더 큰 인스턴스에 효과적으로 일반화되는지 입증하는 것.

제안 방법

  • 작은 훈련 인스턴스에서 업그레이드된 STRIPS 형식을 사용해 일반적인 GNN 아키텍처를 활용해 가치 함수 V(s)를 학습한다.
  • 표준 가치 기반 RL에서 사용하는 L0 손실 대신 새로운 L1 손실 함수를 사용함으로써, 최적의 진실 가치가 없더라도 자기지도 학습이 가능하도록 한다.
  • C2 논리의 표현력을 초월하는 특징을 인코딩하기 위해 전이 폐쇄 및 역할 조합과 같은 유도 원소로 상태 표현을 확장한다.
  • 학습된 가치 함수에서 유도된 탐욕 정책을 훈련 인스턴스보다 더 큰 테스트 인스턴스에 적용하여 일반화 성능을 평가한다.
  • 과적합을 완화하고 일반화 성능을 향상시키기 위해 GNN의 깊이를 줄인다(예: 30층에서 2층으로). 특히 유도 원소를 사용할 경우에 효과적이다.
  • 다양한 도메인(예: Logistics, Spanner*, Gridworld)에서 검증하여, 새로운 더 큰 인스턴스에 대한 커버리지 메트릭을 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1최적의 가치 함수나 감독 없이 자기지도 GNN 기반 방법이 더 큰 인스턴스로 일반화되는 정책을 학습할 수 있는가?
  • RQ2최적 계획이 NP-난해한 도메인에서 최적 가치 함수를 학습함에도 불구하고 표준 가치 기반 강화학습 방법이 일반화에 실패하는 이유는 무엇인가?
  • RQ3C2 논리에 제한된 GNN이 복잡한 계획 도메인에서 일반화 정책에 필요한 특징을 얼마나 잘 포착할 수 있는가?
  • RQ4유도 원소(예: 전이 폐쇄, 역할 조합)가 C2 표현력 이외의 능력을 GNN에 확장하여 완전한 일반화를 가능하게 하는 데 얼마나 효과적인가?
  • RQ5GNN의 깊이를 줄이는 것이 일반화 성능을 향상시키는가? 특히 유도 원소와 조합했을 경우에 대해.

주요 결과

  • Logistics 도메인에서 유도 원소를 추가함으로써 탐욕 정책의 커버리지가 0%에서 14%로 상승했고, 사이클 방지 기능을 추가하면 60%에서 100%로 상승했다.
  • 최대 50개의 위치를 가진 수정된 Spanner* 도메인에서 GNN 층 수를 10층으로 줄였을 때, 유도 원소 없이 커버리지가 33%에 도달했지만, 유도 원소를 추가하면 86%로 상승했다.
  • GNN 층 수를 10층에서 5층으로 줄였을 때, 유도 원소를 사용하면 커버리지가 86%로 상승했고, 층 수를 2층으로 줄였을 때는 100% 커버리지에 도달했다.
  • 층 수를 줄임으로써 성능 향상은 주로 과적합 감소 덕분이며, 특히 유도 원소와 조합했을 경우 더욱 두드러진다.
  • 유도 원소와 최소한의 GNN 깊이를 조합함으로써, 여러 도메인(예: Logistics, Spanner*)에서 100%의 일반화를 달성한다.
  • L1 손실 함수는 효과적인 자기지도 학습을 가능하게 하여, 최적 정책이 존재하지 않는 경우에도 일반화가 가능하며, NP-난해한 도메인에서 표준 가치 기반 RL보다 뛰어난 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.