Skip to main content
QUICK REVIEW

[논문 리뷰] Representation Learning on Graphs: A Reinforcement Learning Application

Sephora Madjiheurem, Laura Toni|arXiv (Cornell University)|2019. 01. 16.
Reinforcement Learning in Robotics참고 문헌 15인용 수 5
한 줄 요약

이 논문은 강화학습에서 선형 가치 함수 근사에 대해 기존의 원형가치함수(PVFs) 대신 학습된 그래프 표현 모델—특히 node2vec와 변분 그래프 autoencoder(Variational Graph Autoencoders)—를 사용하는 일반화된 표현 정책 반복(RPI) 프레임워크를 제안한다. 이는 구조적 기하학성과 국소 그래프 성질을 반영하는 학습된 특징이 저차원 상태 공간에서 PVFs보다 유의미하게 뛰어난 성능을 보임을 보여주며, 특히 구조적 동치성보다는 유사성에 중점을 두는 node2vec이 뛰어난 성능을 기록한다.

ABSTRACT

In this work, we study value function approximation in reinforcement learning (RL) problems with high dimensional state or action spaces via a generalized version of representation policy iteration (RPI). We consider the limitations of proto-value functions (PVFs) at accurately approximating the value function in low dimensions and we highlight the importance of features learning for an improved low-dimensional value function approximation. Then, we adopt different representation learning algorithm on graphs to learn the basis functions that best represent the value function. We empirically show that node2vec, an algorithm for scalable feature learning in networks, and the Variational Graph Auto-Encoder constantly outperform the commonly used smooth proto-value functions in low-dimensional feature space.

연구 동기 및 목표

  • 기저 상태 공간 기하학이 비정규적이거나 잘 모델링되지 않을 경우 원형가치함수(PVFs)가 가치 함수 근사에 한계를 보이는 문제를 해결하기 위해.
  • 그래프 기반 표현 학습이 강화학습에서 선형 가치 함수 근사에 더 나은 기저 함수를 제공할 수 있는지 조사하기 위해.
  • 기존의 PVFs와 비교하여 현대적인 그래프 임베딩 방법—node2vec와 변분 그래프 autoencoder(Variational Graph Autoencoders)—이 저차원 특징 공간에서 가치 함수 근사에 어떻게 성능을 내는지 평가하기 위해.
  • MDP 유도 그래프의 기하학적 구조를 가장 잘 유지하는 그래프 표현 학습 전략이 가치 함수 근사 향상에 기여하는지 규명하기 위해.

제안 방법

  • 기존 RPI에서 사용하는 고정된 라플라시안 고유맵 대신 임의의 기저 함수를 허용하도록 표현 정책 반복(RPI) 알고리즘을 일반화한다.
  • 수집된 MDP 트레이젝터리에서 상태 전이 그래프를 구성하며, 노드는 상태를, 간선은 전이 확률을 나타낸다.
  • 노드 임베딩을 학습하기 위해 node2vec을 적용하여 국소 및 전반적인 그래프 구조를 유지하며, 랜덤 워크 전략을 제어하기 위해 초모수 p와 q를 사용한다.
  • 잠재 공간 임베딩에서 인접 행렬을 재구성함으로써 노드 표현을 학습하기 위해 변분 그래프 오토에인드어(Variational Graph Autoencoder, VGAE)를 훈련한다.
  • 학습된 임베딩을 선형 가치 함수 근사에서 기저 함수로 사용하며, 최소 제곱 최적화를 통해 예측된 가치 함수와 진짜 가치 함수 간의 평균 제곱오차를 최소화한다.
  • 가장 우수한 표본 추출 전략을 도출하기 위해 node2vec 초모수(p와 q)를 그리드 서치를 통해 최적화한다.

실험 결과

연구 질문

  • RQ1기존의 원형가치함수와 비교해 그래프 기반 표현 학습이 강화학습에서 가치 함수 근사 성능을 향상시킬 수 있는가?
  • RQ2특히 node2vec과 변분 그래프 오토에인드어(Variational Graph Autoencoders)를 포함한 다양한 그래프 표현 학습 방법이 저차원 특징 공간에서 가치 함수 근사에 어떻게 성능을 내는가?
  • RQ3노드 임베딩의 어떤 특성(예: 구조적 동치성 대비 유사성)이 효과적인 가치 함수 근사에 가장 중요할까?
  • RQ4랜덤 워크 과정에서 사용하는 표본 추출 전략(특히 너비 우선 탐색 대비 깊이 우선 탐색)이 학습된 기저 함수의 성능에 영향을 미치는가?

주요 결과

  • 구조적 동치성을 강조하는 p=1 및 q=4로 설정된 node2vec이 모든 다른 설정과 비교해 뛰어난 성능을 보이며 가치 함수 근사 정확도를 크게 향상시킨다.
  • node2vec 임베딩을 사용할 경우, 특히 저차원 특징 공간에서 원형가치함수보다 가치 함수 근사의 평균 제곱오차를 더 효과적으로 감소시킨다.
  • VGAE는 더 많은 훈련이 필요함에도 불구하고 node2vec에 비해 성능 향상이 미미하여, 이 맥락에서 단순한 모델이 효과적인 표현 학습을 위해 충분할 수 있음을 시사한다.
  • 학습된 특징의 성능 향상은 MDP 유도 그래프의 전반적인 구조적 기하학성을 잘 반영하면서 국소 이웃성 특성을 유지하는 임베딩 방법에서 가장 두드러진다.
  • 그래프가 잘 추정되지 않을 경우 PVFs에 기반한 부드러움 가정이 실질적으로 성립하지 않음을 고려할 때, 데이터 기반 기저 함수 학습의 필요성을 정당화한다.
  • 결과적으로, 유사성보다는 구조적 동치성을 우선시하는 표현 학습 모델이 강화학습의 가치 함수 근사에 더 적합하다는 것이 제안된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.