[논문 리뷰] Offline Reinforcement Learning for Visual Navigation
ReViND는 사전 수집된 데이터셋을 사용하여 온라인 미세조정이나 추가 데이터 수집 없이도 사용자가 지정한 보상 함수(예: 잔디 위에 머무르기 또는 그림자 피하기)를 최적화하면서도 먼 목표지점으로의 실생활 로봇 주행을 가능하게 하는 오프라인 강화학습 시스템이다. 이는 목표 조건부 오프라인 Q-학습과 위상적 그래프 계획을 결합하여 실현 가능하다.
Reinforcement learning can enable robots to navigate to distant goals while optimizing user-specified reward functions, including preferences for following lanes, staying on paved paths, or avoiding freshly mowed grass. However, online learning from trial-and-error for real-world robots is logistically challenging, and methods that instead can utilize existing datasets of robotic navigation data could be significantly more scalable and enable broader generalization. In this paper, we present ReViND, the first offline RL system for robotic navigation that can leverage previously collected data to optimize user-specified reward functions in the real-world. We evaluate our system for off-road navigation without any additional data collection or fine-tuning, and show that it can navigate to distant goals using only offline training from this dataset, and exhibit behaviors that qualitatively differ based on the user-specified reward function.
연구 동기 및 목표
- 비용이 많이 드는 온라인 데이터 수집 대신 기존 오프라인 데이터셋을 활용하는 확장 가능하고 실생활 적용 가능한 로봇 주행 시스템을 개발하는 것.
- 오직 오프라인 강화학습과 사전 레이블링된 보상 함수를 사용하여 100m 이상의 장거리 목표지점으로의 장수평 주행을 가능하게 하는 것.
- 사용자가 지정한 보상 함수를 수정하여 다양한 주행 행동(예: 잔디 길 선호 또는 햇빛이 비치는 길 선호)을 지원하는 것.
- 반응형 정책과 이민학습의 한계를 극복하기 위해 계획과 오프라인 강화학습을 통합하여 더 나은 일반화 능력과 보상 인식 행동을 달성하는 것.
제안 방법
- 사용자가 지정한 보상 레이블을 포함한 원시 시각 관측값과 오프라인 트레이젝터리 데이터로부터 직접 목표 조건부 정책을 학습하기 위해 암묵적 Q-학습(IQL)을 사용한다.
- 노드가 시각 관측값이고 간선가치 함수에 의해 정의되는 위상적 그래프를 구성하며, 거리 척도로 −Vπ를 사용한다.
- 장수평 주행 동안 지정된 보상 함수를 최대화하는 최소비용 경로를 찾기 위해 위상적 표현에서 그래프 탐색을 수행한다.
- IQL에서 유도된 저수준 정책 실행과 그래프 탐색을 통한 고수준 계획을 결합하여 국소 주행 정확도와 전반적 보상 최적화를 동시에 달성한다.
- 사전 훈련을 위해 공개된 30시간 분량의 데이터셋을 활용하며, 보상 함수는 사후 레이블링을 통해 인코딩되어 새로운 환경에서의 배포를 가능하게 한다.
- 온정책 데이터 수집이나 미세조정 없이도 실생활 환경에 배포되며, 오직 오프라인 데이터와 보상 재가중치에 의존한다.
실험 결과
연구 질문
- RQ1사전에 존재하는 데이터셋만을 사용하여 오프라인 강화학습을 실생활 환경에서 장수평 시각 주행에 효과적으로 적용할 수 있는가?
- RQ2오프라인 강화학습과 위상적 계획을 융합하여 사용자가 지정한 보상 함수에 기반한 다양한 주행 행동을 달성할 수 있는가?
- RQ3이러한 시스템은 이민학습 및 온라인 강화학습 기준 모델 대비 목표지점 도달 성공률과 보상 최적화 측면에서 어떻게 성능을 내는가?
- RQ4미세조정 없이도 시각적으로 유사하지만 이전에 본 적 없는 환경으로의 일반화 능력은 어느 정도인가?
주요 결과
- ReViND는 온라인 데이터 수집 없이도 사전 훈련된 오프라인 학습만으로도 새로운 시각적으로 유사한 환경에서 100m 이상의 먼 목표지점으로 성공적으로 주행한다.
- 시스템은 보상 함수에 따라 질적으로 다른 행동을 보이며, 예를 들어 잔디 길을 선호하거나 새로 베인 잔디를 피하는 등 효과적인 보상 일반화를 보여준다.
- 특히 15~20m를 초월할 경우 벌레선형 경로와 충돌 문제로 인해 평탄한 정책이 실패하는 장수평 작업에서 ReViND는 이민학습(BC, fBC)과 모델프리 강화학습(IQL)을 모두 능가한다.
- 그래프 기반 계획은 평탄한 정책보다 성능을 크게 향상시키며, 오프라인 강화학습(ReViND)은 보상 최적화 측면에서 필터링 기반 접근법(fBC-graph)보다 항상 승리한다.
- 정량적 평가 결과 ReViND는 기준 모델 대비 더 높은 평균 유틸리티와 낮은 이탈률을 기록하며, 다양한 보상 목표에서 일관된 성공률을 보였다.
- 시스템의 성능는 다양하고 보상 레이블이 부여된 데이터의 가용성에 크게 의존한다; 예를 들어, 오직 도로 데이터만 존재할 경우 오프로드 주행 행동을 학습할 수 없다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.