[논문 리뷰] Reinforcement Learning with Videos: Combining Offline Observations with Interaction
이 논문은 시각 기반 로봇 정책 학습에서 샘플 효율성을 향상시키기 위해 오프라인 인간 영상과 온라인 로봇 상호작용을 결합하는 프레임워크인 강화학습과 영상(RLV)을 제안한다. 도메인 불변 표현을 사용해 시각적 관찰에서 행동과 보상을 추론함으로써, RLV는 표준 강화학습 대비 샘플 복잡도를 50% 이상 감소시킨다. 이는 행동 및 보상 추정이 불완전한 상황에서도 성립한다.
Reinforcement learning is a powerful framework for robots to acquire skills from experience, but often requires a substantial amount of online data collection. As a result, it is difficult to collect sufficiently diverse experiences that are needed for robots to generalize broadly. Videos of humans, on the other hand, are a readily available source of broad and interesting experiences. In this paper, we consider the question: can we perform reinforcement learning directly on experience collected by humans? This problem is particularly difficult, as such videos are not annotated with actions and exhibit substantial visual domain shift relative to the robot's embodiment. To address these challenges, we propose a framework for reinforcement learning with videos (RLV). RLV learns a policy and value function using experience collected by humans in combination with data collected by robots. In our experiments, we find that RLV is able to leverage such videos to learn challenging vision-based skills with less than half as many samples as RL methods that learn from scratch.
연구 동기 및 목표
- 시각 기반 로봇 조작 작업을 위한 강화학습(RL)에서의 샘플 비효율성 문제를 해결한다.
- 레이블이 없는 인간 영상으로부터의 시뮬레이션을 통해 애널로그 학습의 한계를 극복하고, RL이 전문가 시범을 초월해 향상되도록 한다.
- 인간과 로봇의 시각적 관찰 간 상당한 도메인 이동이 존재하는 상황에서도, 비정형적이고 행동이 없는 인간 영상을 심층 강화학습 파이프라인에 통합한다.
- 지상 진술 행동 또는 보상 레이블이 없는 상태에서 시각 데이터로부터 행동과 보상을 추론하는 방법을 개발하여 엔드 투 엔드 훈련을 가능하게 한다.
- 오프라인 인간 영상과 온라인 상호작용을 조합함으로써, 표준 RL 또는 단순 애널로그 학습 대비 더 빠른 수렴과 더 나은 최종 성능을 달성함을 입증한다.
제안 방법
- 인간 영상과 로봇 상호작용 데이터의 시각적 특징을 정렬하기 위해 도메인 불변 표현 네트워크를 사용하여 도메인 이동을 감소시킨다.
- 인간 영상 데이터의 관찰 시퀀스에서 행동을 추론하기 위해 역역학 모델을 훈련시켜 지상 진술 행동이 없는 정책 학습을 가능하게 한다.
- 대조적 표현 학습을 통해 관찰 시퀀스에서 희박한 보상을 추정하는 보상 예측 모델을 학습시켜, 명시적 보상 신호가 없더라도 작동하도록 한다.
- 실제 로봇 상호작용 데이터와 함께 추론된 행동과 보상을 재생 버퍼에 통합하여 표준 강화학습 알고리즘(SAC 등)에서 공동 훈련한다.
- 특징 품질 향상과 도메인 간 일반화를 향상시키기 위해 자기지도 대조 학습 목표를 적용한다.
- 실제 데이터와 추론된 데이터의 병합된 재생 버퍼를 사용하여 표준 이면 강화학습 알고리즘(SAC 등)을 통해 정책과 가치 함수를 미세 조정한다.
실험 결과
연구 질문
- RQ1강화학습은 행동이나 보상 레이블이 없는 비정형적 인간 영상 데이터를 효과적으로 활용하여 로봇 정책을 훈련시킬 수 있는가?
- RQ2인간 영상에서 추론된 행동과 보상은 표준 강화학습 대비 시각 기반 강화학습의 샘플 효율성을 어느 정도 향상시킬 수 있는가?
- RQ3인간과 로봇의 시각적 관찰 간 도메인 이동과 불완전한 행동/보상 예측에 대해 이 방법은 얼마나 강건한가?
- RQ4학습 속도와 최종 성능 측면에서 이 프레임워크는 표준 강화학습과 관찰 기반 애널로그 학습을 모두 능가하는가?
- RQ5이 방법은 다양한 복잡한 시각적 행동을 포함한 실제 세계의 인간 영상으로도 일반화 가능한가?
주요 결과
- RLV는 표준 SAC 기반 강화학습 대비 주어진 성능 수준에 도달하기 위한 온라인 상호작용 샘플 수를 50% 이상 감소시킨다.
- 추론된 행동이나 보상이 전혀 없는 경우에도 이 방법은 표준 강화학습보다 더 빠르게 수렴함을 보여주며, 열악한 지도 신호에 대한 강건성을 입증한다.
- 지상 진술 행동 및 보상 사용 시 성능와 유사한 결과를 달성함으로써, 추론된 지도 신호의 품질이 높음을 보여준다.
- RLV는 학습 속도와 최종 성능 측면에서 표준 강화학습 기반 탐색 기반(Baseline, RND)을 모두 능가하며, 영상 데이터의 가치가 탐색을 넘어서 있음을 시사한다.
- 프레임워크는 실제 인간 영상으로 일반화되며, 밀고 밀기 및 서랍 열기와 같은 복잡한 시각 기반 조작 작업을 성공적으로 학습한다.
- 제거 분석을 통해 이 방법은 불완전한 행동 및 보상 예측에 대해 강건하며, 지상 진술 레이블 대비 학습된 레이블을 사용할 경우 성능 저하가 최소한이 됨을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.