[논문 리뷰] Language-Driven Representation Learning for Robotics
이 논문은 인간의 영상과 캡션을 사용하여 시각적 재구성과 시각 기반 언어 생성을 동시에 최적화하는 언어 기반 시각 표현 학습 프레임워크인 Voltron을 소개한다. 조정 가능한 언어 조건화 메커니즘을 통해 저수준의 공간 패턴 학습과 고수준의 의미 이해를 균형 있게 조절함으로써, Voltron은 다섯 가지 다양한 로봇 학습 과제에서 최신 기술 수준의 성능을 달성하며, 특히 언어 조건화 이mitation과 의도 평가와 같은 고수준 의미 과제에서 뛰어난 성능을 보인다.
Recent work in visual representation learning for robotics demonstrates the viability of learning from large video datasets of humans performing everyday tasks. Leveraging methods such as masked autoencoding and contrastive learning, these representations exhibit strong transfer to policy learning for visuomotor control. But, robot learning encompasses a diverse set of problems beyond control including grasp affordance prediction, language-conditioned imitation learning, and intent scoring for human-robot collaboration, amongst others. First, we demonstrate that existing representations yield inconsistent results across these tasks: masked autoencoding approaches pick up on low-level spatial features at the cost of high-level semantics, while contrastive learning approaches capture the opposite. We then introduce Voltron, a framework for language-driven representation learning from human videos and associated captions. Voltron trades off language-conditioned visual reconstruction to learn low-level visual patterns, and visually-grounded language generation to encode high-level semantics. We also construct a new evaluation suite spanning five distinct robot learning problems $\unicode{x2013}$ a unified platform for holistically evaluating visual representations for robotics. Through comprehensive, controlled experiments across all five problems, we find that Voltron's language-driven representations outperform the prior state-of-the-art, especially on targeted problems requiring higher-level features.
연구 동기 및 목표
- 다양한 로봇 학습 과제, 예를 들어 그립 가능 예측과 언어 조건화 이mitation에서 기존 시각 표현 간의 일관성 부족 문제를 해결하기 위해.
- 로봇 분야에서 저수준 시각 패턴과 고수준 의미 이해를 모두 포괄하는 통합 프레임워크를 개발하기 위해.
- 시각 운동 제어를 초월하여 다섯 가지의 독립된 로봇 학습 응용 분야에서 시각 표현을 종합적으로 평가하기 위해.
- 언어 감독이 재구성에 대한 조건화와 의미에 대한 언어 생성이라는 이중 목표에서 효과적으로 활용될 수 있음을 입증하기 위해.
- 다양한 로봇 과제에서 시각 표현을 평가하기 위한 새로운 평가 세트를 수립하기 위해.
제안 방법
- Voltron은 영상 프레임과 관련된 언어 캡션을 처리하기 위해 비전 트랜스포머 인코더를 사용하며, 시각 재구성을 위한 마스킹 오토에코딩 목적함수를 적용한다.
- 언어가 조건 신호로 사용될지(α=0) 또는 시각적 특징에서 생성될지(α>0)를 제어할 수 있는 조정 가능한 확률 α를 도입함으로써, 저수준과 고수준 특징 학습 간의 트레이드오프를 가능하게 한다.
- 시간적 변화를 모델링하기 위해 이중 프레임 컨텍스트(초기 관측과 현재 관측)를 사용하며, 특히 동작 진행을 포함한 과제에 매우 유용하다.
- 적응을 위해 과제별 헤드를 사용한다: 세그멘테이션에는 PUP 블록, 바운딩 박스 예측에는 MLP, 정책 학습에는 간단한 MLP를 사용한다.
- 모델은 마스킹된 프레임과 해당 캡션을 함께 사용하여 에고세트릭 영상 데이터셋(Ego4D 등)에서 사전 학습을 수행하며, 재구성과 대비 목적함수의 조합을 사용한다.
- 평가 범위는 다섯 가지 과제로 구성된다: 그립 가능 예측, 언어 표현 기반 지목, 시각 운동 제어, 언어 조건화 이mitation, 제로샷 의도 평가.

실험 결과
연구 질문
- RQ1언어 감독이 시각 운동 제어를 초월하여 고수준 의미가 필요한 과제에서 로봇의 시각 표현 성능을 향상시킬 수 있는가?
- RQ2언어 조건화 재구성과 언어 생성 간의 트레이드오프가 다양한 로봇 학습 과제에서 성능에 미치는 영향은 어떠한가?
- RQ3언어 감독을 통해 사전 학습된 표현이 MVP와 R3M와 같은 이전 최신 기술 수준의 방법보다 광범위한 과제 범위에서 더 잘 일반화되는가?
- RQ4통합된 표현 학습 프레임워크가 저수준 공간적 특징과 고수준 의미 이해를 효과적으로 균형 있게 조절할 수 있는가?
- RQ5이중 프레임 컨텍스트의 사용이 시간 동적 변화와 인간의 의도를 포함한 과제에서 학습 성능을 향상시키는가?
주요 결과
- Voltron의 언어 기반 표현은 모든 다섯 가지 평가 과제에서 이전 최신 기술 수준의 방법, 즉 MVP와 R3M를 뛰어넘으며, 고수준 의미 과제에서 뚜렷한 성과 향상을 보였다.
- 언어 조건화 이mitation 학습 과제에서 Voltron(V-Gen 버전)은 실물의 Franka Kitchen 과제에서 22.5%의 성공률을 기록하여 R3M와 MVP를 능가했다.
- 제로샷 의도 평가 과제에서 V-Gen은 WHiRL 데이터셋에서 78.3%의 정확도를 기록하여 CLIP와 R3M를 크게 앞섰다.
- 그립 가능 예측 과제에서 Voltron는 EGTEA Gaze+ 데이터셋에서 평균 IoU 91.2%를 달성하여 MVP와 R3M를 초월했다.
- 이중 프레임 조건화를 사용하는 V-Dual 버전은 시간적 추론이 필요한 과제, 예를 들어 언어 표현 기반 지목 과제에서 향상된 성능을 보였다.
- 제거 분석 결과, 언어 조건화와 생성 간의 균형(α를 통해 제어)이 매우 중요하며, α=0.5일 때 다양한 과제에서 최적의 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.