Skip to main content
QUICK REVIEW

[논문 리뷰] Transformers for One-Shot Visual Imitation

Sudeep Dasari, Abhinav Gupta|arXiv (Cornell University)|2020. 11. 11.
Multimodal Machine Learning Applications참고 문헌 57인용 수 7
한 줄 요약

이 논문은 도메인 스플릿(예: 다른 레이아웃, 형태)이 있는 상황에서도 일반화할 수 있도록 교사 에이전트의 컨텍스트 비디오와 자기지도 학습 역역학 손실을 활용하는 트랜스포머 기반 정책 네트워크를 제안한다. 작업에 관련된 시각적 특징에 주목하고 역학 인식 표현을 유지함으로써, 이 방법은 일회성 조작 작업에서 이전 베이스라인 대비 약 2배 향상된 성공률을 달성한다.

ABSTRACT

Humans are able to seamlessly visually imitate others, by inferring their intentions and using past experience to achieve the same end goal. In other words, we can parse complex semantic knowledge from raw video and efficiently translate that into concrete motor control. Is it possible to give a robot this same capability? Prior research in robot imitation learning has created agents which can acquire diverse skills from expert human operators. However, expanding these techniques to work with a single positive example during test time is still an open challenge. Apart from control, the difficulty stems from mismatches between the demonstrator and robot domains. For example, objects may be placed in different locations (e.g. kitchen layouts are different in every house). Additionally, the demonstration may come from an agent with different morphology and physical appearance (e.g. human), so one-to-one action correspondences are not available. This paper investigates techniques which allow robots to partially bridge these domain gaps, using their past experience. A neural network is trained to mimic ground truth robot actions given context video from another agent, and must generalize to unseen task instances when prompted with new videos during test time. We hypothesize that our policy representations must be both context driven and dynamics aware in order to perform these tasks. These assumptions are baked into the neural network using the Transformers attention mechanism and a self-supervised inverse dynamics loss. Finally, we experimentally determine that our method accomplishes a $\sim 2$x improvement in terms of task success rate over prior baselines in a suite of one-shot manipulation tasks.

연구 동기 및 목표

  • 로봇이 도메인 스플릿(예: 다른 레이아웃, 형태)이 있는 상황에서 단일 시연만으로 학습할 수 있도록 일회성 시각적 모방 학습의 과제를 해결한다.
  • 낮은 데이터 환경에서 일반화 및 과적합 문제를 겪는 행동 복제에만 의존하는 이전 방법의 한계를 극복한다.
  • 컨텍스트 기반이면서 역학 인식인 정책을 개발하여, 새로운 작업 인스턴스와 환경에서도 견고한 성능을 달성한다.
  • 자기지도 학습 손실과 주의 메커니즘이 광범위한 미세조정 없이도 일회성 모방 학습에서 일반화를 향상시키는지 조사한다.

제안 방법

  • 로봇의 현재 관측값과 교사 에이전트의 시범 비디오에서 유도된 공간적 ResNet 특징을 처리하기 위해 트랜스포머 인코더를 사용한다.
  • 다중 헤드 자기주의를 적용하여 작업 조건에 맞는 관계 기반 표현을 학습함으로써, 주목할 만한 시각적 요소(예: 물체 위치)에 집중하고 간섭 요소는 무시한다.
  • 컨텍스트 인식 상태 표현을 기반으로 전문가 행동을 모방하기 위해 행동 복제 손실을 사용해 정책을 훈련시킨다.
  • 표현 학습을 정규화하기 위해 자기지도 학습 역역학 손실을 도입함으로써, 제어에 중요한 운동 관련 역학을 포착하도록 보장한다.
  • 일반화를 향상시키고 과적합을 줄이기 위해 훈련 중에 데이터 증강(예: 무작위 자르기, 색상 왜곡)을 적용한다.
  • 단일 목표 프레임이 아닌 전체 시범 비디오에 조건을 줌으로써 더 나은 작업 이해와 컨텍스트 인식 행동 예측이 가능하도록 한다.

실험 결과

연구 질문

  • RQ1자기주의를 갖춘 트랜스포머 기반 아키텍처가 순환 또는 피드포워드 베이스라인 대비 일회성 시각적 모방 학습 성능을 향상시키는가?
  • RQ2단일 시범만 제공될 경우 자기지도 학습 역역학 손실이 일반화에 얼마나 효과적인가?
  • RQ3전체 시범 비디오(단일 프레임이 아닌)에 정책을 조건화하면 더 나은 작업 이해와 성공률을 달성하는가?
  • RQ4아키텍처의 편향(예: 주의 메커니즘)과 손실 함수가 함께 작용할 때, 저데이터 모방 학습 환경에서 테스트 시 성능 향상에 얼마나 기여하는가?
  • RQ5제안된 방법은 미세조정 없이도 다른 물체 배치나 로봇 형태와 같은 도메인 스플릿에 일반화 가능한가?

주요 결과

  • 제안된 트랜스포머 기반 정책는 일련의 픽앤플레이스 작업에서 이전 일회성 모방 학습 베이스라인 대비 약 2배 향상된 작업 성공률을 달성한다.
  • 역역학 손실이 없는 모델은 1600개의 데이터 쌍으로 훈련했을 때 동료들보다 25% 이상 성능이 열 劣하므로, 이 정규화의 핵심적인 역할을 확인한다.
  • 역역학 손실은 행동 복제 손실이 포괄하지 못하는 바를 보완하여 테스트 시 성능 향상을 이끌어내며, 학습 목표에 반영되지 않은 긍정적 전이 효과를 제공함을 시사한다.
  • 동일한 훈련 손실을 사용하더라도 트랜스포머 모델은 LSTMs와 ResNet 기반 모델을 포함한 모든 다른 아키텍처보다 크게 승리한다.
  • 역역학 손실을 제거하면 모든 데이터 영역에서 성능이 뚜렷이 열 劣하며, 특히 저데이터 설정에서 그 중요성이 확인된다.
  • 단일 프레임이 아닌 전체 시범 비디오에 정책을 조건화하면 성능이 향상되며, 이는 맥락 정보가 작업 이해에 필수적임을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.