Skip to main content
QUICK REVIEW

[논문 리뷰] SMART: Self-supervised Multi-task pretrAining with contRol Transformers

Yanchao Sun, Shuang Ma|arXiv (Cornell University)|2023. 01. 24.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

SMART는 오프라인 트레이ジェ터리에서 보상에 종속되지 않는 표현을 학습하는 Control Transformer(CT)를 사용하여 순차적 결정 문제를 위한 자기지도 다중작업 미리훈련 프레임워크를 제안한다. 전방 역학, 역방향 역학, 및 마스킹된 후회적 제어 목표를 결합함으로써 SMART는 낮은 품질 또는 무작위의 미리훈련 데이터가 존재하는 경우에도 다양한 이mitation learning(ILD) 및 강화학습(RL) 작업에서 최신 기술 수준의 전이 성능를 달성한다.

ABSTRACT

Self-supervised pretraining has been extensively studied in language and vision domains, where a unified model can be easily adapted to various downstream tasks by pretraining representations without explicit labels. When it comes to sequential decision-making tasks, however, it is difficult to properly design such a pretraining approach that can cope with both high-dimensional perceptual information and the complexity of sequential control over long interaction horizons. The challenge becomes combinatorially more complex if we want to pretrain representations amenable to a large variety of tasks. To tackle this problem, in this work, we formulate a general pretraining-finetuning pipeline for sequential decision making, under which we propose a generic pretraining framework extit{Self-supervised Multi-task pretrAining with contRol Transformer (SMART)}. By systematically investigating pretraining regimes, we carefully design a Control Transformer (CT) coupled with a novel control-centric pretraining objective in a self-supervised manner. SMART encourages the representation to capture the common essential information relevant to short-term control and long-term control, which is transferrable across tasks. We show by extensive experiments in DeepMind Control Suite that SMART significantly improves the learning efficiency among seen and unseen downstream tasks and domains under different learning scenarios including Imitation Learning (IL) and Reinforcement Learning (RL). Benefiting from the proposed control-centric objective, SMART is resilient to distribution shift between pretraining and finetuning, and even works well with low-quality pretraining datasets that are randomly collected.

연구 동기 및 목표

  • 다양한 역학, 보상, 액션 공간을 가진 다양한 순차적 결정 문제 작업을 위한 일반적이고 전이 가능한 표현을 미리훈련하는 데 도전한다.
  • 특히 미리훈련 데이터가 열악하거나 무작위 정책으로 수집된 경우에도, 미리훈련과 피니튜닝 간의 데이터 분포 이탈 문제를 극복한다.
  • 특수 작업에 맞는 적응 없이도 이mitation learning(IL)과 강화학습(RL) 모두를 지원하는 통합된 표현 학습 프레임워크를 개발한다.
  • 보상 신호에 의존하지 않고 고차원 관측치로부터 단기 및 장기 역학을 모두 포괄하는 제어 중심의 미리훈련 목표를 설계한다.
  • 미리훈련 데이터가 저품질이거나 비전문가인 경우에도, 새로운 작업과 도메인에 대해 강건하고 일반화 가능한 성능을 확보한다.

제안 방법

  • 고차원 관측치로부터 상태-액션 상호작용을 모델링하는 인과적 어텐션 기반 아키텍처인 Control Transformer(CT)를 도입한다.
  • 세 가지 구성 요소로 이루어진 새로운 제어 중심의 미리훈련 목표를 설계한다: 전방 역학 예측, 역방향 역학 예측, 및 마스킹된 후회적 제어(Mask-Ctl).
  • 미래 상태를 주어진 조건에서 액션을 예측함으로써 마스킹된 후회적 제어를 사용하여 장기적 시간적 추론과 정책 불변의 역학 이해를 장려한다.
  • 보상 신호나 전문가 시뮬레이션에 접근할 수 없는 오프라인 트레이제터리 데이터에서 CT를 자기지도 방식으로 훈련한다.
  • 보상 모델링과 표현 학습을 분리함으로써 전이 동작에 대한 IL 및 RL 모두와의 호환성을 확보한다.
  • 일부 변형에서는 대조적 감독을 위해 모멘텀 인코더를 적용하지만, 주요 결과에서는 핵심 제어 중심 목표를 우선시한다.

실험 결과

연구 질문

  • RQ1보상에 종속되지 않는 자기지도 미리훈련 프레임워크가 다양한 순차적 결정 문제 작업을 위한 전이 가능한 표현을 효과적으로 학습할 수 있는가?
  • RQ2시각 또는 언어 기반의 목표와 비교할 때, 제안된 제어 중심의 미리훈련 목표는 어떤가? 하류 작업에서의 전이 성능에 대해 어떻게 비교되는가?
  • RQ3무작위 또는 비전문가 정책으로 수집된 미리훈련 데이터를 사용할 경우, SMART는 얼마나 높은 수준의 일반화 성능를 보여주는가?
  • RQ4전반적인 성능에 대해 단기(전방/역방향 역학)와 장기(마스킹된 후회적 제어) 역학 모델링의 기여도는 각각 어느 정도인가?
  • RQ5보조 손실(예: 마스킹된 상태 예측 또는 대조적 손실)을 추가하면 일반화 성능가 향상되며, 어떤 조건에서 그러한 개선이 이루어지는가?

주요 결과

  • SMART는 DeepMind Control Suite에서 이mitation learning(BC) 및 강화학습(RL) 하류 작업 전반에서 학습 효율성을 크게 향상시키며, 무작위로 초기화된 모델 훈련 및 이전 최신 기술 수준의 미리훈련 방법보다 뛰어난 성능를 기록한다.
  • 제거 실험 결과, 전방 역학, 역방향 역학, 마스킹된 후회적 제어의 세 가지 구성 요소 모두가 필수적임을 확인하였으며, 어느 하나라도 제거하면 성능 저하가 발생한다.
  • SMART는 분포 이탈에 매우 강건하다: 무작위 정책으로 수집된 데이터를 사용하는 경우에도 효과적으로 일반화되며, 이러한 저품질 데이터 환경에서 베이스라인을 능가한다.
  • 미리훈련 데이터가 탐색적일 경우, 추가 손실 없이 원본 SMART 목표를 사용할 때 전체 성능가 최고로 나타나, 핵심 제어 중심 설계가 충분하고 안정적임을 시사한다.
  • 마스킹된 상태 예측 또는 대조적 손실과 같은 보조 손실을 추가하면, 무작위 미리훈련 데이터에서만 성능 향상이 이루어지며, 이는 분포 이탈이 높을 경우 더 나은 시각적 표현을 학습하는 데 도움이 된다는 것을 의미한다.
  • 128개의 실험 설정(4가지 변형 × 2가지 학습 시나리오 × 2가지 데이터 세트 선택 × 8개의 하류 작업) 전반에서 일관된 성능를 유지함으로써, 이 프레임워크의 유연성과 신뢰성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.