[논문 리뷰] Hierarchical Few-Shot Imitation with Skill Transition Models
FIST는 숙련 전이 모델을 활용하여 미리 훈련되지 않은 장기 작업에 일반화할 수 있는 계층적 few-shot 성능 모방 학습 프레임워크를 제안한다. 현재 상태와 향후 상태에 조건화된 역숙련 역학 모델을 학습하고, 반응형 거리 함수를 사용하여 반모수적 상태 선택을 수행함으로써 정책 이탈을 방지하고, 최소한의 시범 예제로도 최신 기술 성능을 달성한다.
A desirable property of autonomous agents is the ability to both solve long-horizon problems and generalize to unseen tasks. Recent advances in data-driven skill learning have shown that extracting behavioral priors from offline data can enable agents to solve challenging long-horizon tasks with reinforcement learning. However, generalization to tasks unseen during behavioral prior training remains an outstanding challenge. To this end, we present Few-shot Imitation with Skill Transition Models (FIST), an algorithm that extracts skills from offline data and utilizes them to generalize to unseen tasks given a few downstream demonstrations. FIST learns an inverse skill dynamics model, a distance function, and utilizes a semi-parametric approach for imitation. We show that FIST is capable of generalizing to new tasks and substantially outperforms prior baselines in navigation experiments requiring traversing unseen parts of a large maze and 7-DoF robotic arm experiments requiring manipulating previously unseen objects in a kitchen.
연구 동기 및 목표
- 복잡한 하위작업의 연속이 필요한 새로운 장기 작업에 대해 자율 에이전트가 일반화할 수 있도록 하는 것.
- 소수의 시범 예제만 제공될 경우 few-shot 성능 모방 학습에서 정책 이탈 문제를 해결하는 것.
- 데이터 기반 행동 사전 지식과 few-shot 성능 모방을 결합하여 단일 모드, 향후 상태 조건화된 기술 정책을 학습하는 것.
- 역숙련 역학 모델을 통해 현재 상태와 향후 상태에 모두 조건화된 기술 선택을 통해 일반화 성능을 향상시키는 것.
- 다양한 오프라인 데이터에서 사전 훈련하고 소수의 하류 시범 예제에서 미세 조정함으로써 분포 외(OOD) 작업에 효과적으로 적응할 수 있도록 하는 것.
제안 방법
- FIST는 현재 상태에서 목표 향후 상태로 전이하기 위해 필요한 기술을 예측하는 역숙련 역학 모델을 학습하여 단일 모드이자 목표 조건화된 기술 선택을 가능하게 한다.
- 추론 시 역숙련 모델의 조건화에 사용할 가장 관련성이 높은 시범 상태를 식별하기 위해 반응형 거리 함수를 도입한다.
- 반모수적 접근 방식을 사용하여 현재 관측값과 가장 가까운 상태를 기반으로 시범 집합에서 가장 적합한 기술을 선택한다.
- 행동 사전 지식을 제공하기 위해 기술 사전 지식은 대규모 오프라인 시범 데이터셋에서 사전 훈련된다.
- 소수의 하류 시범 예제에서의 미세 조정을 통해 사전 훈련 기간 동안 볼 수 없었던 분포 외 작업에 적응할 수 있다.
- 행동 사전 지식의 구조적 탐색과 few-shot 성능 모방의 샘플 효율성을 결합하여 강력한 일반화 성능을 달성한다.
실험 결과
연구 질문
- RQ1사전 훈련 기간 동안 볼 수 없었던 장기 작업에 대해 few-shot 성능 모방 학습이 가능한 기술 표현을 학습할 수 있는가?
- RQ2소수의 시범 예제만 존재할 경우 few-shot 성능 모방 학습에서 정책 이탈을 어떻게 방지할 수 있는가?
- RQ3현재 상태와 향후 상태에 모두 조건화된 기술 정책을 적용하면 다중 모드 기술 공간에서 일반화 성능 향상과 모드 붕괴 감소에 기여하는가?
- RQ4분포 외 작업 일반화에 대해 오프라인 데이터셋에서의 사전 훈련과 하류 데이터에서의 직접 미세 조정 간의 영향은 무엇인가?
- RQ5다양한 거리 측정법(예: 반응형 vs. 유클리드)이 FIST의 반모수적 상태 선택 성능에 어떤 영향을 미치는가?
주요 결과
- FIST는 사전 훈련 기간 동안 볼 수 없었던 장기 작업의 네비게이션 작업에서 최신 기술 성능을 달성하였으며, 가장 복잡한 시나리오에서 평균 성공률이 4.0 ± 0.0을 기록하여 기존 기준보다 뚜렷이 뛰어나다.
- 7-DoF 로봇 조작 작업에서 FIST는 티티케이틀과 슬라이드 캐비닛과 같은 물체를 다루는 새로운 작업에서 성공률 3.5 ± 0.3을 기록하여 SPiRL 및 기타 기준보다 뛰어나다.
- 절단 실험 결과에 따르면 하류 시범 예제에서의 미세 조정이 필수적임을 확인할 수 있었다: FIST-no-FT는 평균 성공률 2.0 ± 0.0에 머물러 미세 조정 없이 일반화에 실패함을 시사한다.
- 다양한 오프라인 데이터셋에서의 사전 훈련이 일반화에 필수적임을 입증하였다: FIST-no-pretrain는 평균 성공률 0.5 ± 0.16에 머물러 행동 사전 지식의 중요성을 강조한다.
- 반응형 거리 함수는 유클리드 거리보다 성능이 뛰어나며, FIST (Euc.)는 4개 작업 중 3개에서 약간 열등한 성능을 보여, 복잡한 상태 공간에서 반응형 측정법이 더 강건함을 시사한다.
- FIST는 사전 훈련 데이터셋에 포함되지 않은 분포 외 작업, 예를 들어 티티케이틀 조작이나 하단 캐비닛 열기 등에도 성공적으로 일반화하여 강력한 제로샷 전이 능력을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.