[논문 리뷰] Hyper-Decision Transformer for Efficient Online Policy Adaptation
이 논문은 초단기 온라인 적응을 가능하게 하는 파rameter 효율적인 프레임워크인 하이퍼-결정 트랜스포머(Hyper-Decision Transformer, HDT)를 제안한다. 사전 훈련된 결정 트랜스포머를 새로운 작업에 빠르게 적응시키기 위해 소수의 예시만을 사용한다. 트랜스포머 내부의 어댑터 모듈을 조건부로 초기화하기 위해 하이퍼넷워크를 사용함으로써, HDT는 단지 0.5%의 파라미터만을 미세조정하고, 전면 미세조정 또는 프롬프팅 기반의 기준보다 더 빠른 수렴 속도와 뛰어난 성공률을 달성한다. 이는 전문가 액션 없이도 가능하다.
Decision Transformers (DT) have demonstrated strong performances in offline reinforcement learning settings, but quickly adapting to unseen novel tasks remains challenging. To address this challenge, we propose a new framework, called Hyper-Decision Transformer (HDT), that can generalize to novel tasks from a handful of demonstrations in a data- and parameter-efficient manner. To achieve such a goal, we propose to augment the base DT with an adaptation module, whose parameters are initialized by a hyper-network. When encountering unseen tasks, the hyper-network takes a handful of demonstrations as inputs and initializes the adaptation module accordingly. This initialization enables HDT to efficiently adapt to novel tasks by only fine-tuning the adaptation module. We validate HDT's generalization capability on object manipulation tasks. We find that with a single expert demonstration and fine-tuning only 0.5% of DT parameters, HDT adapts faster to unseen tasks than fine-tuning the whole DT model. Finally, we explore a more challenging setting where expert actions are not available, and we show that HDT outperforms state-of-the-art baselines in terms of task success rates by a large margin.
연구 동기 및 목표
- 사전 훈련된 결정 트랜스포머를 최소한의 데이터와 계산 자원으로 새로운 작업에 효율적으로 적응시키는 도전에 대응하기 위해.
- 전문가 액션이 있는 메타-모방학습(meta-imitation learning, meta-IL)과 전문가 액션이 없는 메타-관찰학습(meta-Learning-from-Observation, meta-LfO) 모두에서 일반화 성능을 향상시키기 위해.
- 최소한의 파라미터 업데이트로 뛰어난 성능을 달성하면서, 전면 미세조정 및 프롬프팅 방법을 능가하는 효율성을 유지하기 위해.
- 다양한 모델 크기와 훈련 작업 다양성 하에서 방법의 확장성과 강건성 탐색을 위해.
제안 방법
- HDT는 각 트랜스포머 블록에 경량 어댑터 모듈을 통합하여 사전 훈련된 결정 트랜스포머와 통합한다. 이 어댑터 모듈은 적응 과정에서 미세조정된다.
- 하이퍼넷워크는 소수의 예시를 기반으로 어댑터 모듈의 초기 파라미터를 생성하여 작업별 정보를 인코딩한다.
- 어댑터는 파라미터 오버헤드를 최소화하기 위해 블로킹(bottleneck) 구조를 사용하며, 적응 과정에서 기초 모델의 총 파라미터의 0.5%만 업데이트된다.
- 메타-IL에서는 어댑터를 전문가 예시를 사용한 지도 학습 방식으로 미세조정하고, 메타-LfO에서는 상태 정보만을 사용해 온라인 강화학습을 통해 업데이트한다.
- 하이퍼넷워크는 다양한 작업에서 훈련되어 새로운 작업으로의 일반화를 가능하게 하며, 전문가 액션 없이도 효과적인 초기화를 가능하게 한다.
- 이 프레임워크는 소수의 예시를 사용한 모방학습과 새로운 환경으로의 제로샷 전이 모두를 지원하며, 뛰어난 데이터 효율성을 보인다.

실험 결과
연구 질문
- RQ1하이퍼넷워크가 새로운 작업에서 정책 적응을 신속하고 효율적으로 가능하게 하기 위해 어댑터 파라미터를 효과적으로 초기화할 수 있는가?
- RQ2HDT의 성능은 데이터 효율성과 파라미터 효율성 측면에서 전면 미세조정 및 프롬프팅 기반 방법과 비교해 어떻게 되는가?
- RQ3전문가 액션이 제공되지 않는 상황, 즉 메타-LfO 설정에서 HDT가 새로운 작업으로 일반화할 수 있는가?
- RQ4모델 크기와 훈련 작업의 다양성이 HDT의 일반화 및 적응 성능에 어떤 영향을 미치는가?
- RQ5하이퍼넷워크가 어댑터 파라미터에 의미 있는 작업별 정보를 성공적으로 추출하고 인코딩하는가?
주요 결과
- 단 한 개의 전문가 예시만을 사용하고 기초 모델의 파라미터 0.5%만을 미세조정함으로써, HDT는 결정 트랜스포머의 전면 미세조정보다 새로운 작업에 더 빠르게 적응한다.
- 전문가 액션이 없는 메타-LfO 설정에서 HDT는 최신 기준보다 성공률에서 크게 앞서며, 강력한 일반화 능력을 입증한다.
- 시각화를 통해 다양한 작업 간에 구분 가능한 어댑터 파라미터 분포가 관찰되어, 하이퍼넷워크가 작업별 정보를 성공적으로 인코딩했다는 것을 입증한다.
- 어댑터의 블로킹 크기 또는 기초 DT의 모델 크기를 줄이면 수렴 속도가 느려지고 성능 저하가 발생하며, 특히 메타-LfO 설정에서 두드러진다.
- 훈련 작업의 다양성과 더 큰 모델 크기를 통해 HDT는 성공률 향상과 더 빠른 수렴을 보이며, 확장성을 확인한다.
- 메타-IL과 메타-LfO 모두에서 HDT는 프롬프팅 테이닝 및 IA3 기반의 미세조정 기준보다 뛰어난 성능을 보이며, 특히 성공률과 데이터 효율성에서 두각을 나타낸다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.