[논문 리뷰] HIGhER : Improving instruction following with Hindsight Generation for Experience Replay
HIGhER는 실패한 트레이젝터리에 대해 자연어 히스토리 목표를 생성하여 강화학습에서 지시 수행을 향상시키는 새로운 방법을 제안한다. 이는 전문가의 지시 없이 경험 재생을 가능하게 한다. 성공적인 트레이젝터리에서 학습한 목표 매핑 모델을 활용해 실패한 트레이젝터리의 목표를 의미적으로 일관된 지시로 재라벨링함으로써, 전통적인 히스토리 경험 재생(HER)과 유사한 성능을 달성하면서도 인간의 시범이 필요 없게 된다.
Language creates a compact representation of the world and allows the description of unlimited situations and objectives through compositionality. While these characterizations may foster instructing, conditioning or structuring interactive agent behavior, it remains an open-problem to correctly relate language understanding and reinforcement learning in even simple instruction following scenarios. This joint learning problem is alleviated through expert demonstrations, auxiliary losses, or neural inductive biases. In this paper, we propose an orthogonal approach called Hindsight Generation for Experience Replay (HIGhER) that extends the Hindsight Experience Replay (HER) approach to the language-conditioned policy setting. Whenever the agent does not fulfill its instruction, HIGhER learns to output a new directive that matches the agent trajectory, and it relabels the episode with a positive reward. To do so, HIGhER learns to map a state into an instruction by using past successful trajectories, which removes the need to have external expert interventions to relabel episodes as in vanilla HER. We show the efficiency of our approach in the BabyAI environment, and demonstrate how it complements other instruction following methods.
연구 동기 및 목표
- 지시 조건 강화학습에서 보상이 작업을 완수하지 못하면 전혀 제공되지 않는 희박한 보상 문제를 해결하기 위해.
- 자연어 목표를 사용할 때 히스토리 경험 재생(HER)에서 실패한 트레이젝터리의 재라벨링에 인간 시범에 의존하지 않도록 하기 위해.
- 언어의 구성성과 트레이젝터리 일관성을 활용하여 언어 기반 인식과 내비게이션 정책을 함께 학습시키기 위해.
- 자기지도 히스토리 목표 생성이 지시 수행 환경에서 전문가 지도 HER의 성능을 따라할 수 있음을 보여주기 위해.
- 오직 환경 상호작용만으로 시작하여 확장 가능하고 일반화 가능한 지시 수행 접근법을 제공하기 위해.
제안 방법
- HIGhER는 성공적인 트레이젝터리만을 사용해 최종 상태에서 자연어 지시를 예측하는 목표 매핑 네트워크를 훈련시킨다.
- 실패가 발생하면, 실제 결과와 일치하는 생성된 지시로 에이전트의 트레이젝터리가 재라벨링되며, 이는 긍정적인 보상 신호를 생성한다.
- 재라벨링된 에피소드는 재생 버퍼에 저장되어, 성공적인 트레이젝터리뿐 아니라 의미적으로 타당한 재라벨링된 트레이젝터리로부터도 정책이 학습할 수 있도록 한다.
- 공간적 목표 재라벨링을 언어 기반 목표 생성으로 대체함으로써 HER를 언어 목표로 확장하여 외부 전문가가 필요 없도록 한다.
- 심층 Q-학습을 통해 정책와 함께 목표 매핑을 종합적으로 최적화함으로써 언어 이해와 행동 선택을 함께 최적화할 수 있도록 한다.
- 언어의 구성성에 의존하여 '빨간 물체를 아무거나 집어오기' 또는 '파란 것이 아닌 공을 가져오기'와 같은 다양한 의미 있는 지시를 생성할 수 있다.
실험 결과
연구 질문
- RQ1실패한 트레이젝터리에 대해 의미적으로 일관된 자연어 지시를 생성함으로써 지시 수행 강화학습의 샘플 효율성을 향상시킬 수 있는가?
- RQ2자기지도 히스토리 목표 생성이 언어 조건 강화 환경에서 전문가 지도 HER의 성능을 어느 정도 따라할 수 있는가?
- RQ3노이즈가 있거나 부정확한 언어 지도 상황에서 HIGhER는 표준 RL 기반 모델보다 어떻게 성능을 내는가?
- RQ4언어의 구성성과 트레이젝터리 일관성을 활용하면 목표 매핑기가 새로운 지시에 일반화할 수 있는가?
- RQ5언어 기반 인식과 내비게이션 정책을 함께 학습시키면 새로운 지시에 대해 더 나은 제로샷 일반화 성능을 달성할 수 있는가?
주요 결과
- HIGhER는 인간 시범이 전혀 없이 오직 환경 상호작용만을 기반으로 하여 BabyAI 환경에서 표준 히스토리 경험 재생(HER)과 유사한 성능을 달성한다.
- 실패한 에피소드에 대해 의미 있는 히스토리 지시를 생성함으로써 HIGhER는 지시 수행 작업에서 샘플 복잡도를 크게 감소시킨다.
- HIGhER는 노이즈와 부정확한 언어 지도 상황에서도 강건성을 보이며, 도전적인 지시 수행 시나리오에서 표준 DQN 및 HER 기반 모델을 능가한다.
- 목표 매핑기는 관찰된 트레이젝터리에서 '빨간 물체를 아무거나 집어오기' 또는 '파란 것이 아닌 공을 가져오기'와 같은 의미적으로 일관되고 다양한 지시를 생성하는 데 성공한다.
- 실험 결과에 따르면 HIGhER는 언어 기반 인식과 내비게이션 정책의 효과적인 공동 학습을 가능하게 하며, 새로운 지시에 대한 강력한 일반화 성능도 보여준다.
- 이 방법은 언어 외의 다른 모odal로도 일반화 가능하여, 시각-언어 또는 다중모odal 목표 공간으로의 확장 가능성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.