Skip to main content
QUICK REVIEW

[논문 리뷰] Learning from Ambiguous Demonstrations with Self-Explanation Guided Reinforcement Learning

Yan Zha, Lin Guan|arXiv (Cornell University)|2021. 10. 11.
Explainable Artificial Intelligence (XAI)참고 문헌 35인용 수 4
한 줄 요약

이 논문은 인간의 모호한 지시에서 학습을 향상시키기 위해 에이전트가 작업에 관련된 물체 간 관계(예: 공간적 또는 색상 기반의 술어)를 자기 설명(self-explanations)으로 추론하도록 하는 자기 설명을 유도하는 강화학습 프레임워크인 SERLfD를 제안한다. GAN-IRL에 자기 설명 예측기(SE-Net)를 통합함으로써, 특히 모호하거나 노이즈가 있는 지시가 있는 경우 정책 학습의 안정성과 성능이 향상되며, 기존의 표준 RLfD 기준선을 능가한다.

ABSTRACT

Our work aims at efficiently leveraging ambiguous demonstrations for the training of a reinforcement learning (RL) agent. An ambiguous demonstration can usually be interpreted in multiple ways, which severely hinders the RL-Agent from learning stably and efficiently. Since an optimal demonstration may also suffer from being ambiguous, previous works that combine RL and learning from demonstration (RLfD works) may not work well. Inspired by how humans handle such situations, we propose to use self-explanation (an agent generates explanations for itself) to recognize valuable high-level relational features as an interpretation of why a successful trajectory is successful. This way, the agent can provide some guidance for its RL learning. Our main contribution is to propose the Self-Explanation for RL from Demonstrations (SERLfD) framework, which can overcome the limitations of traditional RLfD works. Our experimental results show that an RLfD model can be improved by using our SERLfD framework in terms of training stability and performance.

연구 동기 및 목표

  • 모호한 인간 지시에서 강화학습 에이전트를 훈련시키는 과제를 해결하기 위해, 다수의 해석이 가능한 상황에서 안정적이고 효율적인 학습을 방해하는 요소를 제거하는 것.
  • 지시가 노이즈가 있거나 명확한 작업 관련 신호가 부족할 경우 실패하는 기존 RLfD 방법의 한계를 극복하는 것.
  • 에이전트가 작업에 관련된 물체 간 관계를 식별하는 자기 설명을 생성함으로써 인간과 유사한 내省(introspection)를 시뮬레이션하는 것.
  • 명시적 애너테이션 없이도 복잡한 실제 세계의 로봇 작업에서 명시적 운동 행동과 암시적 관계 지식을 모두 포함하는 상황에서 샘플 효율성과 정책 성능을 향상시키는 것.
  • 명시적 레이블이 필요 없이 도메인 술어에 대한 배경 지식을 활용하여 지시의 해석을 안내하는 프레임워크를 개발하는 것.

제안 방법

  • 생성적 적대적 역강화학습(GAN-IRL)과 비선형 자기 설명 예측기(SE-Net)를 결합한 자기 설명 유도 RL 프레임워크(SERLfD)를 도입하여 원시 관측치에서 작업에 관련된 술어 유용도를 추론한다.
  • SE-Net을 훈련시켜 지시 트레이제터리의 기반으로 상징적 술어(예: 'block_at_yellow', 'ring_at_blue')의 유용도 가중치를 예측하도록 하여, 에이전트가 작업 성공에 가장 관련이 깊은 관계를 식별할 수 있도록 한다.
  • 예측된 자기 설명을 정책 학습을 안내하기 위해 에이전트의 상태 또는 보상 함수에 통합함으로써 일반화 능력을 향상시키고 노이즈 또는 모호한 지시에 대한 민감도를 감소시킨다.
  • GAN-IRL의 판별기(discriminator)는 성공적이고 실패한 트레이제터리를 구분하도록 설계되며, SE-Net이 제공하는 해석 신호를 통해 구분 능력과 정책 최적화 성능을 향상시킨다.
  • 공통된 도메인 술어 어휘와 분류기들을 활용하여 상징적 관계를 시각적 관측치에 기반하게 하여 원시 감각 입력에 대한 상징적 추론을 가능하게 한다.
  • 에이전트가 성공적인 지시와 일치하는 설명을 생성하도록, 자기 설명 예측기(SE-Net)를 정책과 함께 적대적 모방 학습(adversarial imitation learning) 방식으로 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1자기 설명 메커니즘이 모호한 인간 지시에서 학습하는 강화학습 에이전트의 안정성과 성능을 향상시킬 수 있는가?
  • RQ2명시적 레이블 없이도 비전문가가 제공한 비정형 지시에서 작업에 관련된 물체 간 관계(예: 공간적 또는 색상 기반 술어)를 에이전트가 어떻게 추론할 수 있는가?
  • RQ3자기 설명을 보상 또는 상태 공간에 통합할 경우 샘플 효율성과 일반화 능력 향상에 어느 정도 기여하는가?
  • RQ4자기 설명은 같은 지시에 대해 충돌하는 해석(예: 색상 또는 위치 기반으로 물체를 목표 영역에 할당하는 것)을 어떻게 해소하는가?
  • RQ5SE-Net은 복잡한 로봇 작업에서 인과적으로 중요한 관계(예: 'block_at_yellow'은 'block_at_L1'보다 우선)를 효과적으로 식별하고 우선순위를 정할 수 있는가?

주요 결과

  • SERLfD 프레임워크는 특히 모호한 지시가 있는 환경에서 표준 RLfD 기준선에 비해 훈련 안정성과 최종 성능을 크게 향상시켰다.
  • Robot-Push 도메인에서 SACfD+SE 및 TD3fD+SE 모델은 'block_at_yellow'과 'ring_at_blue'과 같은 작업에 관련된 술어를 우선시하여 인간의 의도와 일치하는 행동을 학습했다. 이는 지시가 모호하더라도 성립하였다.
  • Robot-Remove-and-Push 도메인에서 모델들은 'is_cube_pushedTo_blue' 및 'is_cylinder_pushedTo_yellow'과 같은 고유용도 술어를 정확히 식별하여 복잡한 조작 작업에서 효과적인 행동을 유도했다.
  • 이산형 팩맨 도메인에서 SE-Nets가 통합된 강화학습 에이전트는 베이스라인 방법을 능가했으며, 최적의 귀신 포획을 위해 펠릿 소비 타이밍을 개선한 의사결정 능력을 보였다.
  • 자기 설명 예측기(SE-Net)는 시간이 지남에 따라 관련 술어에 더 높은 유용도 가중치를 부여하는 것을 성공적으로 학습했으며, 작업 진행에 따라 덜 관련된 관계에서 더 작업 중심적인 관계로 예측이 이동하는 경향을 보였다.
  • 자기 설명의 시각화 결과는 모델이 작업에 관련된 관계에 대한 해석을 동적으로 조정함을 확인했으며, 예를 들어 나중 단계에서 목표가 하나만 남아 있을 경우 'ring_at_L1'을 'ring_at_blue'보다 우선시하는 경향을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.