Skip to main content
QUICK REVIEW

[논문 리뷰] Tell me why! Explanations support learning relational and causal structure

Andrew K. Lampinen, Nicholas Roy|arXiv (Cornell University)|2021. 12. 07.
Topic Modeling인용 수 9
한 줄 요약

이 논문은 복잡한 환경에서 관계적이고 인과적 구조를 학습하는 데 있어, 자연어 설명을 예측하도록 훈련하는 것—단순히 관찰하는 것보다—강화학습 에이전트의 능력을 크게 향상시킨다는 것을 입증한다. 설명을 예측함으로써 에이전트는 분포 외로의 일반화 능력을 높이고, 부적절한 상관관계를 피하며, 심지어 인과적 간섭을 수행하는 법을 학습하게 되어, 이상 탐지 및 혼란스러운 인과 작업에서 기준 모델을 능가한다.

ABSTRACT

Inferring the abstract relational and causal structure of the world is a major challenge for reinforcement-learning (RL) agents. For humans, language--particularly in the form of explanations--plays a considerable role in overcoming this challenge. Here, we show that language can play a similar role for deep RL agents in complex environments. While agents typically struggle to acquire relational and causal knowledge, augmenting their experience by training them to predict language descriptions and explanations can overcome these limitations. We show that language can help agents learn challenging relational tasks, and examine which aspects of language contribute to its benefits. We then show that explanations can help agents to infer not only relational but also causal structure. Language can shape the way that agents to generalize out-of-distribution from ambiguous, causally-confounded training, and explanations even allow agents to learn to perform experimental interventions to identify causal relationships. Our results suggest that language description and explanation may be powerful tools for improving agent learning and generalization.

연구 동기 및 목표

  • 복잡한 환경에서 언어 설명이 깊이 있는 강화학습 에이전트가 추상적인 관계적 및 인과적 구조를 학습하는 데 도움이 될 수 있는지 조사하는 것.
  • 단순히 설명을 관찰하는 것보다 설명을 예측함으로써 학습과 일반화가 향상되는지 검토하는 것.
  • 혼란스러운 훈련 환경에서 쉽게 학습 가능한 특징에 대한 편향을 극복하는 데 설명이 어떻게 기여하는지 규명하는 것.
  • 설명이 인과적 구조를 식별하기 위해 실험적 간섭을 수행하는 데 도움이 되는지 평가하는 것.
  • 예시로, 추상화, 인과적 연결 등 설명의 다양한 요소가 향상된 성능에 기여하는 방식을 탐색하는 것.

제안 방법

  • 에이전트는 정책 네트워크와 가치 함수를 사용하여 2차원 및 3차원 환경에서 딥 강화학습으로 훈련된다.
  • 언어 헤드는 행동, 관찰, 작업 구조 간의 관계를 설명하는 자연어 설명을 예측하도록 훈련된다.
  • 설명은 '오븐을 켜면 빵을 굽기 위해 따뜻해진다'처럼 행동과 추상적 작업 목표를 연결하는 언어 문자열로 정의된다.
  • 인간 애너테이션 또는 합성된 설명 데이터를 사용하여 교차 엔트로피 손실을 기반으로 지도학습 방식으로 설명 예측을 훈련한다.
  • 일반화 능력은 인과적 특징이 부적절한 특징과 분리된 분포 외 테스트 세트에서 평가된다.
  • 인과적 간섭 작업은 변수를 조작하여 의존성을 테스트하는 등의 행동을 선택하고 실행하는 것을 요구한다.

실험 결과

연구 질문

  • RQ1강화학습 작업에서 언어 설명을 예측하도록 훈련하는 것이 관계적 구조 학습 능력을 향상시키는가?
  • RQ2설명을 예측하는 것이 설명을 관찰하거나 언어 감독 없이 훈련하는 것보다 분포 외 일반화 능력이 뛰어나게 되는가?
  • RQ3설명의 다양한 구성 요소(예: 인과적 연결, 추상적 서술)가 학습 및 일반화에 기여하는 방식은 무엇인가?
  • RQ4설명 예측 훈련을 통해 에이전트가 인과적 구조를 식별하기 위해 실험적 간섭을 수행하는 법을 학습할 수 있는가?
  • RQ5혼란스러운 인과적 환경에서 설명이 에이전트가 부적절한 상관관계를 학습하는 것을 어느 정도 막는가?

주요 결과

  • 혼란스러운 인과적 작업에서 특히, 분포 외로의 평가에서 기준 모델에 비해 설명 예측을 훈련한 에이전트가 유의미하게 더 뛰어난 일반화 능력을 보였다.
  • 예측 기반 설명 훈련은 훈련 기간 동안 보상과 완벽하게 관련된 부적절한 특징에 대한 의존도를 감소시켰다. 이러한 특징은 평가에서는 실패하였다.
  • 설명을 예측한 에이전트는 인과적 구조를 식별하기 위해 실험적 간섭을 수행하는 법을 학습했으며, 이는 인과적 사고의 메타학습을 보여주었다.
  • 설명 예측이 단순한 관찰보다 더 큰 이점을 제공했으며, 이는 예측 학습이 내부 표현을 형성하는 데 기여한다는 것을 시사한다.
  • 설명은 혼란스러운 특징을 분리하고 다양한 관계적 및 인과적 작업에서 더 견고하고 일반화 가능한 정책을 형성하는 데 기여했다.
  • 기본 인과적 구조가 없더라도 설명 예측은 모호하고 복잡한 작업에서 성능을 향상시키는 데 도움이 되는 추상화를 형성하는 데 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.