Skip to main content
QUICK REVIEW

[논문 리뷰] Maximizing Information Gain in Partially Observable Environments via Prediction Reward

Yash Satsangi, Sungsu Lim|arXiv (Cornell University)|2020. 05. 11.
Domain Adaptation and Few-Shot Learning참고 문헌 46인용 수 4
한 줄 요약

이 논문은 예측 보상(prediction reward)을 믿음 기반 정보 수익의 대체 지표로 사용하여 부분적으로 관찰 가능한 환경에서 정보 수익을 최대화하는 모델 자유형 강화학습 접근법인 딥 앤티시페이터리 네트워크(DANs)를 제안한다. 이는 이론적으로 예측 정확도 최적화가 음의 엔트로피(정보 수익) 최대화를 근사함을 보이며, 명시적 믿음 추론 없이도 효율적인 딥 RL 기반 능동적 인식을 가능하게 한다. 센서 선택 및 시각적 주의 작업에서의 성공적인 성능을 입증하였다.

ABSTRACT

Information gathering in a partially observable environment can be formulated as a reinforcement learning (RL), problem where the reward depends on the agent's uncertainty. For example, the reward can be the negative entropy of the agent's belief over an unknown (or hidden) variable. Typically, the rewards of an RL agent are defined as a function of the state-action pairs and not as a function of the belief of the agent; this hinders the direct application of deep RL methods for such tasks. This paper tackles the challenge of using belief-based rewards for a deep RL agent, by offering a simple insight that maximizing any convex function of the belief of the agent can be approximated by instead maximizing a prediction reward: a reward based on prediction accuracy. In particular, we derive the exact error between negative entropy and the expected prediction reward. This insight provides theoretical motivation for several fields using prediction rewards---namely visual attention, question answering systems, and intrinsic motivation---and highlights their connection to the usually distinct fields of active perception, active sensing, and sensor placement. Based on this insight we present deep anticipatory networks (DANs), which enables an agent to take actions to reduce its uncertainty without performing explicit belief inference. We present two applications of DANs: building a sensor selection system for tracking people in a shopping mall and learning discrete models of attention on fashion MNIST and MNIST digit classification.

연구 동기 및 목표

  • 정보 수익이 믿음 상태에 의존하는 부분적으로 관찰 가능한 환경에 딥 강화학습을 적용하는 데 도전하는 데 목적을 두며.
  • 비용이 많이 드는 명시적 믿음 추론을 피하기 위해, 예측 보상으로 믿음 기반 정보 수익을 이론적으로 근거 있는 방식으로 근사하는 방법을 제공하며.
  • 시각적 주의, 질의 응답, 내재적 동기 등 서로 다른 분야를 정보 수익 최대화를 통한 공통 기반으로 통합하며.
  • 실시간이며 연속적인 환경인 센서 선택 및 이미지 분류와 같은 환경에서 에이전트가 불확실성을 능동적으로 줄일 수 있도록 딥 러닝 프레임워크(DANs)를 개발하며.
  • 센서 선택 및 주의 작업에서의 실험적 검증을 통해 기존 기준 대비 향상된 성능을 보이며.

제안 방법

  • 믿음의 임의의 볼록 함수(예: 음의 엔트로피)를 최대화하는 것은 예측 보상 최대화로 근사될 수 있으며, 정확한 오차 한계가 이론적으로 유도됨을 제안한다.
  • 정보 수익의 대체 지표로 예측 보상의 개념을 도입하며, 알려지지 않은 변수를 올바르게 예측하면 +1을, 그렇지 않으면 0을 부여한다.
  • 기대 예측 보상과 음의 엔트로피(정보 수익) 사이의 정확한 관계를 유도함으로써 오차 분석 및 대체 보상 최적화가 가능해진다.
  • 예측 보상으로 탐색과 불확실성 감소를 이끄는 예측기와 정책을 동시에 학습하는 모델 자유형 강화학습 아키텍처인 딥 앤티시페이터리 네트워크(DANs)를 개발한다.
  • 정적 분류 작업과 달리 시간이 지남에 따라 변화하는 알려지지 않은 변수(예: 사람의 위치)를 다루는 지속적 학습 설정에 DANs를 적용한다.
  • 깊이 신경망을 사용해 관측치에서 알려지지 않은 변수를 예측하며, 정책은 예측 정확도를 최대화하도록 정책 기반 강화학습 방법으로 학습된다.

실험 결과

연구 질문

  • RQ1예측 보상은 부분적으로 관찰 가능한 환경에서 정보 수익의 효과적이고 이론적으로 타당한 대체 지표가 될 수 있는가?
  • RQ2예측 보상 최대화와 정보 수익 최대화(음의 엔트로피) 사이의 정확한 오차는 무엇인가?
  • RQ3명시적 믿음 추론 없이도 딥 강화학습 에이전트가 불확실성을 줄일 수 있는가?
  • RQ4제안된 방법은 시각적 주의, 질의 응답, 내재적 동기 등 서로 다른 분야를 정보 최대화 원리의 공통 원리 아래 통합할 수 있는가?
  • RQ5DAN 아키텍처는 센서 선택 및 시각적 주의와 같은 능동적 인식 작업에서 기존 방법보다 우수한 성능을 보일 수 있는가?

주요 결과

  • 기대 예측 보상은 정보 수익의 하한을 제공하며, 볼록 쌍대성((convex duality))을 사용해 이 둘 사이의 간격을 정확히 특성화하였다.
  • 적절히 예측 작업을 설계함으로써 예측 보상 최대화와 정보 수익 최대화 사이의 오차를 최소화할 수 있어 효과적인 근사가 가능하다.
  • 쇼핑몰에서 사람을 추적하는 센서 선택 과제에서 DANs는 모델 기반 기준 대비 추적 정확도 및 정보 수익 측면에서 최고 성능을 기록하였다.
  • 패션 MNIST 및 MNIST 숫자 분류 과제에서 DANs는 고정 크기의 구간을 사용함에도 불구하고 정보가 많은 이미지 영역에 집중하는 이산적 주의 메커니즘을 학습하여 분류 정확도를 향상시켰다.
  • 이 방법은 명시적 믿음 상태 추정 또는 수작업으로 만든 세계 모델이 필요 없이 연속적이고 동적인 환경에서 모델 자유형 딥 RL을 통한 능동적 인식을 가능하게 하였다.
  • 이론적 프레임워크는 엔트로피를 초월해 믿음의 임의의 볼록 함수로 일반화되어, 더 넓은 불확실성 최소화 문제에 적용 가능성을 확장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.