Skip to main content
QUICK REVIEW

[논문 리뷰] EAGER: Asking and Answering Questions for Automatic Reward Shaping in Language-guided RL

Thomas Carta, Pierre‐Yves Oudeyer|arXiv (Cornell University)|2022. 06. 20.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 자연어 목표에서 질문 생성(QG)과 질의 응답(QA)을 통해 보조 목표를 자동으로 생성하는 언어 유도 강화 학습 방법 EAGER를 제안한다. 궤적 기반 부분 정보에 대한 자가 생성 질문에 대해 확신 있게 응답하는 것에 보상을 주어 전문가 간섭 없이 내재 보상을 형상화함으로써, 희박 보상, 장수평 작업에서 샘플 효율성을 향상시킨다.

ABSTRACT

Reinforcement learning (RL) in long horizon and sparse reward tasks is notoriously difficult and requires a lot of training steps. A standard solution to speed up the process is to leverage additional reward signals, shaping it to better guide the learning process. In the context of language-conditioned RL, the abstraction and generalisation properties of the language input provide opportunities for more efficient ways of shaping the reward. In this paper, we leverage this idea and propose an automated reward shaping method where the agent extracts auxiliary objectives from the general language goal. These auxiliary objectives use a question generation (QG) and question answering (QA) system: they consist of questions leading the agent to try to reconstruct partial information about the global goal using its own trajectory. When it succeeds, it receives an intrinsic reward proportional to its confidence in its answer. This incentivizes the agent to generate trajectories which unambiguously explain various aspects of the general language goal. Our experimental study shows that this approach, which does not require engineer intervention to design the auxiliary objectives, improves sample efficiency by effectively directing exploration.

연구 동기 및 목표

  • 장수평, 희박 보상 환경에서 언어 조건 강화 학습의 샘플 비효율성을 해결하기 위해.
  • 언어 유도 RL에서 전문가가 설계한 보조 목표나 보상 형상화가 필요 없도록 하기 위해.
  • 자연어 지시어에서 질문 생성을 통해 에이전트가 자율적으로 의미 있는 보조 목표를 생성할 수 있도록 하기 위해.
  • 자기 생성 질문에 대한 응답에 대한 확신 기반 내재 보상으로 탐색과 학습 효율성을 향상시키기 위해.
  • NLP 질문-응답 메트릭스에서 영감을 얻은 참조 없이 자동으로 보상 형상화하는 메커니즘 개발하기 위해.

제안 방법

  • 에이전트는 초기 언어 목표의 단어를 마스킹하여 질문 생성(QG) 모듈을 사용해 질문을 생성한다.
  • 질의 응답(QA) 모듈은 에이전트의 현재 궤적만을 사용하여 각 질문에 응답을 尝시도하며, 관측된 상태 시퀀스에 기반한 응답을 제공한다.
  • 에이전트는 정확한 응답에 대한 자신감 비례로 내재 보상을 받으며, 잘못된 양성 결과를 방지하기 위해 'no_answer' 옵션을 제공한다.
  • QA 모듈은 성공한 궤적 데이터셋으로 사전 훈련되어 부분 목표 정보에 대한 질문에 응답하는 데 익숙해진다.
  • 자기 생성 질문의 커리큘럼을 사용해 탐색을 유도하여, 언어 목표의 핵심 요소를 모순 없이 재구성할 수 있는 궤적을 햖थन한다.
  • QA 성공률이 0.56 이상을 유지하는 한 QA 성능에 대해 강건하며, QA가 더 신뢰성 있을수록 학습이 향상된다.

실험 결과

연구 질문

  • RQ1전문가 입력 없이 자연어 목표에서 유용한 보조 목표를 자동으로 생성할 수 있는가?
  • RQ2자기 생성 QA로 형상화된 내재 보상은 언어 유도 RL에서 샘플 효율성을 어떻게 향상시키는가?
  • RQ3QA 신뢰도는 EAGER 프레임워크 성능에 어떤 영향을 미치는가?
  • RQ4QA 모듈 설계 선택 사항—예를 들어 'no_answer' 옵션과 신뢰도 기반 보상—은 학습 효율성에 어떤 영향을 미치는가?
  • RQ5다양한 궤적 분포와 QA 품질을 가진 환경 간에 EAGER는 일반화 가능한가?

주요 결과

  • EAGER는 자가 생성 질문과 신뢰도 기반 응답을 통해 내재 보상을 형상화함으로써 언어 유도 RL에서 샘플 효율성을 향상시킨다.
  • QA 모듈의 성공률이 0.56 이상일 경우 더 빠른 학습을 달성하며, 다양한 QA 성능 수준에서도 학습 곡선이 안정화된다.
  • 'no_answer' 옵션이 포함된 QA 모듈과 신뢰도 기반 보상이 적용된 에이전트는 이진 또는 비신뢰도 기반 보상 기반 대비 유의미하게 높은 샘플 효율성을 보인다.
  • 노이즈를 추가한 광범위한 궤적 분포에서 훈련할 경우, 좁고 결정론적인 궤적 분포에서 훈련하는 것보다 더 빠른 학습이 이루어진다.
  • 제거 실험 결과, 'no_answer' 메커니즘과 신뢰도 기반 보상 모두 독립적으로 학습 속도와 안정성을 향상시킨다.
  • QA 성능이 열악한 경우에도 EAGER는 효과적이며, 불완전한 질문-응답 시스템에 대해 강건함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.