Skip to main content
QUICK REVIEW

[논문 리뷰] Choice Set Misspecification in Reward Inference

Rachel Freedman, Rohin Shah|arXiv (Cornell University)|2021. 01. 19.
Reinforcement Learning in Robotics참고 문헌 8인용 수 4
한 줄 요약

이 논문은 보상 추론에서 선택 집합 오특정을 도입한다. 여기서 로봇은 인간이 선택할 수 있었던 피드백 옵션의 집합을 잘못 가정한다. 이 오특정을 다섯 가지 유형으로 분류하며, 일부 유형은 심각한 성능 저하를 초래함(예: 진짜 보상의 반대를 추론함)을 보이고, 다른 유형은 기대값에서 증명 가능한 중립성을 보이며, 이는 보다 견고한 보상 학습 시스템 설계를 가능하게 한다.

ABSTRACT

Specifying reward functions for robots that operate in environments without a natural reward signal can be challenging, and incorrectly specified rewards can incentivise degenerate or dangerous behavior. A promising alternative to manually specifying reward functions is to enable robots to infer them from human feedback, like demonstrations or corrections. To interpret this feedback, robots treat as approximately optimal a choice the person makes from a choice set, like the set of possible trajectories they could have demonstrated or possible corrections they could have made. In this work, we introduce the idea that the choice set itself might be difficult to specify, and analyze choice set misspecification: what happens as the robot makes incorrect assumptions about the set of choices from which the human selects their feedback. We propose a classification of different kinds of choice set misspecification, and show that these different classes lead to meaningful differences in the inferred reward and resulting performance. While we would normally expect misspecification to hurt, we find that certain kinds of misspecification are neither helpful nor harmful (in expectation). However, in other situations, misspecification can be extremely harmful, leading the robot to believe the opposite of what it should believe. We hope our results will allow for better prediction and response to the effects of misspecification in real-world reward inference.

연구 동기 및 목표

  • 보상 추론에서 새로운 오특정 원인을 규명하고 형식화하는 것: 인간의 피드백 선택 집합에 대한 잘못된 가정.
  • 로봇의 선택 집합과 인간의 선택 집합 간의 관계 및 최적 피드백의 위치에 기반해 선택 집합 오특정을 서로 다른, 실증적으로 구별 가능한 유형으로 분류하는 것.
  • 다양한 오특정 유형이 추론된 보상과 그에 따른 에이전트 성능(정규화 오차 및 믿음 정확도 포함)에 미치는 영향을 분석하는 것.
  • 모든 오특정이 동일하게 해로운 것은 아니며, 일부 유형이 기대값에서 증명 가능한 중립성을 가짐을 보여주는 것.
  • 유해한 오특정을 최소화할 수 있는 전략(예: 더 큰 로봇 선택 집합을 선호함)을 식별하여 더 견고한 보상 학습 시스템 설계에 기여하는 것.

제안 방법

  • 보상-합리적 암묵적 선택(RRiC) 프레임워크 내에서 선택 집합 오특정을 형식화하며, 인간의 피드백은 집합 C_H에서 추출되고, 로봇의 믿음은 C_R에서 추출된다.
  • 집합 관계(예: C_H ⊆ C_R, C_R ⊆ C_H)와 최적 피드백 c*가 두 집합에 대해 어디에 위치하는지에 기반해 다섯 가지 오특정 유형을 정의한다.
  • 로봇의 선택 확률을 모델링하기 위해 봄츠만 합리성과 합리성 매개변수 β를 사용한다.
  • 베이즈 정리에 기반한 보상 매개변수 θ에 대한 확률적 추론을 수행한다: P(θ|c_H, C_R) ∝ P(c_H|θ, C_R)P(θ), 여기서 P(c_H|θ, C_R)는 RRiC 모델을 통해 계산된다.
  • 정규화 오차(정확한 보상과 오특정 하에서 추론된 보상 간의 기대 보상 차이)로 성능을 평가한다.
  • 다양한 선택 집합 가정을 가진 격자 환경에서 실증 평가를 수행하며, 다양한 오특정 유형 하에서 추론된 믿음과 그에 따른 행동을 비교한다.

실험 결과

연구 질문

  • RQ1로봇이 인간 피드백 옵션의 선택 집합을 잘못 가정할 경우, 이는 추론된 보상과 그에 따른 에이전트 행동에 어떤 영향을 미치는가?
  • RQ2특정 유형의 선택 집합 오특정은 기대값에서 증명 가능한 중립성을 가지는가, 비록 잘못된 가정이더라도 말이다?
  • RQ3어떤 종류의 선택 집합 오특정이 가장 심각한 성능 저하를 초래하는가(예: 진짜 보상의 반대를 추론함)?
  • RQ4로봇의 선택 집합을 설계함으로써 해로운 오특정의 위험을 체계적으로 줄일 수 있는가?
  • RQ5선택 집합 오특정이 기대 성능에 영향을 주지 않는 조건은 언제이며, 이는 안전한 로봇 학습에 어떤 함의를 갖는가?

주요 결과

  • 선택 집합 오특정은 심각한 성능 저하를 초래할 수 있으며, 한 유형(B3)은 진짜 보상의 반대를 추론하여 높은 정규화 오차를 초래한다.
  • 반대로, 최적 피드백이 인간과 로봇의 선택 집합에 모두 포함되어 있고 로봇의 집합이 더 큰 경우(유형 A2), 오특정은 기대값에서 증명 가능한 중립성을 가지며, 기대 성능에 영향을 주지 않는다.
  • 인간의 실제 선택 집합이 로봇이 가정한 집합의 진부분집합인 경우, 특히 인간의 선택이 로봇의 확장된 집합 내에서 최적의 선택이 아닌 경우, 로봇이 보상 매개변수에 대한 믿음이 심각하게 왜곡될 수 있다.
  • 일부 경우에서는 오특정이 과신을 유도하며(예: 로봇의 선택 집합에 많은 열악한 선택지가 포함된 경우), 다른 경우에서는 과소신을 유도하며, 이는 오특정 유형에 따라 달라진다.
  • 실증 결과에 따르면, 인간의 선택 집합에 로봇의 집합에 포함되지 않은 선택지가 있고 최적 피드백이 로봇의 집합에는 있지만 인간의 집합에는 없는 유형 B3에서는, 로봇가 보상으로 진짜 보상의 반대를 최대화하는 것을 추론한다.
  • 연구 결과에 따르면, 로봇의 선택 집합을 인간의 것보다 크게 설계함(유형 A2를 선호함)하면 더 우호적인 오특정이 가능하며, 치명적인 추론 오류의 위험을 줄일 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.