Skip to main content
QUICK REVIEW

[논문 리뷰] Agents and Devices: A Relative Definition of Agency

Laurent Orseau, Simon McGregor McGill|arXiv (Cornell University)|2018. 05. 31.
Reinforcement Learning in Robotics참고 문헌 14인용 수 8
한 줄 요약

이 논문은 관찰된 행동을 바탕으로 시스템이 목표 최적화를 하는 에이전트인지, 입력-출력 매핑을 하는 장치인지(formally) 평가하기 위한 베이지안 프레임워크를 제안한다. 에이전트에 대해서는 역강화학습, 장치에 대해서는 시퀀스 예측을 사용하여 베이즈의 정리에 따라 사후 확률을 계산하며, 목표 전환 행동과 비최적 경로조차도 적절한 사전분포를 사용하면 에이전트 유사 행동으로 해석될 수 있음을 보여준다.

ABSTRACT

According to Dennett, the same system may be described using a `physical' (mechanical) explanatory stance, or using an `intentional' (belief- and goal-based) explanatory stance. Humans tend to find the physical stance more helpful for certain systems, such as planets orbiting a star, and the intentional stance for others, such as living animals. We define a formal counterpart of physical and intentional stances within computational theory: a description of a system as either a device, or an agent, with the key difference being that `devices' are directly described in terms of an input-output mapping, while `agents' are described in terms of the function they optimise. Bayes' rule can then be applied to calculate the subjective probability of a system being a device or an agent, based only on its behaviour. We illustrate this using the trajectories of an object in a toy grid-world domain.

연구 동기 및 목표

  • 계산 시스템에서 관찰자에 따라 달라지는 에이전트와 장치의 구분을 공식화하기 위해.
  • 관찰된 행동을 바탕으로 시스템이 에이전트 또는 장치일 가능성의 주관적 확률을 계산하는 방법을 개발하기 위해.
  • 목표 전환 및 반응형 행동을 포함한 다양한 행동 경로를 포함한 격자도 환경에서 접근법을 검증하기 위해.
  • 목표가 변경되더라도, 전환 빈도가 적고 적절한 사전분포로 모델링된다면 에이전시가 유지될 수 있음을 보여주기 위해.
  • AI 및 강화학습 연구에 적합한 비인간 중심의 형식적 에이전시 정의를 제공하기 위해.

제안 방법

  • 시스템의 행동을 시간에 따라 변화하는 입력-출력 쌍 (x_t, y_t)의 시퀀스로 모델링한다.
  • 기계적 행동를 모델링하기 위해 입력-출력 함수 d의 가중치 합인 장치 혼합모형 M_d를 정의하며, 각 d는 사전 가중치 w_d를 가진다.
  • 관찰된 행동에서 가장 가능성이 높은 목표와 ε-그리디 정책을 추론하기 위해 역강화학습을 사용하는 에이전트 혼합모형 M_a를 정의한다.
  • 베이즈 정리에 따라 관찰된 궤적에 기반해 시스템이 에이전트일 사후확률 P(M_a | yx_{1:T})를 계산한다.
  • 장치 모형과 에이전트 모형에서 궤적의 로그우도(log-likelihood)를 비교하여 어느 설명이 더 가능성이 높은지 판단한다.
  • 에이전트가 행동 도중 목표를 변경할 수 있도록 허용하기 위해 목표 전환 사전분포 모형을 사용한다.

실험 결과

연구 질문

  • RQ1시스템의 행동이 얼마나 에이전트 유사(목표 최적화)인지 또는 장치 유사(기계적 입력-출력 매핑)인지 공식적으로 측정할 수 있는 방법은 무엇인가?
  • RQ2어느 정도의 목표 전환 행동을 보일 수 있더라도 여전히 에이전트로 분류될 수 있으며, 그러한 행동은 어떻게 모델링되어야 하는가?
  • RQ3벽을 따라 움직이기, 무작위로 움직이기, 비최적의 목표 향한 추구와 같은 다양한 행동 패턴들이 장치 모형과 에이전트 모형에서 얼마나 유사한지 비교할 수 있는가?
  • RQ4관찰된 궤적만을 사용하여 진정으로 에이전트 유사 행동인지, 반응형이며 목표가 없는 행동인지 구분할 수 있는가?
  • RQ5관찰자의 사전 지식이 에이전시의 사후확률에 어떤 영향을 미치며, 이를 계산적으로 실현 가능한 방식으로 공식화할 수 있는가?

주요 결과

  • 프레임워크는 격자도 환경에서 장치 유사 행동과 에이전트 유사 행동을 성공적으로 구분하며, 벽을 따라 움직이는 경로는 장치로, 목표 향한 경로는 에이전트로 더 잘 설명된다.
  • 비최적의 경로를 취하더라도 목표 향한 행동은, 특히 목표 전환 사전분포를 사용할 경우 장치 모형보다 에이전트 모형에서 더 높은 가능성을 가진다.
  • 무작위 행동은 둘 다 높은 음수의 로그우도(NLL)를 보이며, 이는 어느 설명에도 잘 맞지 않음을 의미하며, 이는 명백한 에이전시나 기계적 메커니즘이 없음을 반영한다.
  • 시스템이 목표를 전환할 경우(예: 마젠타 병풍에서 초록 병풍으로), 목표 전환 사전분포를 가진 에이전트 모형은 전환 없이 고정된 목표를 가진 모형보다 훨씬 더 좋은 적합도를 보이며, 사전분포의 구조가 중요함을 보여준다.
  • 행동이 목표 향한 방향성을 가지며 일관성이 있으면, 비록 비최적일지라도 에이전시의 사후확률이 증가하고, 반응형 또는 무작위 행동일 경우 감소한다.
  • 모형은 목표 전환이 드물고 사전분포에 명시적으로 반영된다면, 시스템이 목표 전환 동안에도 에이전트로 유지될 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.