Skip to main content
QUICK REVIEW

[논문 리뷰] Contracting over persistent information

Wei Zhao, Claudio Mezzetti|arXiv (Cornell University)|2020. 07. 12.
Law, Economics, and Judicial Systems인용 수 6
한 줄 요약

이 논문은 전달 없이 또는 전달가능한 전달 없이도 시간에 따라 원하는 행동을 선택하도록 에이전트를 유인하기 위해 주체가 정보 공개를 사용하는 동적 프린시펄-에이전트 계약을 연구한다. 최적 계약은 원하는 행동이 정적 최적 반응이 되면 공개를 중단하거나, 유한 시간 내에 에이전트가 상태를 완전히 학습할 때까지 계속하는 것으로 나타났다. 핵심 기여는 믿음의 동적 변화와 사후 믿음의 마팅게일 조건을 고려한 최적의 정보 공개 정책의 완전한 특성화이다.

ABSTRACT

We consider a dynamic moral hazard problem between a principal and an agent, where the sole instrument the principal has to incentivize the agent is the disclosure of information. The principal aims at maximizing the (discounted) number of times the agent chooses a particular action, e.g., to work hard. We show that there exists an optimal contract, where the principal stops disclosing information as soon as its most preferred action is a static best reply for the agent or else continues disclosing information until the agent perfectly learns the principal's private information. If the agent perfectly learns the state, he learns it in finite time with probability one; the more patient the agent, the later he learns it.

연구 동기 및 목표

  • 전달, 해고, 직접 제약 조건을 사용할 수 없지만 정보 공개만을 통해 동적 계약을 연구하기 위한 것이다.
  • 에이전트가 주체의 가장 선호하는 행동을 선택하는 빈도를 최대화하는 최적의 공개 정책을 특성화하기 위한 것이다.
  • 에이전트의 믿음이 시간에 따라 변화하는 동적 정보 공개에서 믿음의 동적 변화 문제를 다루기 위한 것이다. 이 경우 에이전트의 사후 믿음은 마팅게일을 형성해야 한다.
  • 최적 계약이 원하는 행동이 정적 최적 반응이 되는 순간 정지하거나, 에이전트가 상태를 완전히 학습할 때까지 계속되는 것을 보여주기 위한 것이다.
  • 믿음의 진화와 약속된 유틸리티 제약 조건이 있는 동적 설득 문제에 대한 완전한 해답을 제공하기 위한 것이다.

제안 방법

  • 주체는 정보 공개 정책(계약)을 이행하여 이진 상태에 대한 정보가 언제, 어떻게 공개될지를 규정한다.
  • 모델은 에이전트의 계속 유틸리티와 변화하는 믿음을 상태 변수로 포함하며, 믿음이 시간에 따라 마팅게일을 형성해야 한다는 제약 조건이 포함되어 있다.
  • 해결 과정은 inccentive 제약 조건과 약속된 유틸리티 제약 조건을 포함한 벨만 방정식을 사용한 고정점 문제를 해결하는 것이다.
  • 공개가 중단되는 조건을 도출한다. 즉, 주체의 선호 행동이 에이전트에게 정적 최적 반응이 되는 순간이다.
  • 최적 정책을 정의한다. 이는 에이전트의 믿음이 선호 행동을 최적으로 만드는 순간 공개를 중단하거나, 에이전트가 상태를 확률 1로 학습할 때까지 계속하는 것이다.
  • 분석은 재귀적 방법을 사용하며, 최적 정책을 무작위 공개나 최초의 최적 솔루션과 같은 단순한 기준과 비교한다.

실험 결과

연구 질문

  • RQ1에이전트가 상태를 완전히 학습하기 전에 최적의 정보 공개가 언제 중단되는가?
  • RQ2믿음의 동적 변화와 사후 믿음의 마팅게일 성질이 최적의 정보 공개 정책 설계에 어떻게 영향을 미치는가?
  • RQ3에이전트의 내성성과 상태를 학습하는 데 걸리는 시간 사이의 관계는 무엇인가?
  • RQ4에이전트의 믿음이 선호 행동이 최적임을 보일 때조차도 전략적으로 정보를 유보함으로써 주체가 더 높은 수익을 올릴 수 있는가?
  • RQ5최적 정책은 무작위 공개나 최초의 최적 솔루션과 비교하여 어떻게 다른가?

주요 결과

  • 최적 계약은 주체의 가장 선호하는 행동이 에이전트에게 정적 최적 반응이 되는 순간 즉시 정보 공개를 중단하여, 추가 정보 비용 없이 효율성을 확보한다.
  • 공개가 계속되면, 에이전트는 유한한 시간 내에 상태를 확률 1로 학습하며, 학습 속도는 에이전트의 내성성에 따라 달라진다.
  • 최적 정책은 때로는 높은 비용 상태를 공개하여 선호 행동의 인지 비용을 줄이는 방식으로 기회비용의 비대칭성을 활용한다.
  • 특히 기회비용이 비대칭일 경우, 최적 정책은 무작위 공개보다 주체의 수익이 엄청나게 높다.
  • 에이전트의 믿음이 선호 행동이 정적으로 최적임을 보이는 임계값에 도달하면, 추가 공개는 불필요하며 정책은 종료될 수 있다.
  • 인centive 제약 조건을 무시한 이론적 문제의 해답은 최적 정책이 최초의 최적 솔루션과 일치하는지 확인하는 데 도움이 되는 기준을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.