Skip to main content
QUICK REVIEW

[논문 리뷰] Extending rational models of communication from beliefs to actions

Theodore R. Sumers, Robert D. Hawkins|arXiv (Cornell University)|2021. 05. 25.
Topic Modeling참고 문헌 24인용 수 8
한 줄 요약

이 논문은 합리적 의사소통 모델에서 믿음 기반 및 행동 기반 목표를 통합하기 위한 새로운 프레임워크인 신호 전이대상(-signaling bandits-)을 제안한다. 청취자의 의사결정을 말하는 자의 추론에 통합함으로써, 복잡하고 불확실한 환경에서 더 진실성 있고 일반화 가능하며 행동에 효과적인 언어를 생성하는 통합된 말하는 자 모델을 도출한다. 시뮬레이션에서 순수하게 믿음 기반 또는 행동 기반 접근 방식보다 뛰어난 성능을 보인다.

ABSTRACT

Speakers communicate to influence their partner's beliefs and shape their actions. Belief- and action-based objectives have been explored independently in recent computational models, but it has been challenging to explicitly compare or integrate them. Indeed, we find that they are conflated in standard referential communication tasks. To distinguish these accounts, we introduce a new paradigm called signaling bandits, generalizing classic Lewis signaling games to a multi-armed bandit setting where all targets in the context have some relative value. We develop three speaker models: a belief-oriented speaker with a purely informative objective; an action-oriented speaker with an instrumental objective; and a combined speaker which integrates the two by inducing listener beliefs that generally lead to desirable actions. We then present a series of simulations demonstrating that grounding production choices in future listener actions results in relevance effects and flexible uses of nonliteral language. More broadly, our findings suggest that language games based on richer decision problems are a promising avenue for insight into rational communication.

연구 동기 및 목표

  • 이전에 별개이거나 혼동되어 왔던 합리적 의사소통 모델에서 믿음 기반 및 행동 기반 목표를 통합하기 위함.
  • 기존 모델이 현실 세계의 결과나 행동을 고려하지 않고 오직 믿음을 전달하는 데에만 집중한다는 한계를 해결하기 위함.
  • 말하는 자가 발화가 청취자의 믿음을 어떻게 형성하고, 궁극적으로 의사결정 맥락에서 행동에 영향을 주는지를 고려하여 의사결정 맥락에서 행동을 유도하는 통합된 프레임워크를 개발하기 위함.
  • 의사결정 맥락에서 미래의 청취자 행동에 기반한 의사소통이 더 관련성 있고 진실성 있으며 일반화 가능한 언어 사용을 이끌어내는지 조사하기 위함.
  • 클래식한 신호 게임을 다중 손잡이 기반 결정 문제로 일반화한 새로운 작업 파рад림인 '신호 전이대상(signaling bandits)'을 통해 모델을 검증하기 위함.

제안 방법

  • 스토캐스틱 보상이 있는 다중 손잡이 기반 결정 문제에 통합된 다중 손잡이 기반 결정 문제에 통합된 루이스 신호 게임을 확장한 새로운 작업 파라다임인 '신호 전이대상(signaling bandits)'을 제안한다.
  • 세 가지 말하는 자 모델을 개발한다: 믿음 기반 말하는 자(정보성 최대화), 행동 기반 말하는 자(기대 행동 유틸리티 최대화), 통합된 말하는 자(유도된 믿음을 통한 기대 유틸리티 최적화).
  • 기본적으로 합리적 언어 행위(RSA) 프레임워크를 사용하며, 믿음뿐 아니라 행동에 대한 청취자 유틸리티 함수까지 포함하도록 확장한다.
  • 온도 매개변수(β)를 가진 소프트맥스 의사결정 정책을 사용하여 말하는 자의 최적성 모델링을 가능하게 하며, 발화에 대한 확률적 선택을 허용한다.
  • 청취자의 추론 과정을 도입하여, 발화에 기반해 믿음을 갱신하고, 그 믿음에 기반해 기대 유틸리티를 최대화하는 행동을 선택한다.
  • 지역적 및 글로벌 의사결정 수준의 다양한 맥락에서 말하는 자 행동을 시뮬레이션하고, 진실성, 행동 최적성, 보상 등의 지표를 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1믿음 기반 및 행동 기반 말하는 자 모델은 의사결정 맥락에서 어떤 방식으로 발화 선택과 성능에 차이를 보이는가?
  • RQ2믿음 형성과 행동 결과를 통합한 통합된 말하는 자 모델이 순수하게 믿음 기반 또는 행동 기반 모델보다 더 효과적이고 진실한 의사소통을 가능하게 하는가?
  • RQ3미래의 청취자 행동에 기반한 의사소통이 더 일반화 가능하고 맥락에 강건한 언어 사용을 이끌어내는가?
  • RQ4풍부한 의사결정 환경에서 정보성과 행동 관련성 사이의 최적 균형은 어떻게 도출되는가?
  • RQ5청취자의 의사결정 수준(지역적 vs. 글로벌)이 말하는 자의 발화 구조와 진실성에 어떤 영향을 미치는가?

주요 결과

  • 통합된 말하는 자 모델은 지역적 및 글로벌 맥락 모두에서 모든 지표에서 믿음 기반 및 행동 기반 모델을 앞서며, 더 높은 기대 보상과 더 높은 행동 최적성을 달성한다.
  • 글로벌 맥락(시뮬레이션 3)에서 β→∞일 때, 통합된 말하는 자는 ⟨Green, 2⟩를 100% 확률로 진실된 발화로 생산하는 데에 수렴하지만, 행동 기반 말하는 자는 ⟨Green, 2⟩와 ⟨Circle, 2⟩ 사이에서 무관심하게 유지된다.
  • 행동 기반 말하는 자는 지역적 맥락에서 특히 믿음을 왜곡하는 잘못된 또는 과도하게 부풀린 발화(예: 오해의 신호)를 자주 생산하며, 이는 행동 결과를 향상시키지만 믿음을 손상시킨다.
  • 통합된 말하는 자는 기저의 보상 구조에 민감하게 반응하여, 다양한 미래 맥락에서 최적의 행동을 지원하는 진실성 있고 일반화 가능한 발화를 선호한다.
  • 고도의 최적성(β→∞)에서도 다수의 발화가 동일한 행동 결과를 낳을 경우 행동 기반 말하는 자는 진실된 메시지로 수렴하지 못하지만, 통합된 말하는 자는 이를 달성한다.
  • 믿음 기반 말하는 자는 모든 진실된 발화가 균일한 사전 확률 하에서 동일하게 정보성이 있으므로 β에 민감하지 않지만, 행동 관련 의사결정을 지원하지 못한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.