Skip to main content
QUICK REVIEW

[논문 리뷰] A Mental Model Based Theory of Trust

Zahra Zahedi, Sarath Sreedharan|arXiv (Cornell University)|2023. 01. 29.
Cognitive Science and Mapping인용 수 5
한 줄 요약

이 논문은 사용자가 AI 에이전트의 능력과 작업 성과에 대한 정서적 모델과 신념을 기반으로 인간의 신뢰를 정량화하는 정신 모델 기반의 신뢰 이론(MMbTT)을 제안한다. 인간 대상 실험을 통해 이 이론이 특히 전문성과 신뢰성과 같은 작업 특화 성분에서 신뢰 변화를 높은 정확도로 예측함을 입증하며, 동적 신뢰 변화를 포착하는 데 있어 기존의 자기 보고 척도보다 뛰어나다.

ABSTRACT

Handling trust is one of the core requirements for facilitating effective interaction between the human and the AI agent. Thus, any decision-making framework designed to work with humans must possess the ability to estimate and leverage human trust. In this paper, we propose a mental model based theory of trust that not only can be used to infer trust, thus providing an alternative to psychological or behavioral trust inference methods, but also can be used as a foundation for any trust-aware decision-making frameworks. First, we introduce what trust means according to our theory and then use the theory to define trust evolution, human reliance and decision making, and a formalization of the appropriate level of trust in the agent. Using human subject studies, we compare our theory against one of the most common trust scales (Muir scale) to evaluate 1) whether the observations from the human studies match our proposed theory and 2) what aspects of trust are more aligned with our proposed theory.

연구 동기 및 목표

  • 신뢰 인식 기반의 심리학적으로 타당하고 계산적으로 정형화된 인간의 AI 에이전트에 대한 신뢰 이론을 개발하여, 신뢰 인식 의사결정을 지원한다.
  • 자기 보고 척도와 행동적 신호와 같은 기존의 신뢰 추론 방법의 한계를 보완하기 위해, 사용자의 에이전트에 대한 정신 모델에 기반한 신뢰를 제안한다.
  • 인지 모델링 프레임워크를 활용하여, 신뢰 변화, 적절한 수준의 신뢰, 인간이 AI 에이전트에 얼마나 의존하는지를 정형화한다.
  • 통제된 인간 대상 실험을 통해 기존의 신뢰 척도(예: Muir 척도)와 비교하여 이론의 예측 능력을 평가한다.
  • 미래의 신뢰 인식 AI 시스템 개발을 가능하게 하여, 사용자의 정신 모델에 기반한 설명 가능하고 해석 가능한 행동을 생성하도록 한다.

제안 방법

  • 사용자의 AI 에이전트에 대한 정신 모델($\mathbb{M}^{R}_{h}$)과 최적의 작업 성과 모델($\mathcal{M}^{*}_{h}$)을 기반으로 신뢰를 함수로 정의한다.
  • 에이전트의 성공 가능성에 대한 인식 변화를 기반으로 신뢰 변화를 모델링하며, 에이전트 모델($\mathcal{M}^{R}$) 또는 설명의 업데이트를 통해 이를 반영한다.
  • 적절한 수준의 신뢰를 사용자의 작업 모델과 에이전트의 모델 간의 일치도 함수로 정의한다.
  • 직접적인 자기 보고에 의존하지 않고, 사용자 기대와 에이전트 행동 간의 인지 일관성을 활용하여 신뢰 수준을 계산적 프레임워크로 추론한다.
  • 에이전트의 성공 가능성에 대한 제어된 업데이트를 적용한 인간 대상 실험을 수행하여 전문성, 예측 가능성, 신뢰성, 믿음, 총합 신뢰 등의 성분별로 신뢰 변화를 측정한다.
  • MMbTT 프레임워크의 예측 결과를 Muir 신뢰 척도에 대한 응답과 비교하여 정확성과 인간의 신뢰 인식과의 일치도를 검증한다.

실험 결과

연구 질문

  • RQ1AI 에이전트의 인식된 신뢰성이 조작될 때, 정신 모델 기반의 신뢰 이론(MMbTT)이 인간의 신뢰 변화를 어느 정도 정확히 예측할 수 있는가?
  • RQ2MMbTT 프레임워크는 Muir 질문지와 같은 기존의 자기 보고 신뢰 척도와 얼마나 잘 일치하는가?
  • RQ3전문성, 예측 가능성, 신뢰성 등의 신뢰 성분 중 어떤 것이 MMbTT 프레임워크에 의해 가장 정확하게 예측되는가?
  • RQ4예측 가능성과 같은 일부 신뢰 성분이 신뢰 업데이트에 대해 일관되지 않은 반응을 보이는 이유는 무엇이며, 이는 현재의 신뢰 측정 도구에 대한 어떤 시사점을 제공하는가?
  • RQ5MMbTT 프레임워크는 사용자의 정신 모델에 기반하여 행동과 설명을 조정하는 신뢰 인식 AI 시스템 설계의 기초로 활용될 수 있는가?

주요 결과

  • 긍정적 업데이트 그룹에서 총합 신뢰가 통계적으로 유의미하게 증가함(t(40) = -3.46, p < 0.001)을 확인하여, 성공 가능성 증가가 신뢰를 높인다는 가설을 지지함.
  • 전문성(t(40) = -4.09, p = 0.0001), 신뢰성(t(40) = -3.85, p = 0.0002), 믿음(t(40) = -2.919, p = 0.003), 총합 신뢰(t(40) = -2.084, p = 0.02) 성분 모두 긍정적 업데이트 후 유의미한 증가를 보임.
  • 예측 가능성 성분은 통계적으로 유의미한 변화 없음(t(40) = -0.63, p = 0.266)을 보여, 성공 가능성 업데이트에도 불구하고 사용자가 로봇의 행동에 대해 불확실성을 유지함.
  • 부정적 업데이트 그룹에서는 전문성만 통계적으로 유의미한 감소를 보임(t(40) = -3.21, p = 0.001), 예측 가능성 및 총합 신뢰 성분은 유의미한 변화 없음.
  • 예측 가능성 수준이 높은 상황에서 전문성 감소에도 불구하고 총합 신뢰에 유의미한 변화가 없음을 고려할 때, 현재의 신뢰 설문지가 동적 신뢰 이동을 충분히 반영하지 못할 수 있음.
  • 결과적으로, 사용자의 신뢰는 추상적인 에이전트 행동보다는 구체적인 작업 결과에 연결된 질문일 때 더 정확히 예측됨을 시사하며, 신뢰 설문지의 내용은 일반적인 것이 아니라 작업에 특화되어야 함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.