[논문 리뷰] Are we measuring trust correctly in explainability, interpretability, and transparency research?
이 논문은 현재 설명 가능성, 해석 가능성, 투명성(XIT) 연구에서 신뢰를 측정하는 데 사용되는 방법을 비판하며, 자가 보고 신뢰 척도에만 의존할 경우 모델의 품질에 비례하는 신뢰가 되었는지 파악하지 못한다는 점을 주장한다. 본 논문은 행동 과제를 통한 실제 신뢰의 표현을 통합하고, 모델의 신뢰성 수준을 조작하여 XIT 방법이 보다 적절하게 校정된 신뢰를 향상시키는지 평가할 수 있도록 제안한다. 이를 위해 인간-AI 상호작용 연구에서 더 엄밀하고 행동 기반의 신뢰 측정을 발전시키기 위한 세 가지 실용적 평가 방법을 제시한다.
This paper presents an argument for why we are not measuring trust sufficiently in explainability, interpretability, and transparency research. Most studies ask participants to complete a trust scale to rate their trust of a model that has been explained/interpreted. If the trust is increased, we consider this a positive. However, there are two issues with this. First, we usually have no way of knowing whether participants should trust the model. Trust should surely decrease if a model is of poor quality. Second, these scales measure perceived trust rather than demonstrated trust. This paper showcases three methods that do a good job at measuring perceived and demonstrated trust. It is intended to be starting point for discussion on this topic, rather than to be the final say. The author invites critique and discussion.
연구 동기 및 목표
- 현재 XIT 연구에서 모델의 실제 신뢰성과 일치하는지 검증하지 않고 자가 보고 신뢰 척도에만 의존하는 문제를 부각시키는 것.
- 인식된 신뢰(자가 보고)만으로는 부족하며, XIT 방법이 적절하게 校정된 신뢰를 이끌어내는지 평가하기 위해 행동적 선택을 통한 실제 신뢰를 측정해야 한다는 점을 주장하는 것.
- 기본 모델의 신뢰성을 조작하고, XIT 방법이 인식된 신뢰와 실제 모델 신뢰도 간의 일치를 향상시키는지 평가하기 위한 프레임워크를 제안하는 것.
- 단일 시점 평가에 의존하는 대신, 시간에 따라 변화하는 신뢰의 역동성을 추적하는 종단적 연구를 장려하는 것.
- XIT 연구에서의 신뢰 평가 방법을 개선하기 위한 공동체 차원의 논의를 시작하고, 방법론적 엄밀성과 모델 품질에 대한 보정 필요성을 강조하는 것.
제안 방법
- 참가자가 AI에게 작업을 위탁할 것인지 결정해야 하는 행동 기반의 신뢰 과제(예: 신뢰 낙하 게임 또는 경제 게임)를 사용하여 행동을 통해 신뢰를 표현하도록 하는 것.
- 모델의 실제 신뢰성(예: 정확도 또는 신뢰성 수준을 변화시켜)을 조작하여, 모델 품질에 따라 신뢰가 증가하거나 감소해야 하는 조건을 조성하는 것.
- 표준화된 리커트 척도 설문지를 통한 인식된 신뢰와 행동적 결정을 통한 실제 신뢰를 결합하여, XIT 방법이 인식된 신뢰와 현실 간의 일치를 향상시키는지 평가하는 것.
- 기존의 신뢰 측정 도구(예: IMPACTS 모델, Jian 등이 제안한 신뢰 체크리스트)를 활용하지만, 모델의 신뢰성을 체계적으로 변화시키는 통제된 실험 설계 내에서 적용하는 것.
- 실제 금전적 이권이 관련된 인cent라이즈된 의사결정 과제를 통합하여 생태학적 타당성을 높이고, 신뢰 보고에 대한 반응 편향을 줄이는 것.
- 신뢰가 시간에 따라 어떻게 변화하는지 추적할 수 있도록 종단적 연구를 설계하여, XIT 방법의 장기적 영향과 보정된 신뢰 및 신뢰 기반 행동에 대한 영향을 평가하는 것.
실험 결과
연구 질문
- RQ1현재의 XIT 평가 방법이 모델의 실제 신뢰성과 일치하는 보정된 신뢰를 어느 정도 측정하는가? (보정된 신뢰: 모델의 실제 신뢰성에 비례하는 신뢰)
- RQ2XIT 연구에서 실제 신뢰를 신뢰성 있게 측정하는 방법은 무엇이며, 어떤 행동 과제가 이 개념을 가장 잘 반영하는가?
- RQ3모델의 실제 신뢰성을 조작함으로써 XIT 방법이 인식된 신뢰와 실제 신뢰 간의 보정을 향상시키는지 확인할 수 있는가?
- RQ4XIT 연구에서 자가 보고 신뢰 척도의 한계는 무엇이며, 과신 또는 과소신을 파악하지 못하는 이유는 무엇인가?
- RQ5종단적 평가 설계는 인간-AI 팀에서의 신뢰 역동성을 이해하는 데 어떻게 기여할 수 있으며, 특히 XIT 간섭 조치에 대한 반응에서 어떤 영향을 미치는가?
주요 결과
- 대부분의 현재 XIT 연구는 모델의 품질에 비례하는 신뢰가 되었는지 검증하지 않고 자가 보고 신뢰 척도에만 의존하기 때문에, 실제 모델의 신뢰성과 일치하는지 확인하지 못한다.
- 인식된 신뢰 척도만으로는 신뢰가 적절한지 판단할 수 없다. 잘못된 설명으로 인해 낮은 품질의 모델을 과신할 수 있으며, 이는 설문조사로는 파악되지 않는 문제이다.
- 행동 과제(예: 위탁 결정)를 통한 실제 신뢰 측정은 자가 보고보다 실제 신뢰 기반 행동을 반영하기 때문에 더 타당한 측정 방법이다.
- 논문은 신뢰 평가에 모델의 신뢰성을 조작하는 것이 필수적임을 입증하며, XIT 방법이 신뢰성 있는 모델에서만 신뢰를 증가시키는지 여부를 평가할 수 있도록 한다.
- 기존의 신뢰 낙하 게임 및 인센티브가 부여된 경제 게임은 실제 신뢰를 측정하는 데 효과적이며, XIT 평가 프레임워크에 통합되어야 한다.
- 논문은 현재의 평가 관행가 부족하다고 결론 내리며, 특히 종단적 연구 환경에서 행동 기반의 보정된 신뢰 측정으로의 전환을 촉구한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.