[논문 리뷰] X-ToM: Explaining with Theory-of-Mind for Gaining Justified Human Trust
X-ToM은 이성적 사고 이론을 기반으로 한 설명 프레임워크로, 인공지능 시스템의 사고 과정을 마치 정신 상태를 지닌 것처럼 모델링하여 사용자가 예측이 *왜* 내려지는지 이해할 수 있도록 한다. 이는 응답 시간을 늘리지 않으면서도 질문-응답(QA) 및 시각화 지도(saliency map) 기반의 기존 방법들보다 설명 만족도가 유의미하게 향상되며(유의수준 p<0.01), 특히 유용성, 충분성, 세부 정보 측면에서 뛰어나며, 이는 사용자 신뢰를 정당화하는 데 기여한다.
We present a new explainable AI (XAI) framework aimed at increasing justified human trust and reliance in the AI machine through explanations. We pose explanation as an iterative communication process, i.e. dialog, between the machine and human user. More concretely, the machine generates sequence of explanations in a dialog which takes into account three important aspects at each dialog turn: (a) human's intention (or curiosity); (b) human's understanding of the machine; and (c) machine's understanding of the human user. To do this, we use Theory of Mind (ToM) which helps us in explicitly modeling human's intention, machine's mind as inferred by the human as well as human's mind as inferred by the machine. In other words, these explicit mental representations in ToM are incorporated to learn an optimal explanation policy that takes into account human's perception and beliefs. Furthermore, we also show that ToM facilitates in quantitatively measuring justified human trust in the machine by comparing all the three mental representations. We applied our framework to three visual recognition tasks, namely, image classification, action recognition, and human body pose estimation. We argue that our ToM based explanations are practical and more natural for both expert and non-expert users to understand the internal workings of complex machine learning models. To the best of our knowledge, this is the first work to derive explanations using ToM. Extensive human study experiments verify our hypotheses, showing that the proposed explanations significantly outperform the state-of-the-art XAI methods in terms of all the standard quantitative and qualitative XAI evaluation metrics including human trust, reliance, and explanation satisfaction.
연구 동기 및 목표
- 인간의 인공지능에 대한 신뢰 부족 문제를 해결하기 위해, 인공지능의 사고 과정을 마치 정신 상태를 지닌 것처럼 반영하는 설명을 개발한다.
- 시각화 지도나 질문-응답(QA)과 같은 표면적 설명을 넘어서 사용자가 인공지능 예측을 더 깊이 이해할 수 있도록 한다.
- 이성적 사고 이론 기반 설명이 인간 사용자의 정당화된 신뢰와 의존도를 높이는지 측정한다.
- 통제된 인간 대상 실험을 통해 다양한 설명 유형에 대해 사용자 만족도, 응답 시간, 의존도를 평가한다.
제안 방법
- X-ToM 프레임워크는 인공지능을 '실행자(Performer)'로 모델링하여 믿음과 의도를 가진 것처럼 행동하게 하여, 객체의 부분과 관계를 어떻게 추론하는지 설명한다.
- 객체의 부분과 그 관계를 표현하기 위해 AOG(Accumulative Object Graph)와 유사한 구조를 사용하여, 이미지의 어느 영역이 가장 영향을 미치는지 추론할 수 있도록 한다.
- 감지 성공 원인과 영향력 있는 이미지 영역에 관해 평가자 질문에 응답하는 방식으로 설명을 생성한다. 예를 들어, '사람이 달리는 것을 인식하는 데 가장 중요한 부분은 무엇인가요?'와 같은 질문에 대응한다.
- 심리학자 풀에서 모집된 120명의 인간 참가자를 대상으로 웹 인터페이스를 통해 X-ToM을 QA 및 시각화 지도 기반의 기준과 비교 평가한다.
- 사용자의 반응은 만족도, 의존도, 응답 시간에 대해 리커트 척도로 수집되어 사용성과 신뢰도를 평가한다.
- 정량적 및 정성적 지표를 포함한 평가를 수행하며, 설명 만족도, 응답 시간, 주관적 의존도를 포함한다.
실험 결과
연구 질문
- RQ1X-ToM은 QA 및 시각화 지도 기반 방법에 비해 사용자 만족도를 높이는가?
- RQ2사용자는 X-ToM 설명을 기존 방법보다 더 빨리 이해하는가?
- RQ3X-ToM은 인간 사용자의 인공지능 예측에 대한 정당화된 신뢰와 의존도를 높이는가?
- RQ4사용자 인식에 따르면, 특정 신체 부위를 탐지하는 데 있어 어떤 이미지 영역이 가장 영향력이 있는가?
- RQ5다양한 설명 유형 간 설명 품질(유용성, 충분성, 세부 정보)의 차이는 어떻게 다른가?
주요 결과
- X-ToM은 QA 및 시각화 지도 기반 기준보다 설명 만족도에서 뚜렷한 우월성을 보였으며, 특히 유용성, 충분성, 세부 정보 측면에서 유의미하게 높았다(p<0.01).
- X-ToM과 기준 방법 간 응답 시간에 유의미한 차이가 없었으며, 이는 X-ToM 설명이 처리 속도가 느리지 않음을 시사한다.
- 주관적 의존도 측정 결과, X-ToM 그룹의 의존도가 시각화 지도 기반 기준보다 높게 나타나 사용자 신뢰가 더 강하다는 것을 시사한다.
- 신뢰도, 이해 가능성, 정확성, 설명의 일관성 측면에서 그룹 간 유의미한 차이가 없었다.
- 정성적 의존도 점수는 정량적 의존도 측정 결과와 일치하여 연구 결과의 타당성을 강화한다.
- 결과적으로 이성적 사고 이론 기반 설명은 사용성이나 속도를 희생시키지 않은 채 신뢰를 향상시킬 수 있음을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.