[논문 리뷰] Don't Explain without Verifying Veracity: An Evaluation of Explainable AI with Video Activity Recognition
이 연구는 통제된 사용자 실험을 통해 영상 활동 인식을 위한 해석가능한 인공지능(XAI)에서 해석의 진실성의 영향을 평가한다. 낮은 진실성을 가진 해석은 정확한 해석이나 해석이 전혀 없는 경우보다 사용자 성과와 일치도를 크게 떨어뜨리는 것으로 나타났으며, 사용자 혼란과 신뢰 상실로 인해 오해의 해석은 전혀 없는 것보다 악영향을 미칠 수 있음을 보여준다.
Explainable machine learning and artificial intelligence models have been used to justify a model's decision-making process. This added transparency aims to help improve user performance and understanding of the underlying model. However, in practice, explainable systems face many open questions and challenges. Specifically, designers might reduce the complexity of deep learning models in order to provide interpretability. The explanations generated by these simplified models, however, might not accurately justify and be truthful to the model. This can further add confusion to the users as they might not find the explanations meaningful with respect to the model predictions. Understanding how these explanations affect user behavior is an ongoing challenge. In this paper, we explore how explanation veracity affects user performance and agreement in intelligent systems. Through a controlled user study with an explainable activity recognition system, we compare variations in explanation veracity for a video review and querying task. The results suggest that low veracity explanations significantly decrease user performance and agreement compared to both accurate explanations and a system without explanations. These findings demonstrate the importance of accurate and understandable explanations and caution that poor explanations can sometimes be worse than no explanations with respect to their effect on user performance and reliance on an AI system.
연구 동기 및 목표
- 해석의 진실성이 해석가능한 인공지능 시스템에서 사용자 성과와 신뢰에 어떻게 영향을 미치는지 조사하기.
- 부정확하거나 오해의 소지가 있는 해석이 영상 활동 인식 작업에서 사용자의 이해력과 의사결정을 떨어뜨리는지 평가하기.
- 정확한 해석, 낮은 진실성의 해석, 해석이 없는 조건 간의 사용자 성과와 일치도를 비교하기.
- 해석의 진실성이 사용자의 정신 모델 형성과 시스템 의존도에 미치는 영향을 평가하기.
- 모델 정확도를 넘어서 XAI 설계에서 진실성의 중요성을 뒷받침하는 경험적 증거를 제공하기.
제안 방법
- 120명의 참가자를 대상으로 해석가능한 영상 활동 인식 시스템을 사용한 통제된 사용자 실험을 실시하였다.
- 정확한 해석, 낮은 진실성(부정확한) 해석, 해석 없음의 세 가지 실험 조건을 설계하였다.
- 사용자 성과, 시스템 예측에 대한 일치도, 정확도 인식을 측정하기 위해 영상 검토 및 질의 작업을 사용하였다.
- 구조화된 설문지와 상호작용 로그를 통해 사용자 작업 성과, 자신감, 정신 모델 형성에 대한 데이터를 수집하였다.
- 다양하고 전문 지식이 없는 사용자 대상을 확보하기 위해 Amazon Mechanical Turk를 활용하여 참가자 모집을 수행하였다.
- 통계적 방법을 사용하여 해석의 진실성 조건 간 성과와 일치도를 비교 분석하였다.
실험 결과
연구 질문
- RQ1해석의 진실성은 영상 활동 인식 작업에서 사용자 성과에 어떻게 영향을 미치는가?
- RQ2부정확한 해석을 제공할 경우, 정확한 해석이나 해석이 없는 경우보다 사용자가 시스템 예측에 대해 낮은 일치도를 보이는가?
- RQ3해석의 진실성은 사용자의 시스템 정확도 및 신뢰도 인식에 어떻게 영향을 미치는가?
- RQ4왜곡된 해석은 사용자가 인공지능 시스템에 대해 잘못된 정신 모델을 형성하게 만들 수 있는가?
- RQ5정확한 해석이 있는 시스템과 해석이 없는 시스템 간에 사용자 성과에 유의미한 차이가 있는가?
주요 결과
- 낮은 진실성의 해석은 정확한 해석이나 해석이 없는 경우와 비교해 사용자 성과를 유의미하게 떨어뜨렸다.
- 부정확한 해석이 제공된 경우 사용자 예측 일치도가 크게 감소하여 신뢰도와 신뢰성 저하를 나타냈다.
- 낮은 진실성의 해석에 의존한 참가자들은 모델의 실제 논리와 더 약한 일치를 보였으며, 이는 잘못된 정신 모델 형성의 징후로 나타났다.
- 연구 결과에 따르면, 오해의 소지가 있는 해석은 해석이 전혀 없는 것보다 더 해로울 수 있으며, 혼란과 오해를 유도하기 때문이다.
- 정확한 해석을 접한 참가자들은 해석이 없거나 잘못된 해석을 받은 경우보다 더 나은 이해력과 높은 작업 성과를 보였다.
- 결과적으로 해석의 진실성은 XAI 설계에서 핵심적인 요소이며, 열악한 품질의 해석은 사용자 효과성과 신뢰도를 떨어뜨릴 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.