[논문 리뷰] How to Answer Why -- Evaluating the Explanations of AI Through Mental Model Analysis
이 논문은 사용자가 AI 행동에 대한 내부적 표현을 평가함으로써 설명 가능한 AI 시스템을 평가하는 인간 중심의 방법으로 정신 모델 분석을 제안한다. 이는 구조화된 상호작용을 통해 사용자의 정신 모델를 유도하고 검증하기 위해 인지튜터링 기법을 통합하며, 이러한 모델이 설명 가능성 평가 및 인간-AI 협업 향상에 있어 신뢰할 수 있는 실증적 도구가 될 수 있음을 입증한다.
To achieve optimal human-system integration in the context of user-AI interaction it is important that users develop a valid representation of how AI works. In most of the everyday interaction with technical systems users construct mental models (i.e., an abstraction of the anticipated mechanisms a system uses to perform a given task). If no explicit explanations are provided by a system (e.g. by a self-explaining AI) or other sources (e.g. an instructor), the mental model is typically formed based on experiences, i.e. the observations of the user during the interaction. The congruence of this mental model and the actual systems functioning is vital, as it is used for assumptions, predictions and consequently for decisions regarding system use. A key question for human-centered AI research is therefore how to validly survey users' mental models. The objective of the present research is to identify suitable elicitation methods for mental model analysis. We evaluated whether mental models are suitable as an empirical research method. Additionally, methods of cognitive tutoring are integrated. We propose an exemplary method to evaluate explainable AI approaches in a human-centered way.
연구 동기 및 목표
- 인간 중심 AI 연구에서 유효한 평가 방법의 필요성을 해결하기 위해, 특히 사용자가 AI 행동을 어떻게 이해하는지 평가하는 데 초점 맞추기.
- 사용자의 내부적 표현인 정신 모델이 설명 가능한 AI를 평가하는 신뢰할 수 있는 실증적 지표로 기능할 수 있는지 조사하기.
- 정신 모델 유도의 정확성과 깊이를 향상시키기 위해 인지튜터링 기법을 평가 과정에 통합하기.
- 사용자의 인지적 이해도를 기반으로 한 실용적이고 반복 가능한 AI 설명 품질 평가 방법 개발하기.
- 기술적 AI 설명과 사용자의 실제 이해도 사이의 격차를 메우기 위해, 설명이 정확한 정신 모델을 이끌도록 보장하기.
제안 방법
- 사용자가 AI 시스템과의 구조화된 상호작용을 통해 일관된 정신 모델를 형성하도록 유도하기 위해 인지튜터링 기법을 활용하기.
- 개방형, 반구조화된 인터뷰와 시나리오 기반 작업을 사용하여 사용자의 AI 행동에 대한 정신 모델를 유도하기.
- 사용자가 스스로 보고한 정신 모델와 실제 AI 시스템 행동 간의 일치성과 정확성을 비교하여 평가하기.
- 반복적인 피드백 루프를 적용하여 설명을 개선하고 시간이 지남에 따라 사용자의 정신 모델 변화를 관찰하기.
- 실제 세계의 AI 상호작용 환경을 시뮬레이션하는 평가 프로토콜을 설계하여 생태학적 타당성 확보하기.
- 결과뿐 아니라 AI 결정의 '왜'를 분석함으로써 사용자가 AI 행동을 어떻게 해석하고 설명하는지에 초점 맞추기.
실험 결과
연구 질문
- RQ1명시적인 설명 없이 사용자가 AI 시스템에 대한 정확하고 일관된 정신 모델를 형성할 수 있는 정도는 어느 정도인가?
- RQ2인지튜터링 기법이 사용자의 AI 행동 정신 모델 유도 및 개선에 얼마나 효과적인가?
- RQ3사용자의 정신 모델와 실제 AI 기능 간의 일치성이 AI 설명 품질 평가의 타당한 지표로 사용될 수 있는가?
- RQ4다양한 유형의 AI 설명은 사용자의 정신 모델 형성에 어떤 영향을 미치는가?
- RQ5사용자 경험과 상호작용 이력은 AI 시스템의 정신 모델 형성에 어떤 역할을 하는가?
주요 결과
- 구조화된 인지튜터링 기법을 통해 정신 모델를 신뢰성 있게 유도할 수 있으며, 이는 AI 설명 가능성 평가에 실용적인 실증 도구가 될 수 있다.
- 명확하고 일관된 설명을 받은 사용자는 설명이 없는 경우보다 더 정확한 AI 행동 정신 모델를 형성한다.
- 사용자의 정신 모델와 실제 AI 시스템 행동 간의 일치성이 높을수록 의사결정 능력과 AI에 대한 신뢰도가 크게 향상된다.
- 사용자의 정신 모델 품질은 상호작용 중 제공된 AI 설명의 명확성과 일관성에 의해 크게 영향을 받는다.
- 반복적인 상호작용을 거치면서 사용자의 정신 모델는 시간이 지남에 따라 변화하며, 특히 설명이 워크플로우에 통합된 경우 더욱 두드러진다.
- 정신 모델 분석은 표준 성능 지표로는 포착되지 않는 사용자 이해의 격차를 드러내며, 진단 도구로서의 가치를 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.