[논문 리뷰] A Multidisciplinary Survey and Framework for Design and Evaluation of Explainable AI Systems
이 논문은 기계학습, 시각화, 인터페이스 상호작용 분야에서의 설계 목표와 평가 방법을 분류함으로써 설명 가능한 인공지능(XAI) 시스템을 설계하고 평가하기 위한 다학문적 프레임워크를 제안한다. 이는 설계 목표와 평가 기법을 맵핑한 단계적이고 반복적인 프레임워크를 제공하여 다학문적 XAI 연구를 통합하고 종단 간 시스템 개발을 지원한다.
The need for interpretable and accountable intelligent systems grows along with the prevalence of artificial intelligence applications used in everyday life. Explainable intelligent systems are designed to self-explain the reasoning behind system decisions and predictions, and researchers from different disciplines work together to define, design, and evaluate interpretable systems. However, scholars from different disciplines focus on different objectives and fairly independent topics of interpretable machine learning research, which poses challenges for identifying appropriate design and evaluation methodology and consolidating knowledge across efforts. To this end, this paper presents a survey and framework intended to share knowledge and experiences of XAI design and evaluation methods across multiple disciplines. Aiming to support diverse design goals and evaluation methods in XAI research, after a thorough review of XAI related papers in the fields of machine learning, visualization, and human-computer interaction, we present a categorization of interpretable machine learning design goals and evaluation methods to show a mapping between design goals for different XAI user groups and their evaluation methods. From our findings, we develop a framework with step-by-step design guidelines paired with evaluation methods to close the iterative design and evaluation cycles in multidisciplinary XAI teams. Further, we provide summarized ready-to-use tables of evaluation methods and recommendations for different goals in XAI research.
연구 동기 및 목표
- 다양한 분야에서 흩어져 있는 XAI 연구를 통합함으로써 설계 및 평가 접근 방식을 통일한다.
- 최종 사용자, 영역 전문가, 개발자와 같은 다양한 XAI 사용자 그룹을 위해 고유한 설계 목표를 식별하고 분류한다.
- 특정 설계 목표에 적합한 평가 방법을 맵핑하여 체계적이고 타겟팅된 XAI 시스템 개발을 지원한다.
- 설계 및 평가 사이클을 닫기 위해 실용적이고 반복적인 프레임워크를 개발한다.
- 특정 XAI 연구 목표에 맞춰 조정된 평가 방법 및 권장 사항을 담은 즉시 사용 가능한 표를 제공한다.
제안 방법
- 기계학습, 시각화, 인터페이스 상호작용(HCI) 분야의 XAI 문헌을 종합적으로 조사한다.
- 최종 사용자, 영역 전문가, 개발자와 같은 타겟 사용자 그룹에 따라 XAI 설계 목표를 분류한다.
- 평가 방법을 그 초점에 따라 계산 기반, 인간 중심, 시스템 수준 평가로 분류한다.
- 다중 계층을 통해 설계 목표와 적절한 평가 방법을 연결하는 중첩된 반복적 프레임워크를 제안한다.
- 인터랙티브 기계학습 및 사용성 평가 분야의 기존 프레임워크에서 유래한 통찰을 바탕으로 시스템 설계 및 평가 계층을 구성한다.
- 다양한 전문성을 가진 여덟 명의 연구자들이 참여한 일 년간의 다학문적 사례 연구를 통해 프레임워크를 검증한다.
실험 결과
연구 질문
- RQ1다양한 사용자 그룹과 분야에서 XAI 설계 목표를 어떻게 systematic하게 분류할 수 있는가?
- RQ2특정 XAI 설계 목표에 가장 적합한 평가 방법은 무엇이며, 사용자 그룹에 따라 어떻게 다를 수 있는가?
- RQ3통합된 프레임워크를 통해 XAI 시스템 설계에서의 다학문적 협업을 어떻게 효과적으로 지원할 수 있는가?
- RQ4XAI 시스템에서 계산 기반 해석 가능성과 인간 기반 해석 가능성 간의 조율 과정에서 발생하는 주요 과제는 무엇인가?
- RQ5강력하고 사용자 중심의 XAI 시스템을 확보하기 위해 반복적 설계 및 평가 사이클을 어떻게 구성할 수 있는가?
주요 결과
- XAI 설계 목표와 평가 방법 사이에 명확한 맵핑이 수립되었으며, 기계학습, 시각화, HCI 분야에서 각기 다른 우선순위가 드러났다.
- 이 프레임워크는 내부 계층의 알고리즘 해석 가능성과 외부 계층의 사용자 경험 및 시스템 성과를 연결함으로써 반복적 설계 및 평가를 효과적으로 지원한다.
- 사례 연구를 통해 프레임워크가 다학문적 팀이 일 년간의 XAI 개발 과정을 안내하는 데 실용적인 유용성을 보였다.
- 평가 방법은 타겟 사용자에 따라 크게 다름: 모델의 해석 가능성 평가에는 계산 기반 지표가 사용되며, 사용자 신뢰도 및 이해도 평가에는 인간 대상 실험 연구가 필수적이다.
- 프레임워크는 확장성과 확장 가능성을 제공하여 도메인 특화 설계 가이드라인과의 통합 및 추가 사례 연구를 통한 추가 검증이 가능하다.
- 한계점으로는 높은 수준의 추상화로 인해 특정 도메인에 대한 세부 구현 지침이 추가로 필요할 수 있다는 점이 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.