[논문 리뷰] Connecting Algorithmic Research and Usage Contexts: A Perspective of Contextualized Evaluation for Explainable AI
이 논문은 모델 디버깅, 의사결정 지원, 감사 등과 같은 다양한 사용 맥락에서 평가 기준의 상대적 중요도가 어떻게 변화하는지를 규명함으로써 설명 가능한 인공지능(XAI)을 위한 맥락 기반 평가를 제안한다. XAI 전문가 및 군중 작업자들을 대상으로 한 설문 조사 결과, 실제 현장에서는 불확실성 전달 및 투명성 같은 기준이 매우 중요하게 여겨지지만, 현재 알고리즘 연구에서는 이를 충분히 반영하지 못하고 있음을 밝혀내며, 실제 목적에 기반한 사용자 중심 평가로의 전환을 촉구한다.
Recent years have seen a surge of interest in the field of explainable AI (XAI), with a plethora of algorithms proposed in the literature. However, a lack of consensus on how to evaluate XAI hinders the advancement of the field. We highlight that XAI is not a monolithic set of technologies -- researchers and practitioners have begun to leverage XAI algorithms to build XAI systems that serve different usage contexts, such as model debugging and decision-support. Algorithmic research of XAI, however, often does not account for these diverse downstream usage contexts, resulting in limited effectiveness or even unintended consequences for actual users, as well as difficulties for practitioners to make technical choices. We argue that one way to close the gap is to develop evaluation methods that account for different user requirements in these usage contexts. Towards this goal, we introduce a perspective of contextualized XAI evaluation by considering the relative importance of XAI evaluation criteria for prototypical usage contexts of XAI. To explore the context dependency of XAI evaluation criteria, we conduct two survey studies, one with XAI topical experts and another with crowd workers. Our results urge for responsible AI research with usage-informed evaluation practices, and provide a nuanced understanding of user requirements for XAI in different usage contexts.
연구 동기 및 목표
- 알고리즘 기반 XAI 연구와 실제 사용 맥락 사이의 괴리를 해결하기 위해 평가 기준이 사용자 요구와 일치하지 않는 문제를 해결한다.
- 모델 디버깅, 의사결정 지원, 감사 등 특정 XAI 사용 맥락에 가장 중요한 평가 기준을 식별하고 우선순위를 정한다.
- 최종 사용자와 XAI 전문가가 XAI 기준에 대해 어떻게 평가하는지의 차이를 실증적으로 조사하여 현재 평가 관행의 맹점들을 드러낸다.
- 사용자 중심의 평가 기준에 기반한 맥락 특화 가중치를 제공함으로써 연구자와 실무자가 XAI 기법을 선택하거나 최적화할 수 있도록 이끈다.
- 순수 알고리즘적 지표가 아닌 실제 적용 기반, 사용자 중심 평가를 강조함으로써 책임감 있는 AI 연구를 주장한다.
제안 방법
- 기존 문헌을 통합하여 신뢰성, 안정성, 이해 가능성, 불확실성 전달, 투명성 등을 포함한 XAI 평가 기준의 분류 체계를 수립하였다.
- 사용자 목표를 기반으로 모델 디버깅, 의사결정 지원, 능력 평가, 감사 등 XAI의 대표적 사용 맥락을 식별하였다.
- 두 가지 설문 조사를 실시하였다: 하나는 XAI 전문 분야의 전문가(HCI 및 AI 분야)를 대상으로 하고, 다른 하나는 AI 응용의 최종 사용자로 기능하는 군중 작업자들을 대상으로 하였다.
- 후행 평가 설문을 통해 각 사용 맥락 내에서 평가 기준의 상대적 중요도를 순위화하여 맥락 기반 중요도 가중치를 생성하였다.
- 맥락 기반 가중치를 적용한 가중 평가 프레임워크를 제안하여, XAI 기법의 선택 및 최적화를 안내하였다.
- 결과를 활용해 기존 XAI 기법을 벤치마킹하고 특정 용도에 맞게 향상하거나 선택할 때 우선시해야 할 평가 기준을 규명하였다.
실험 결과
연구 질문
- RQ1모델 디버깅, 의사결정 지원, 감사와 같은 다양한 사용 맥락에서 XAI 평가 기준의 상대적 중요도는 어떻게 달라지는가?
- RQ2최종 사용자와 XAI 전문가 간에 신뢰성, 이해 가능성, 불확실성 전달 등의 평가 기준 중요도에 대해 어느 정도 일치하는가?
- RQ3특정 사용자 목표, 예를 들어 도메인 학습이나 모델 신뢰성 평가를 지원하기 위해 가장 중요한 평가 기준은 무엇인가?
- RQ4평가 지표를 순수 알고리즘적 성질에서 실제 필요를 반영하는 사용자 중심 기준으로 재편성할 수 있는가?
- RQ5현재 XAI 연구 및 평가 관행에서 불확실성 전달 및 투명성과 같은 기준을 간과할 경우 어떤 영향을 미치는가?
주요 결과
- 불확실성 전달과 투명성은 전문가와 최종 사용자 모두로부터 매우 중요하게 평가되었지만, 현재 XAI 평가 프레임워크에서는 여전히 부족하게 반영되고 있다.
- 의사결정 지원 맥락에서는 이해 가능성과 불확실성 전달이 신뢰성보다 우선시되었으며, 사용자 선호의 상호 보완적 특성이 드러났다.
- 모델 디버깅 맥락에서는 신뢰성과 안정성이 더 중요하게 평가되었으며, 이는 알고리즘 연구의 초점과 일치하지만, 다른 맥락에서 사용자 요구를 간과할 수 있음을 시사한다.
- 전문가의 인식과 최종 사용자 우선순위 사이에 상당한 격차가 존재하며, 특히 개인화 및 상호작용성에 관해 맹점이 드러나 있어 현재 평가 설계에 문제가 있음을 시사한다.
- 연구 결과에 따르면, 신뢰성이 항상 우선시되는 것은 아니며, 능력 평가 맥락에서는 이해 가능성 향상을 위해 신뢰성을 희생하는 데 사용자가 수용 가능하다는 점이 확인되었다.
- 결과는 맥락 기반 가중 평가 프레임워크의 기초를 제공하며, 실무자가 맥락 기반 중요도에 따라 XAI 기법을 선택하거나 최적화할 수 있도록 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.