[논문 리뷰] Why is plausibility surprisingly problematic as an XAI criterion?
이 논문은 XAI에서 설명의 타당성(plausibility)을 최적화하는 것이 모델 이해 가능성, 투명성, 신뢰성과 같은 核심 목표들과 본질적으로 부합하지 않는다고 주장한다. 설명의 타당성 정규화는 인공지능 설명이 인간의 설명과 너무 유사하게 모방하도록 만들며, 이는 진정한 설명의 유용성을 해칠 뿐 아니라 모델에 대한 과소신뢰 또는 과도신뢰의 위험을 초래한다. 대신 타당성은 인간 해석을 위한 중간 단계의 계산적 대체물로만 기능해야 하며, 최종 목표로 삼아서는 안 된다.
Explainable artificial intelligence (XAI) is motivated by the problem of making AI predictions understandable, transparent, and responsible, as AI becomes increasingly impactful in society and high-stakes domains. The evaluation and optimization criteria of XAI are gatekeepers for XAI algorithms to achieve their expected goals and should withstand rigorous inspection. To improve the scientific rigor of XAI, we conduct a critical examination of a common XAI criterion: plausibility. Plausibility assesses how convincing the AI explanation is to humans, and is usually quantified by metrics of feature localization or feature correlation. Our examination shows that plausibility is invalid to measure explainability, and human explanations are not the ground truth for XAI, because doing so ignores the necessary assumptions underpinning an explanation. Our examination further reveals the consequences of using plausibility as an XAI criterion, including increasing misleading explanations that manipulate users, deteriorating users' trust in the AI system, undermining human autonomy, being unable to achieve complementary human-AI task performance, and abandoning other possible approaches of enhancing understandability. Due to the invalidity of measurements and the unethical issues, this position paper argues that the community should stop using plausibility as a criterion for the evaluation and optimization of XAI algorithms. We also delineate new research approaches to improve XAI in trustworthiness, understandability, and utility to users, including complementary human-AI task performance.
연구 동기 및 목표
- XAI 기법 평가의 최종 목표로 타당성이 타당하다는 광범위한 가정을 도전하기 위해.
- 타당성 최적화가 모델 이해 가능성, 투명성, 그리고 신뢰성에 악영향을 미친다는 것을 입증하기 위해.
- 타당성이 인간 해석을 위한 중간 단계의 계산적 대체물로 재정의되어야 하며, 주요 평가 목표로 삼아서는 안 된다고 주장하기 위해.
- AI 설명 작업과 물체 위치 특정 작업을 구분하고, XAI 전용 평가 지표의 필요성을 강조하기 위해.
- 사용자 중심의 평가로의 전환을 촉구하며, 설명 가능성 전용 목표와 인간의 추론 목표에 기반한 XAI 연구의 방향 전환을 위해.
제안 방법
- XAI에서 타당성을 주요 평가 지표로 사용할 경우 발생하는 개념적·실천적 결함 분석.
- 타당성과 진실성, 충실성의 대조 분석을 통해 타당성이 모델의 정확성보다 인간의 사전 지식과 판단에 의존한다는 점을 강조.
- 결정 검증, 편향 탐지, 지식 발견과 같은 인간의 추론 작업에 실용적인 기여를 우선시하는 XAI 평가의 우선순위 설정.
- AI 모델의 작업(예: 분류)과 XAI의 작업(예: 설명 생성)을 구분하고, 각각에 대해 별도의 평가 지표를 도입할 것을 주장.
- 내재적으로 해석 가능한 모델을 대상으로 통제된 실험 설계를 제안하여 설명 가능성 성능을 모델 성능에서 분리해 평가할 수 있도록 함.
- 타당성을 인간 해석을 위한 계산적 대체물로 위치시키며, XAI 유용성 최적화에 유용하지만, 독립적인 목표로는 삼지 말아야 한다고 주장.
실험 결과
연구 질문
- RQ1왜 타당성은 널리 사용되고 있음에도 불구하고 XAI 기법 평가 기준으로 문제가 되는가?
- RQ2타당성 최적화가 모델의 투명성과 신뢰성에 어떻게 악영향을 미치는가?
- RQ3인간-AI 상호작용에서 타당한 설명을 모델 결정의 정확성과 동일시할 경우 발생하는 결과는 무엇인가?
- RQ4어떻게 하면 타당성보다 설명 가능성 전용 유용성을 우선시하는 XAI 평가를 재구성할 수 있는가?
- RQ5AI 모델 성능 평가와 XAI 설명 품질 평가 사이의 차이는 무엇인가?
주요 결과
- XAI를 타당성 최적화를 위해 최적화하면 설명이 인간의 설명과 너무 유사하게 모방하게 되어 깊은 모델 이해나 투명성 향상에 실패한다.
- 타당성 기반 최적화는 타당성과 모델 결정의 정확성 간의 분리로 과소신뢰 또는 과도신뢰의 위험을 초래한다.
- 타당성은 진실성이나 충실성의 신뢰할 만한 대체 지표가 아니며, 모델 정확성보다 인간의 이성적 타당성만 측정한다.
- 결정 검증이나 편향 탐지와 같은 과정에서 인간 해석을 시뮬레이션하는 데 타당성이 중간 단계의 측정으로서 매우 유용할 수 있다.
- AI 모델에 일반적으로 사용되는 위치 특정 성능 지표를 XAI 시스템 평가에 사용하는 것은 XAI 성능을 잘못 표현하며, 모델 성능과 설명 성능을 혼동하게 한다.
- 논문은 인간의 추론 목표와 설명 가능성의 유용성에 부합하는 XAI 전용 평가 목표로의 패러다임 전환을 촉구하며, 단지 인간 유사한 타당성에만 기반한 평가가 아닌, 설명 가능성 중심의 평가 기반의 필요성을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.