[논문 리뷰] The Clever Hans Effect in Anomaly Detection
이 논문은 다양한 비지도 이상 탐지 모델 전반에서 '현명한 한스 효과'(Clever Hans effect)—즉, 비의미한 관련 특징에 의존하는 이상 탐지 모델—를 탐지하기 위한 설명 가능 인공지능(XAI) 프레임워크를 제안한다. 통합된 세 층으로 구성된 신경망 아키텍처에 모델을 통합하고 픽셀 단위의 설명 일치를 사용함으로써, 이 효과가 데이터 기반이 아니라 구조적 원인에 기인한 광범위한 현상임을 드러낸다. 그러나 단순한 배깅 앙상블 기법을 통해 이러한 효과를 감소시킬 수 있으며, 이는 탐지 성능의 강건성과 일반화 능력을 향상시킨다.
The 'Clever Hans' effect occurs when the learned model produces correct predictions based on the 'wrong' features. This effect which undermines the generalization capability of an ML model and goes undetected by standard validation techniques has been frequently observed for supervised learning where the training algorithm leverages spurious correlations in the data. The question whether Clever Hans also occurs in unsupervised learning, and in which form, has received so far almost no attention. Therefore, this paper will contribute an explainable AI (XAI) procedure that can highlight the relevant features used by popular anomaly detection models of different type. Our analysis reveals that the Clever Hans effect is widespread in anomaly detection and occurs in many (unexpected) forms. Interestingly, the observed Clever Hans effects are in this case not so much due to the data, but due to the anomaly detection models themselves whose structure makes them unable to detect the truly relevant features, even though vast amounts of data points are available. Overall, our work contributes a warning against an unrestrained use of existing anomaly detection models in practical applications, but it also points at a possible way out of the Clever Hans dilemma, specifically, by allowing multiple anomaly models to mutually cancel their individual structural weaknesses to jointly produce a better and more trustworthy anomaly detector.
연구 동기 및 목표
- 비지도 이상 탐지에서 레이블이 없는 상황에서도 '현명한 한스 효과'(모델이 비의미한 상관관계를 악용하는 현상)가 발생하는지 조사하는 것.
- 다양한 이상 탐지 모델에 적용 가능한 통합된 설명 가능 인공지능(XAI) 프레임워크를 개발하여 예측에 영향을 주는 입력 특징을 식별하는 것.
- 픽셀 단위의 지도 없는 참조(annotation)를 사용하여 이상 탐지에서의 현명한 한스 효과를 정량화하고, 데이터 기반 비의미한 상관관계와 구별하는 것.
- 배깅과 같은 앙상블 기법이 현명한 한스 행동을 유도하는 구조적 약점을 완화하고 탐지 성능 및 강건성 향상에 기여하는지 평가하는 것.
- 모델의 구조가 비지도 이상 탐지에서 현명한 한스 효과의 주요 원인임을 입증하며, 지도 학습에서의 기존 가정을 도전하는 것.
제안 방법
- KDE, 오토에인코더, 딥 오토에인코더 등 다양한 이상 탐지 모델을 통합된 세 층 신경망 아키텍처에 통합: (i) 특징 추출, (ii) 거리 계산, (iii) 풀링. 이로 인해 일관된 설명 추출이 가능해진다.
- 통합 아키텍처를 통해 역전파를 적용하여 이상 점수에 가장 영향을 주는 입력 특징을 식별하는 중요도 맵(saliency maps)를 계산한다.
- 정규화된 L2 중요도 맵을 사용하여 특징의 중요도를 정량화하고, 지도 없는 이상 참조(annotation)와 픽셀 단위의 교차율(IoU)을 통해 '현명한 한스 점수'를 계산한다.
- 배깅 앙상블 전략을 적용: KDE, 오토에인코더, 딥 오토에인코더 모델의 표준화된 이상 점수를 평균하여 통합 탐지기 생성.
- 정규화된 개별 모델 점수를 훈련 데이터 기반으로 평균이 0, 분산이 1이 되도록 표준화한 후 평균을 내어 공정한 비교와 앙상블 학습을 가능하게 한다.
- 동일한 테스트 이미지를 사용하여 다양한 모델 간 설명을 시각화하고 비교함으로써 진짜 이상 영역과의 일치도 및 특징 커버리지 수준을 평가한다.
실험 결과
연구 질문
- RQ1현명한 한스 효과가 비지도 이상 탐지 모델에 얼마나 광범위하게 나타나며, 어떤 형태로 나타나는가?
- RQ2이상 탐지에서의 현명한 한스 효과는 주로 데이터 기반의 비의미한 상관관계에 기인하는가, 아니면 모델 자체의 본질적 구조적 한계에 기인하는가?
- RQ3다양한 이상 탐지 모델에 효과적으로 적용 가능한 통합된 XAI 프레임워크를 통해 기능 수준의 설명을 추출하고 비교할 수 있는가?
- RQ4배깅을 통해 여러 이상 탐지기를 조합하면 현명한 한스 효과가 감소하고 탐지 성능 및 일반화 능력이 향상되는가?
- RQ5앙상블 모델의 설명에서 특징 커버리지가 개별 모델 대비 진짜 이상 영역과 얼마나 잘 일치하는가?
주요 결과
- 현명한 한스 효과는 이상 탐지 모델 전반에 광범위하게 존재하며, 각 모델이 고유한 구조적 원인에 기반한 비의미한 특징에 의존하는 전략을 취하고 있음을 확인했다.
- 이상 탐지에서의 현명한 한스 효과는 데이터 기반의 비의미한 상관관계가 아니라 모델 아키텍처에 기인한 것으로 확인되었으며, MNIST-C 및 MVTec 데이터셋을 통한 분석으로 뒷받침된다.
- 배깅 이상 탐지기는 ROC AUC 점수는 낮지만, 현명한 한스 행동을 감소시켜 강건성과 일반화 능력 측면에서 개별 모델보다 뛰어나다.
- 배깅 모델의 설명은 더 넓고 다양한 특징 지원을 보이며, 진짜 이상 영역과의 IoU가 더 높아 실제 이상 영역과의 일치도가 뛰어나다.
- 모든 MVTec 클래스에 걸쳐 평균 현명한 한스 점수는 개별 모델 대비 배깅 모델에서 유의미하게 낮아, 비의미한 특징에 대한 의존성이 감소함을 확인했다.
- 통합된 XAI 프레임워크는 모델 간 설명 비교 및 모델 행동 정량화를 성공적으로 가능하게 하여, 기존 평가 방식으로는 드러나지 않는 구조적 결함를 드러냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.