Skip to main content
QUICK REVIEW

[논문 리뷰] XAI-based Comparison of Input Representations for Audio Event Classification

Annika Frommholz, Fabian Seipel|arXiv (Cornell University)|2023. 04. 27.
Music and Audio Processing인용 수 4
한 줄 요약

이 논문은 음성 이벤트 분류를 위한 1D-CNN(원시 파형) 및 YAMNet(스펙트로그램) 모델의 분류 전략을 비교하기 위해 계층별 관련성 전파(LRP)를 활용한 설명 가능한 인공지능(XAI) 기법인 DFT-LRP를 사용한다. 연구 결과, 1D-CNN는 YAMNet보다 더 분리 가능한, 클래스에 특화된 특징을 학습하고 있으며, 음고 및 스펙트럼 변화에 더 강건한 것으로 나타났다. YAMNet은 음고 정보에 더 의존하는 경향을 보였다.

ABSTRACT

Deep neural networks are a promising tool for Audio Event Classification. In contrast to other data like natural images, there are many sensible and non-obvious representations for audio data, which could serve as input to these models. Due to their black-box nature, the effect of different input representations has so far mostly been investigated by measuring classification performance. In this work, we leverage eXplainable AI (XAI), to understand the underlying classification strategies of models trained on different input representations. Specifically, we compare two model architectures with regard to relevant input features used for Audio Event Detection: one directly processes the signal as the raw waveform, and the other takes in its time-frequency spectrogram representation. We show how relevance heatmaps obtained via "Siren"{Layer-wise Relevance Propagation} uncover representation-dependent decision strategies. With these insights, we can make a well-informed decision about the best input representation in terms of robustness and representativity and confirm that the model's classification strategies align with human requirements.

연구 동기 및 목표

  • 원시 파형 대비 스펙트로그램과 같은 다양한 입력 표현 방식이 음성 이벤트 분류에서 모델의 의사결정 과정에 미치는 영향을 조사하기 위해.
  • 모델의 분류 전략이 인간의 청각적 인지 기대와 일치하는지 평가하기 위해.
  • 필터링 및 음고 이동 등의 음성 신호 변형에 대한 모델의 강건성 평가를 위해.
  • XAI 기법을 활용해 다양한 입력 표현 간의 기저 의사결정 메커니즘을 밝히고 대조하기 위해.
  • 더 이해하기 쉬우며 강건한 분류 전략을 유도하는 입력 표현을 특정함으로써 향후 모델 설계를 안내하기 위해.

제안 방법

  • 원시 파형을 처리하는 1DCNN과 시간-주파수 스펙트로그램을 사용하는 YAMNet이라는 두 가지 CNN 아키텍처를 활용하였다.
  • DFT-LRP를 적용하여 모델 출력의 관련성을 인간이 해석할 수 있는 시간-주파수 도메인으로 입력 특징으로 역전파하였다.
  • 분류 결정에 대한 각 시간-주파수 성분의 중요도를 정량화하기 위해 관련성 히트맵을 생성하였다.
  • 특징의 분리 가능성 평가를 위해 관련성 맵의 클래스 내 및 클래스 간余弦 유사도를 계산하였다.
  • 시험 샘플에 고역통과, 저역통과 및 음고 이동 증강을 적용하여 모델의 강건성을 평가하였다.
  • 평균 관련성 패턴을 비교하기 위해 관련성 중심(Relevance Centroid) 시각화를 사용하였다.

실험 결과

연구 질문

  • RQ1원시 파형과 스펙트로그램을 기반으로 훈련된 모델의 특징 관련성 측면에서 분류 전략은 어떻게 다를까?
  • RQ2모델의 의사결정 과정은 인간이 음성 이벤트를 인지하는 방식과 일치하는가?
  • RQ3어느 입력 표현 방식이 필터링 및 음고 이동과 같은 음성 신호 변형에 더 강건한 분류 성능을 보이는가?
  • RQ4관련성 히트맵을 통해 모델이 얼마나 클래스에 특화되고 분리 가능한 특징을 드러내는가?
  • RQ5DFT-LRP의 사용이 다양한 입력 표현 간 모델 행동을 의미 있게 비교하는 데 어떻게 기여하는가?

주요 결과

  • 1DCNN 모델은 클래스 내 및 클래스 간 관련성 유사도 간의 차이가 더 크며, 이는 더 분리 가능하고 클래스에 특화된 특징을 학습하고 있음을 시사한다 (0.207 대비 0.076).
  • YAMNet은 클래스 내 및 클래스 간 유사도가 높은 편이었으며 (각각 0.593 및 0.584), 이는 더 낮은 분류 능력의 특징 학습을 의미한다.
  • 1DCNN 모델은 음성 신호 변형에 더 강건하다: 고역통과 필터링(3000 Hz) 조건에서 정확도 손실은 4.41%에 그치며, YAMNet은 18.19%의 손실을 보였다.
  • '사이렌' 클래스에 대해 ±7도 간격의 음고 이동을 적용했을 때, 1DCNN의 정확도 손실은 9.67%였고, YAMNet은 25.00%로 더 높은 손실을 보여 YAMNet이 음고에 더 의존하고 있음을 시사한다.
  • 관련성 히트맵 분석 결과, YAMNet의 결정은 음고 정보에 더 영향을 받는 반면, 1DCNN는 더 넓고 강건한 시간적 특징에 의존하는 것으로 나타났다.
  • XAI 분석 결과, 1DCNN의 전략은 인간의 인지와 더 잘 일치하며, 허위 상관관계에 덜 민감한 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.