Skip to main content
QUICK REVIEW

[논문 리뷰] Audio Set classification with attention model: A probabilistic perspective

Qiuqiang Kong, Yong Xu|View|2017. 11. 02.
Music and Audio Processing참고 문헌 12인용 수 8
한 줄 요약

이 논문은 대규모 AudioSet 데이터셋에서 음성 태깅을 위한 주의 기반 딥러닝 모델을 제안하며, 주의를 한 번에 한 개의 인스턴스에 대한 학습 가능한 확률 측도로 간주한다. 완전 연결 신경망에 소프트맥스 활성화를 적용한 방법은 mAP 0.327을 달성하여 Google의 베이스라인(0.314)과 RNN 기반 모델(0.325)을 능가한다. 이는 주의 점수에 가중치를 부여한 인스턴스 예측의 기대값으로서 백 수준 분류를 모델링함으로써 달성된다.

ABSTRACT

This paper investigates the classification of the Audio Set dataset. Audio Set is a large scale weakly labelled dataset of sound clips. Previous work used multiple instance learning (MIL) to classify weakly labelled data. In MIL, a bag consists of several instances, and a bag is labelled positive if at least one instances in the audio clip is positive. A bag is labelled negative if all the instances in the bag are negative. We propose an attention model to tackle the MIL problem and explain this attention model from a novel probabilistic perspective. We define a probability space on each bag, where each instance in the bag has a trainable probability measure for each class. Then the classification of a bag is the expectation of the classification output of the instances in the bag with respect to the learned probability measure. Experimental results show that our proposed attention model modeled by fully connected deep neural network obtains mAP of 0.327 on Audio Set dataset, outperforming the Google's baseline of 0.314 and recurrent neural network of 0.325.

연구 동기 및 목표

  • 527개 클래스를 가진 대규모 AudioSet 데이터셋에서 약한 감독 하에 음성 태깅 문제를 해결하기 위해.
  • Google의 완전 연결 DNN 및 RNN 기반 모델과 같은 기존 베이스라인을 넘어서 분류 성능 향상을 위해.
  • 다중 인스턴스 학습(MIL)의 맥락에서 주의 기반 메커니즘에 대한 새로운 확률적 해석을 제공하기 위해.
  • 주의 가중치 모델링을 위한 다양한 비음수 활성화 함수(ReLU, sigmoid, softmax)의 효과를 탐색하기 위해.

제안 방법

  • 각 인스턴스에 대한 분류기와 주의(확률 측도)를 모두 세 개의 완전 연결 레이어, ReLU 활성화 함수, 드롭아웃을 사용한 깊은 신경망을 통해 모델링한다.
  • 백 내의 각 인스턴스에 대한 주의 가중치를 임베딩 표현의 정규화된 비음수 함수로 정의하며, 소프트맥스가 가장 높은 성능을 보였다.
  • 학습된 주의 점수에 가중치를 부여한 인스턴스 수준 예측의 기대값으로서 백 수준 예측을 계산하며, 수식으로는 E[f_k(x) | p_k(x)] = Σ p_k(x) * f_k(x) (백 내의 인스턴스에 대해)로 표현된다.
  • 약한 레이블이 부여된 AudioSet 데이터셋의 클래스 불균형 문제를 완화하기 위해 데이터 밸런싱 전략을 적용한다.
  • 입력으로는 YouTube-100M에서 사전 훈련된 모델의 블로킹 특징을 사용하며, 1초 간격으로 128차원으로 압축된 PCA 특징을 추출한다.
  • 모든 527개 클래스에 대해 평균 정밀도(mAP), AUC, d-prime를 평가 지표로 사용한다.

실험 결과

연구 질문

  • RQ1기존의 풀링 전략과 비교해 볼 때, 주의를 학습 가능한 확률 측도로 모델링한 주의 기반 메커니즘이 대규모 AudioSet 데이터셋에서 음성 태깅 성능 향상에 기여할 수 있는가?
  • RQ2비음수 활성화 함수(ReLU, sigmoid, softmax)의 선택이 MIL 프레임워크 내 주의 기반 메커니즘의 성능에 어떤 영향을 미치는가?
  • RQ3제안된 확률적 주의 모델이 mAP 및 AUC 측면에서 Google의 베이스라인과 RNN 기반 모델을 능가하는가?
  • RQ4데이터 밸런싱 전략이 AudioSet의 장꼬리 클래스 분포에서 주의 모델의 일반화 능력을 어느 정도 향상시키는가?
  • RQ5주어진 특징 선택과 유사한 점을 고려할 때, 주의 기반 메커니즘이 관련 음성 이벤트를 효과적으로 국소화하고 배경 잡음을 억제하는 데 성공하는가?

주요 결과

  • 소프트맥스 활성화를 적용한 제안된 주의 모델은 mAP 0.327을 달성하여 Google의 베이스라인(0.314)과 RNN 평균 풀링 모델(0.325)을 능가한다.
  • 데이터 밸런싱 전략을 적용함으로써 mAP는 0.275에서 0.296로 향상되어 클래스 불균형 완화에 효과적임을 입증한다.
  • 비음수 활성화 함수 중에서 소프트맥스가 ReLU 및 sigmoid보다 뛰어나며, mAP 0.327, AUC 0.965, d-prime 2.558의 성능을 기록한다.
  • 평균 풀링 및 최대 풀링은 제안된 주의 기반 메커니즘보다 성능이 열 劣하며, 평균 풀링은 mAP 0.296, 최대 풀링은 mAP 0.284를 기록한다.
  • 주의 기반 메커니즘이 관련된 음성 세그먼트에 더 높은 가중치를 할당하는 방식으로 효과적으로 학습함으로써, 더 나은 국소화 능력과 배경 잡음에 대한 강건성을 확보한다.
  • 주의를 학습 가능한 확률 측도로 간주하는 확률적 해석은 음성 태깅 분야의 다중 인스턴스 학습(MIL)에 체계적이고 해석 가능한 프레임워크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.