Skip to main content
QUICK REVIEW

[논문 리뷰] Sound Event Detection of Weakly Labelled Data with CNN-Transformer and Automatic Threshold Optimization

Qiuqiang Kong, Yong Xu|View|2019. 12. 10.
Music and Audio Processing참고 문헌 47인용 수 5
한 줄 요약

이 논문은 약한 레이블이 부여된 오디오 데이터에서 음향 이벤트 검출(Sound Event Detection, SED)을 위한 CNN-Transformer 모델을 제안하며, 클립 단위 학습과 자동 임계값 최적화 방법을 결합하여 성능을 햖थ한다. 이 방법은 두 단계 과정을 통해 임계값을 최적화함으로써 음향 태깅(AT)의 경우 F1 점수 0.646, SED의 경우 0.584의 최신 기술 수준(SOTA) 성능을 달성하여 경험적 임계값 설정 및 이전 방법들을 능가한다.

ABSTRACT

Sound event detection (SED) is a task to detect sound events in an audio recording. One challenge of the SED task is that many datasets such as the Detection and Classification of Acoustic Scenes and Events (DCASE) datasets are weakly labelled. That is, there are only audio tags for each audio clip without the onset and offset times of sound events. \qk{We compare segment-wise and clip-wise training for SED that is lacking in previous works. We propose a convolutional neural network transformer (CNN-Transfomer) for audio tagging and SED, and show that CNN-Transformer performs similarly to a convolutional recurrent neural network (CRNN)}. Another challenge of SED is that thresholds are required for detecting sound events. Previous works set thresholds empirically, and are not an optimal approaches. To solve this problem, we propose an automatic threshold optimization method. The first stage is to optimize the system with respect to metrics that do not depend on thresholds, such as mean average precision (mAP). The second stage is to optimize the thresholds with respect to metrics that depends on those thresholds. Our proposed automatic threshold optimization system achieves a state-of-the-art audio tagging F1 of 0.646, outperforming that without threshold optimization of 0.629, and a sound event detection F1 of 0.584, outperforming that without threshold optimization of 0.564.

연구 동기 및 목표

  • 약한 레이블이 부여된 데이터에서 오직 클립 수준의 태그만 제공되며, 발생 시점(onset) 및 종료 시점(offset) 정보가 없는 음향 이벤트 검출(Sound Event Detection, SED) 문제를 해결하기 위함.
  • 약한 레이블이 부여된 데이터 환경에서 음향 이벤트 검출(SED)과 음향 태깅(AT)에 대해 세그먼트 단위 학습과 클립 단위 학습 전략을 비교하기 위함.
  • 기존의 경험적 임계값 선택 방식을 뛰어넘어 SED 및 AT 성능을 향상시킬 수 있는 새로운 자동 임계값 최적화 방법을 개발하기 위함.
  • CRNN 대비 CNN-Transformer 아키텍처가 장거리 시간적 의존성을 얼마나 잘 포착하는지 평가하기 위함.
  • 약한 지도 학습을 위한 DCASE 2017 Task 4 데이터셋에서 최신 기술 수준의 성능을 달성하기 위함.

제안 방법

  • 음성 스펙트로그램의 장거리 시간적 의존성을 모델링하기 위해 컨볼루션 특징 추출과 자기주의(self-attention) 메커니즘을 결합한 CNN-Transformer 아키텍처를 제안한다.
  • 전체 오디오 클립을 세그먼트로 분할하지 않고 전체 클립을 입력으로 사용하는 클립 단위 학습을 적용하여 전역적 맥락을 유지한다.
  • 두 단계 자동 임계값 최적화 방법을 도입: 첫 번째 단계에서는 임계값에 의존하지 않는 지표(예: mAP)를 사용해 모델 파라미터를 최적화하고, 두 번째 단계에서는 임계값에 의존하는 지표(예: F1)를 사용해 임계값을 최적화한다.
  • 검증 세트를 활용해 그리드 서치 또는 최적화 알고리즘을 통해 임계값을 튜닝하며, 검증 분할에서 F1 점수를 최대화하는 임계값을 선택한 후 평가 세트에 대해 테스트한다.
  • 최종 레이어 출력에 시그모이드 활성화 함수를 적용하여 클래스별 확률 점수를 도출하고, 이를 임계값을 초과하면 이벤트 존재 여부를 예측한다.
  • 표준 지표인 평균 평균 정밀도(mAP), F1 점수, 오차율(ER)을 사용해 AT 및 SED 작업 모두의 성능을 평가한다.

실험 결과

연구 질문

  • RQ1약한 지도 학습 환경에서 클립 단위 학습과 세그먼트 단위 학습 간의 성능 비교는 어떻게 이루어지나?
  • RQ2CNN-Transformer 모델은 병렬 계산을 가능하게 하면서도 CRNN 모델과 유사한 성능을 달성할 수 있는가?
  • RQ3경험적 고정 임계값 대비 자동 임계값 최적화가 음향 태깅과 음향 이벤트 검출에서 F1 점수 향상에 뚜렷한 기여를 하는가?
  • RQ4가장 잘 검출되고, 가장 잘 검출되지 않는 음향 클래스는 무엇이며, 임계값 최적화가 이들의 성능에 어떤 영향을 미치는가?
  • RQ5제안된 방법은 DCASE 2017 Task 4 벤치마크에서 약한 레이블이 부여된 SED에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 평가 세트에서 CNN-Transformer 모델은 음향 태깅 F1 점수 0.646을 기록하여 임계값 최적화 없이 학습한 베이스라인(0.629)을 능가한다.
  • 자동 임계값 최적화를 적용한 SED 시스템은 F1 점수 0.584를 달성하여 최적화되지 않은 버전(0.564)보다 향상된 성능을 보였다.
  • 자동 임계값 최적화로 인해 평가 세트에서 오차율(ER)이 0.78에서 0.68로 감소하여 SED 성능 향상이 뚜렷하게 확인되었다.
  • 클립 단위 학습 전략은 음향 태깅에서 mAP 0.650, SED에서 ER 0.68을 기록하여 DCASE 2017 데이터셋에서 뛰어난 성능을 보였다.
  • CNN-Transformer는 CRNN 기반 모델과 유사한 성능를 보였지만, 병렬 계산이 가능하여 계산적 이점이 있었다.
  • 이 방법은 DCASE 2017 Task 4 벤치마크에서 이전의 방법들(집합 모델 포함)을 뛰어넘는 최신 기술 수준의 성능을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.