Skip to main content
QUICK REVIEW

[논문 리뷰] Polyphonic audio tagging with sequentially labelled data using CRNN with learnable gated linear units

Yuanbo Hou, Qiuqiang Kong|arXiv (Cornell University)|2018. 11. 17.
Music and Audio Processing참고 문헌 15인용 수 10
한 줄 요약

이 논문은 순차적으로 레이블링된 데이터(SLD)를 사용한 다성분 음악 태깅을 위해 학습 가능한 게이팅 선형 유닛(GLU)을 갖춘 CRNN(GLU-CTC)을 제안한다. 여기서 CTC 손실은 프레임 수준의 예측을 클립 수준의 레이블로 매핑한다. 이 방법은 AUC 0.882를 기록하며, 기준 CRNN(0.837), GLU-GMP(0.803), GLU-GAP(0.766)를 모두 능가하여 우수한 시퀀스 모델링 및 레이블 매핑 능력을 입증한다.

ABSTRACT

Audio tagging aims to detect the types of sound events occurring in an audio recording. To tag the polyphonic audio recordings, we propose to use Connectionist Temporal Classification (CTC) loss function on the top of Convolutional Recurrent Neural Network (CRNN) with learnable Gated Linear Units (GLU-CTC), based on a new type of audio label data: Sequentially Labelled Data (SLD). In GLU-CTC, CTC objective function maps the frame-level probability of labels to clip-level probability of labels. To compare the mapping ability of GLU-CTC for sound events, we train a CRNN with GLU based on Global Max Pooling (GLU-GMP) and a CRNN with GLU based on Global Average Pooling (GLU-GAP). And we also compare the proposed GLU-CTC system with the baseline system, which is a CRNN trained using CTC loss function without GLU. The experiments show that the GLU-CTC achieves an Area Under Curve (AUC) score of 0.882 in audio tagging, outperforming the GLU-GMP of 0.803, GLU-GAP of 0.766 and baseline system of 0.837. That means based on the same CRNN model with GLU, the performance of CTC mapping is better than the GMP and GAP mapping. Given both based on the CTC mapping, the CRNN with GLU outperforms the CRNN without GLU.

연구 동기 및 목표

  • 겹침 소리 이벤트가 포함된 녹음물에서 다성분 음악 태깅의 과제를 해결하기 위해.
  • 각 음성 클립에 시간 순서로 다수의 이벤트 레이블이 포함된 순차적으로 레이블링된 데이터(SLD)를 활용하기 위해.
  • CTC 손실을 통해 프레임 수준의 예측에서 클립 수준의 이벤트 탐지로의 레이블 매핑을 향상시키기 위해.
  • 학습 가능한 게이팅 선형 유닛(GLU)이 CRNN 성능을 향상시키는 데 기여하는지 평가하기 위해.

제안 방법

  • 음성 시퀀스의 시간적 의존성을 모델링하기 위해 학습 가능한 게이팅 선형 유닛(GLU)을 갖춘 CRNN 아키텍처를 제안한다.
  • 프레임 수준의 레이블 확률을 클립 수준의 이벤트 탐지로 매핑하기 위해 커넥티스트 텀포럴 클래식리피케이션(CTC) 손실을 적용한다.
  • 각 음성 클립이 시간 순서로 다수의 소리 이벤트 레이블이 포함된 순차적으로 레이블링된 데이터(SLD)를 사용한다.
  • GLU-CTC를 글로벌 최대 풀링(GMP)과 글로벌 평균 풀링(GAP)을 사용한 CRNN 변종과 비교하여 프레임에서 클립으로의 매핑을 평가한다.
  • 변동 길이의 레이블 시퀀스와 프레임 수준의 예측을 처리하기 위해 CTC 손실을 사용해 모델을 훈련시킨다.
  • DCASE2018 음악 태깅 벤치마크에서 ROC 곡선 아래 면적(AUC)을 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1GMP 및 GAP와 같은 글로벌 풀링 방법과 비교해 CTC 기반의 레이블 매핑이 다성분 음악 태깅 성능 향상에 기여하는가?
  • RQ2학습 가능한 게이팅 선형 유닛(GLU)의 통합이 다성분 환경에서 복잡한 음성 시퀀스를 모델링하는 데 CRNN의 능력을 향상시키는가?
  • RQ3표준 CRNN에 CTC 손실를 적용한 경우와 비교해 GLU-CTC 모델이 순차적으로 레이블링된 데이터(SLD)에서 성능은 어떻게 되는가?
  • RQ4음악 태깅에서, 글로벌 풀링보다 CTC 손실 함수가 프레임 수준의 예측을 클립 수준의 레이블로 집계하는 데 더 효과적인가?
  • RQ5GLU와 CTC 손실이 다성분 음악 태깅의 AUC 성능 향상에 기여하는 상대적 기여도는 어떠한가?

주요 결과

  • GLU-CTC 모델은 AUC 0.882를 기록하며, CTC를 사용하는 기준 CRNN(0.837)를 뚜렷이 앞서간다.
  • GLU-CTC는 GLU-GMP(0.803)와 GLU-GAP(0.766)를 모두 앞서며, CTC 기반 매핑이 레이블 집계에 있어 글로벌 풀링보다 더 효과적임을 입증한다.
  • 학습 가능한 게이팅 선형 유닛(GLU)의 통합은 동일한 CTC 손실을 사용하더라도 표준 CRNN보다 성능 향상을 이룬다.
  • CTC 손실 함수는 다성분 음성에서 시간적 관계를 더 잘 모델링할 수 있게 해주며, 특히 겹침 및 순차적인 소리 이벤트에 유리하다.
  • 결과는 GLU와 CTC 손실이 SLD에서 음악 태깅 성능 향상에 상호보완적으로 기여함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.