[논문 리뷰] Training sound event detection with soft labels from crowdsourced annotations
이 논문은 음향 이벤트 검출(Sed) 시스템을 인과자들의 공유된 애너테이션에서 유도된 소프트 레이블을 사용하여 훈련하는 방법을 제안한다. 이 소프트 레이블은 애너테이터의 불확실성과 공감을 반영한다. 여러 애너테이터의 능력 가중 평균을 통해 계산된 이러한 소프트 레이블을 활용함으로써, 기존의 하드 레이블 훈련에서 간과되는 희귀 음향 클래스의 검출이 향상되며, 클래스별 임계값 설정을 통해 희귀 사건의 검출 성능이 향상된다. 특히 평균 제곱 오차(MSE) 손실과 소프트 레이블 감독을 사용할 경우 최고의 성능을 기록한다.
In this paper, we study the use of soft labels to train a system for sound event detection (SED). Soft labels can result from annotations which account for human uncertainty about categories, or emerge as a natural representation of multiple opinions in annotation. Converting annotations to hard labels results in unambiguous categories for training, at the cost of losing the details about the labels distribution. This work investigates how soft labels can be used, and what benefits they bring in training a SED system. The results show that the system is capable of learning information about the activity of the sounds which is reflected in the soft labels and is able to detect sounds that are missed in the typical binary target training setup. We also release a new dataset produced through crowdsourcing, containing temporally strong labels for sound events in real-life recordings, with both soft and hard labels.
연구 동기 및 목표
- 장기간의 강한 레이블이 부족한 대규모 SED 데이터셋 문제를 해결하기 위해, 시간적으로 강한 레이블이 부여된 새로운 데이터셋을 구축한다.
- 애너테이터의 불확실성과 공감을 반영한 소프트 레이블이 기존의 하드 레이블 대비 SED 모델 성능 향상에 기여하는지 조사한다.
- 소프트 레이블을 사용할 때, 다양한 훈련 목표 함수(BCE 대비 MSE)의 효과를 평가한다.
- 소프트 레이블 감독이 기존 하드 레이블 훈련에서 간과되는 부족한 음향 클래스의 검출을 가능하게 하는지 확인한다.
- 희귀 이벤트 탐지 민감도를 향상시키기 위해 클래스별 임계값 전략을 탐색한다.
제안 방법
- 중첩된 약한 레이블이 부여된 세그먼트를 활용해 공유된 애너테이션을 수집하였으며, 애너테이터들은 사전 정의된 음향 이벤트의 존재/부재를 표시하였다.
- 여러 애너테이터의 의견을 MACE-추정된 능력에 따라 가중 평균하여 소프트 레이블을 계산하였으며, 활성도 점수는 0에서 1 사이의 값을 가졌다.
- 실생활 음향 환경 5개, 음향 클래스 17개를 포함하며 소프트 레이블과 하드 레이블을 모두 제공하는 새로운 데이터셋 MAESTRO-Real을 공개하였다.
- SED 모델은 소프트 레이블을 사용하여 이진 교차 엔트로피(BCE) 및 평균 제곱 오차(MSE) 손실 함수로 훈련되었다.
- 시스템 출력은 하드 레이블 기반 1초 세그먼트 F1 스코어와 오차율(ER), 소프트 레이블 기반 카우프만-라이블러 발산(KLD)을 사용해 평가되었다.
- 희귀 이벤트 탐지 민감도를 최적화하기 위해 각 클래스별로 10% 커팅된 중간 범위 임계값을 사용하여 클래스별 성능을 분석하였다.
실험 결과
연구 질문
- RQ1공유된 애너테이션에서 유도된 소프트 레이블이 하드 레이블 대비 음향 이벤트 검출 성능 향상에 기여하는가?
- RQ2소프트 레이블 훈련을 통해 기존 하드 레이블 훈련에서 간과되는 부족한 클래스의 검출이 가능한가?
- RQ3다양한 손실 함수(BCE 대비 MSE)가 소프트 레이블 감독과 어떻게 상호작용하는가?
- RQ4소프트 예측과 소프트 레퍼런스 간 KLD는 모델의 校정성과 불확실성 모델링을 어느 정도 반영하는가?
- RQ5소프트 레이블 감독을 사용할 때 클래스별 임계값 전략이 희귀 이벤트 탐지 성능 향상에 기여하는가?
주요 결과
- 소프트 레이블과 MSE 손실을 사용해 훈련한 S_MSE_lin 모델은 가장 높은 마이크로 평균 F1 스코어(70.82%)와 소프트 레퍼런스와 가장 낮은 KLD(1.383)를 기록하여 소프트 레이블 분포와 가장 잘 일치함을 보였다.
- 하드 레이블과 BCE 손실을 사용해 훈련한 H_BCE_sig 모델은 훈련 목표 함수 내 클래스 불균형으로 인해 부족한 클래스를 탐지하지 못했다.
- MSE 손실을 사용한 소프트 레이블 훈련은 소프트 레이블 값이 0.5 이하일지라도 모든 음향 클래스의 검출을 가능하게 하였으며, 고정된 0.5 임계값을 적용할 경우 이러한 정보가 손실되는 것을 방지하였다.
- 소프트 레이블의 10% 커팅된 중간 범위를 기반으로 한 클래스별 임계값을 적용함으로써 클래스별 F1 스코어가 크게 향상되었으며, 전체 ER(0.47)와 F1(67.30%)는 최고 성능의 하드 레이블 모델 대비 약간 증가했지만, 희귀 이벤트 탐지 민감도 향상에 기여하였다.
- KLD 지표는 S_MSE_lin 모델의 소프트 출력이 레퍼런스 소프트 레이블에 가장 가까웠음을 확인하여 효과적인 불확실성 모델링을 입증하였다.
- 소프트 레이블과 하드 레이블을 모두 포함한 MAESTRO-Real 데이터셋의 공개는 향후 불확실성 인식 애너테이션을 활용한 SED 연구를 위한 유의미한 기준이 된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.