Skip to main content
QUICK REVIEW

[논문 리뷰] Introducing ECAPA-TDNN and Wav2Vec2.0 Embeddings to Stuttering Detection

Shakeel A. Sheikh, Md Sahidullah|arXiv (Cornell University)|2022. 04. 04.
Stuttering Research and Treatment인용 수 4
한 줄 요약

이 논문은 대규모 음성 데이터셋에서 사전 훈련된 모델을 활용하여 제한된 스탑니어 데이터를 보완하고, 스탑니어 감지에 ECAPA-TDNN 및 Wav2Vec2.0 임베딩을 도입한다. ECAPA-TDNN의 발화자 임베딩과 Wav2Vec2.0의 문맥적 표현을 융합함으로써 기준 모델 대비 16.74% 상대 정확도 향상을 달성하였으며, 특히 다중 레이어 연결과 점수 융합을 통해 성능 향상이 두드러졌다.

ABSTRACT

The adoption of advanced deep learning (DL) architecture in stuttering detection (SD) tasks is challenging due to the limited size of the available datasets. To this end, this work introduces the application of speech embeddings extracted with pre-trained deep models trained on massive audio datasets for different tasks. In particular, we explore audio representations obtained using emphasized channel attention, propagation, and aggregation-time-delay neural network (ECAPA-TDNN) and Wav2Vec2.0 model trained on VoxCeleb and LibriSpeech datasets respectively. After extracting the embeddings, we benchmark with several traditional classifiers, such as a k-nearest neighbor, Gaussian naive Bayes, and neural network, for the stuttering detection tasks. In comparison to the standard SD system trained only on the limited SEP-28k dataset, we obtain a relative improvement of 16.74% in terms of overall accuracy over baseline. Finally, we have shown that combining two embeddings and concatenating multiple layers of Wav2Vec2.0 can further improve SD performance up to 1% and 2.64% respectively.

연구 동기 및 목표

  • 스탑니어 데이터셋의 제한성과 편향 문제를 해결하여 딥 러닝 모델을 활용한 스탑니어 감지에 도전한다.
  • 특히 ECAPA-TDNN 및 Wav2Vec2.0와 같은 사전 훈련된 음성 임베딩의 전이 가능성에 대해 탐구한다.
  • ECAPA-TDNN 및 Wav2Vec2.0 임베딩을 점수 융합 및 임베딩 융합 방식으로 융합하여 감지 성능 향상에 미치는 영향을 분석한다.
  • Wav2Vec2.0의 다양한 은닉 레이어와 그 연결이 어색한 발화 패턴을 포착하는 데 기여하는 방식을 분석한다.
  • 사전 훈련된 모델에서 유도된 문맥적 표현과 발화자 수준의 표현이 희귀 스탑니어 유형 감지에 크게 기여함을 입증한다.

제안 방법

  • VoxCeleb에서 발화자 확인을 위해 미세조정한 사전 훈련된 ECAPA-TDNN의 완전 연결층에서 192차원의 발화자 임베딩을 추출한다.
  • LibriSpeech에서 사전 훈련된 Wav2Vec2.0 모델의 여러 레이어(L1, L7, L11)에서 로컬 인코더와 문맥 모듈을 사용하여 문맥적 음성 표현을 확보한다.
  • 후속 분류 작업에서 클래스 간 분離도를 향상시키기 위해 Wav2Vec2.0 임베딩의 차원을 감소시키기 위해 선형 판별 분석(LDA)을 적용한다.
  • 추출된 임베딩을 기반으로 k-최근접 이웃(KNN), 나이브 베이즈(NBC), 다층 퍼셉트론(MLP) 등의 다양한 분류기 모델을 훈련 및 평가한다.
  • 최적화된 가중치 파rameter α=0.9를 사용하여 ECAPA-TDNN 및 Wav2Vec2.0 모델의 예측 확률을 융합함으로써 점수 융합을 구현한다.
  • ECAPA-TDNN 및 Wav2Vec2.0 임베딩을 결합하여 분류기 입력 전에 융합함으로써 상호 보완적 정보를 활용하는 임베딩 융합을 수행한다.

실험 결과

연구 질문

  • RQ1ECAPA-TDNN 및 Wav2Vec2.0 사전 훈련된 임베딩은 SEP-28k와 같은 작은 데이터셋에서 스탑니어 감지 성능 향상에 기여하는가?
  • RQ2Wav2Vec2.0의 레이어 선택(L1, L7, L11)이 감지 성능에 미치는 영향은 어떠한가? 또한, 여러 레이어의 연결이 성능 향상에 기여하는가?
  • RQ3ECAPA-TDNN 및 Wav2Vec2.0 임베딩 간 점수 융합이 개별 모델 대비 감지 정확도 향상에 얼마나 기여하는가?
  • RQ4임베딩 수준 융합을 통해 ECAPA-TDNN 및 Wav2Vec2.0 임베딩을 융합할 경우 점수 융합 대비 성능 향상이 더 높은가?
  • RQ5다양한 스탑니어 유형(정지, 반복, 연장, 중간 말하기, 정상 발화)에서 임베딩 성능은 어떻게 나타나며, 특히 소수 유형에 대해선 어떤가?

주요 결과

  • 신경망 분류기에서 Wav2Vec2.0 임베딩을 사용할 경우, SEP-28k 데이터셋 전용으로 훈련된 기준 시스템 대비 전체 정확도에서 16.74% 상대적 향상을 달성한다.
  • ECAPA-TDNN 및 Wav2Vec2.0 임베딩을 점수 융합 방식으로 융합하면 신경망 기반 분류기에서 전체 정확도가 67.26%로 향상되며, 개별 모델보다 뛰어난 성능을 보인다.
  • Wav2Vec2.0의 L1, L7, L11 레이어 표현을 연결함으로써 기준 시스템 대비 감지 성능이 2.64% 향상되었으며, 특히 정지와 연장과 같은 소수 유형의 인식률 향상에 기여한다.
  • Wav2Vec2.0 임베딩에 LDA를 적용하면 전체 정확도에서 7.28% 향상되었으며, 정지 유형(49.88%)과 연장 유형(14.77%)에서 가장 큰 성과를 보였다.
  • ECAPA-TDNN 임베딩은 Wav2Vec2.0만 사용하는 것보다 정상 발화 감지 정확도를 KNN 기준 5.34%, NBC 기준 1.13%, 신경망 기준 5.13% 향상시켰으며, 강력한 발화자 신원 정보를 제공함을 시사한다.
  • ECAPA-TDNN 및 Wav2Vec2.0 임베딩을 임베딩 수준에서 융합한 결과, 신경망 기반 분류기에서 전체 정확도가 68.35%로 가장 높았으며, 정지 유형(23.86%)과 중간 말하기 유형(69.54%)에서 기준 대비 뚜렷한 향상이 관찰되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.