[논문 리뷰] A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding
논문은 파인튜닝된 wav2vec 2.0 및 HuBERT 모델을 세 가지 비-ASR 작업(SER, SV, SLU)에서 벤치마크하고, 부분 파인튜닝 및 전체 파인튜닝 전략으로 데이터셋 전반에 걸쳐 최첨단 성능을 달성합니다.
Speech self-supervised models such as wav2vec 2.0 and HuBERT are making revolutionary progress in Automatic Speech Recognition (ASR). However, they have not been totally proven to produce better performance on tasks other than ASR. In this work, we explored partial fine-tuning and entire fine-tuning on wav2vec 2.0 and HuBERT pre-trained models for three non-ASR speech tasks: Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding. With simple proposed downstream frameworks, the best scores reached 79.58% weighted accuracy on speaker-dependent setting and 73.01% weighted accuracy on speaker-independent setting for Speech Emotion Recognition on IEMOCAP, 2.36% equal error rate for Speaker Verification on VoxCeleb1, 89.38% accuracy for Intent Classification and 78.92% F1 for Slot Filling on SLURP, showing the strength of fine-tuned wav2vec 2.0 and HuBERT on learning prosodic, voice-print and semantic representations.
연구 동기 및 목표
- 파인튜닝된 wav2vec 2.0 및 HuBERT의 비-ASR 음성 작업에 대한 효과성 시연
- 다운스트림 작업에 대한 부분 파인튜닝 대 전체 파인튜닝 비교
- SER 및 SLU를 위한 오픈소스 파인튜닝 모델 및 다운스트림 프레임워크 제공
제안 방법
- 네 가지 사전 학습 모델 비교(wav2vec 2.0 base/large, ASR 파인튜닝 여부 포함; HuBERT base/large, ASR 파인튜닝 여부 포함)
- CNN 인코더를 고정(부분)하거나 모든 레이어를 파인튜닝하여 파인튜닝
- 간단한 다운스트림 어댑터 부착: SER 및 SV에 대해 평균 풀링 + 선형 분류기; SLU에 대해 어텐션 디코더
- Adam으로 학습하되 인코더와 다운스트림 구성 요소 각각에 대해 별도 스케줄러 사용
- 다음에서 평가: IEMOCAP(SER), VoxCeleb1(SV), SLURP(SLU)
실험 결과
연구 질문
- RQ1자기감쇠형(Self-supervised) 인코더를 파인튜닝하는 것이 고정 특징 기반 시나리오를 넘어 SER, SV, SLU를 개선할 수 있는가
- RQ2데이터가 제한된 SER에서 부분 파인튜닝이 전체 파인튜닝보다 더 효과적인가
- RQ3 HuBERT가 이러한 다운스트림 작업에서 wav2vec 2.0보다 성능이 나은가
- RQ4ASR 파인튜닝이 비-ASR 작업 성능에 미치는 영향은 무엇인가
- RQ5다양한 모델 규모(base vs large)가 작업 전반의 결과에 어떤 차이를 만드는가
주요 결과
- 부분 파인튜닝된 HuBERT large는 SER-SD에서 79.58% WA(최고) 및 SER-SI에서 73.01% WA를 달성
- 전체 파인튜닝 HuBERT large에 ASR 파인튜닝을 적용하면 SV에서 2.36% EER(최고) 및 PF-960h 변형에서 2.38% EER를 달성
- HuBERT는 일반적으로 SER 및 SV에서 wav2vec 2.0보다 우수한 성능을 보임
- SLU 결과는 EF-hbt-large에서 IC 89.38% 및 PF-hbt-large에서 SF 78.92%로 나타남
- ASR 파인튜닝이 항상 SER 및 SLU에 도움이 되지 않으며 일부 경우에 프로소디/의미 정보 손실을 시사
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.