Skip to main content
QUICK REVIEW

[논문 리뷰] How Does Pre-trained Wav2Vec 2.0 Perform on Domain Shifted ASR? An Extensive Benchmark on Air Traffic Control Communications

Juan Zuluaga-Gómez, Amrutha Prasad|arXiv (Cornell University)|2022. 03. 31.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

이 연구는 표준 ASR 데이터셋과 상당한 음향적·언어적 차이를 보이는 항공교통통제(ATC) 통신 분야에서 사전 훈련된 Wav2Vec 2.0 및 XLS-R 모델의 강건성 평가를 수행한다. 도메인 내 데이터 5분 미만으로도 테스트한 결과, 하이브리드 기반 기준 대비 상대적 WER 감소율이 20–40%에 이르며, 전통적 시스템이 8시간의 데이터를 필요로 하는 것보다 성능이 뛰어나며, 여성 음성에 유리한 체계적 성별 편향도 드러났다.

ABSTRACT

Recent work on self-supervised pre-training focus on leveraging large-scale unlabeled speech data to build robust end-to-end (E2E) acoustic models (AM) that can be later fine-tuned on downstream tasks e.g., automatic speech recognition (ASR). Yet, few works investigated the impact on performance when the data properties substantially differ between the pre-training and fine-tuning phases, termed domain shift. We target this scenario by analyzing the robustness of Wav2Vec 2.0 and XLS-R models on downstream ASR for a completely unseen domain, air traffic control (ATC) communications. We benchmark these two models on several open-source and challenging ATC databases with signal-to-noise ratio between 5 and 20 dB. Relative word error rate (WER) reductions between 20% to 40% are obtained in comparison to hybrid-based ASR baselines by only fine-tuning E2E acoustic models with a smaller fraction of labeled data. We analyze WERs on the low-resource scenario and gender bias carried by one ATC dataset.

연구 동기 및 목표

  • 사전 훈련된 자기지도 학습 모델인 Wav2Vec 2.0 및 XLS-R의 강건성을 완전히 새로운 도메인인 항공교통통제(ATC) 통신에 적용하여 평가하는 것.
  • 하이브리드 기반 ASR 시스템과 동등한 성능을 달성하기 위해 필요한 최소한의 도메인 내 레이블된 데이터 양을 규명하는 것.
  • ATC 음성 데이터를 토대로 테스트할 때 성별 편차가 ASR 성능에 미치는 영향과 인식 정확도에서 측정 가능한 성별 편향이 존재하는지 조사하는 것.
  • 공개된 ATC 코퍼스를 기반으로 오픈소스 기반선과 재현 가능한 실험을 구축하여 이나마 다뤄지지 않은 도메인에서의 연구를 촉진하는 것.

제안 방법

  • 신호 대 잡음비(5–20 dB)가 다양한 개방형 ATC 음성 데이터셋을 대상으로 Wav2Vec 2.0 및 XLS-R 모델을 테스트 및 미세조정.
  • 5분에서 15시간까지 다양하게 변하는 레이블된 데이터를 활용한 저자원 미세조정 실험을 수행하여 데이터 효율성 평가.
  • 디코딩 전략 영향 평가를 위해 도메인 내 언어모델을 활용한 그레디 디코딩 및 빔 서치를 수행.
  • 성능 향상을 정량화하기 위해 엔드 투 엔드(E2E) 모델과 하이브리드 기반 ASR 기준 모델을 비교.
  • ATCO2-Test 및 ATCOSIM 데이터셋에서 성별별 성능 분석을 수행하여, 다양한 미세조정 데이터 스케일에서의 WER 평가.
  • 재현 가능성을 보장하고 ATC ASR 분야의 오픈 사이언스를 지원하기 위해 GitHub에 공개 코드 및 기반선을 배포.

실험 결과

연구 질문

  • RQ1사전 훈련 데이터와 상당한 도메인 이탈이 발생하는 항공교통통제(ATC) 통신에 대해 사전 훈련된 Wav2Vec 2.0 및 XLS-R 모델의 강건성은 어떠한가?
  • RQ2하이브리드 기반 ASR 시스템과 동등한 성능을 달성하기 위해 E2E 모델을 미세조정하기 위해 필요한 최소한의 도메인 내 ATC 음성 데이터는 얼마인가?
  • RQ3ATC 음성에서의 성별 편차는 사전 훈련된 E2E ASR 모델의 성능에 어떤 영향을 미치며, 인식 정확도에서 측정 가능한 성별 편향이 존재하는가?
  • RQ4저자원 ATC ASR 환경에서 도메인 내 언어모델 통합이 WER에 어떤 영향을 미치는가?
  • RQ5다국적 어조를 가진 ATC 데이터에서 다국어 XLS-R 모델이 단일어 Wav2Vec 2.0 모델보다 더 우수한 성능을 보일 수 있는가? 이는 어조에 영향을 받지 않는 표현 덕분인가?

주요 결과

  • 도메인 내 ATC 데이터 5분으로도 Wav2Vec 2.0를 미세조정한 결과, ISAVIA 및 NATS 테스트 세트에서 각각 40% 및 43.9%의 WER를 기록하여 높은 데이터 효율성을 입증하였다.
  • 8시간의 미세조정 데이터를 활용한 Wav2Vec 2.0는 ISAVIA 및 NATS에서 WER가 10% 이하로 떨어졌으며, 하이브리드 기반 ASR 기준 모델을 초월하는 성능을 보였다.
  • 하이브리드 기준 모델 대비 ISAVIA 및 NATS에서 상대적 WER 감소율이 20–40%로 관찰되었으며, 이는 제한된 도메인 내 데이터를 사용한 경우에도 성립하였다.
  • UWB-ATCC 데이터로 훈련한 모델은 LDC-ATCC에서 54%의 WER를 기록했고, 반대로 LDC-ATCC 데이터로 훈련한 모델은 64%의 WER를 기록하여 강력한 도메인 특화 적응 효과를 보였다.
  • 여성 음성 녹음본은 항상 남성 음성 녹음본보다 뛰어난 성능을 보였으며, 1시간에서 3.5시간으로 미세조정 데이터를 늘일 경우 여성의 WER 감소율은 29.79%였고, 남성의 경우 21.74%였다.
  • 결과적으로 Wav2Vec 2.0 모델에는 약간의 성별 편향이 존재할 수 있으며, 이는 사전 훈련 데이터의 불균형 때문일 수 있으며, 더 많은 소수성별 데이터를 포함시킴으로써 이를 완화할 수 있을 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.