Skip to main content
QUICK REVIEW

[논문 리뷰] Predicting within and across language phoneme recognition performance of self-supervised learning speech pre-trained models

Hang Ji, Tanvina Patel|arXiv (Cornell University)|2022. 06. 24.
Speech Recognition and Synthesis인용 수 7
한 줄 요약

이 논문은 영어(내어휘) 및 막보시(교차어휘)에서 예비음운적 특징(AF) 캡처와 음소 인식을 위해 CPC, wav2vec 2.0, HuBert의 자기지도 학습 음성 표현을 평가한다. 프레임 수준의 AF 탐색과 엔드 투 엔드 ASR을 사용하여 AF 표현 품질이 음소 인식 정확도를 강하게 예측함을 보여주며, HuBert가 가장 뛰어난 성능을 보였다: 영어에서 10.2% PER, 막보시에서 23.0% PER를 기록했으며, MFCC보다 각각 34.4%와 26.7% 상대적으로 우수했다.

ABSTRACT

In this work, we analyzed and compared speech representations extracted from different frozen self-supervised learning (SSL) speech pre-trained models on their ability to capture articulatory features (AF) information and their subsequent prediction of phone recognition performance for within and across language scenarios. Specifically, we compared CPC, wav2vec 2.0, and HuBert. First, frame-level AF probing tasks were implemented. Subsequently, phone-level end-to-end ASR systems for phoneme recognition tasks were implemented, and the performance on the frame-level AF probing task and the phone accuracy were correlated. Compared to the conventional speech representation MFCC, all SSL pre-trained speech representations captured more AF information, and achieved better phoneme recognition performance within and across languages, with HuBert performing best. The frame-level AF probing task is a good predictor of phoneme recognition performance, showing the importance of capturing AF information in the speech representations. Compared with MFCC, in the within-language scenario, the performance of these SSL speech pre-trained models on AF probing tasks achieved a maximum relative increase of 34.4%, and it resulted in the lowest PER of 10.2%. In the cross-language scenario, the maximum relative increase of 26.7% also resulted in the lowest PER of 23.0%.

연구 동기 및 목표

  • 자기지도 학습 음성 사전학습 모델이 예비음운적 특징(AF) 정보를 얼마나 잘 캡처하는지 평가하기 위해.
  • AF 표현 품질과 후행 음소 인식 성능 간의 상관관계를 조사하기 위해.
  • SSL 모델의 내어휘(영어) 및 교차어휘(막보시) 성능을 비교하기 위해.
  • 프레임 수준의 AF 탐색이 엔드 투 엔드 ASR 성능을 예측할 수 있는지 확인하기 위해.

제안 방법

  • 고정된 SSL 모델(CPC, wav2vec 2.0, HuBert)에 대해 프레임 수준의 예비음운적 특징(AF) 탐색 작업을 적용하여 표현 내 AF 정보를 정량화한다.
  • 엔드 투 엔드 음성 인식(ASR) 시스템을 영어 및 막보시의 음소 인식을 위해 SSL 유래 특징을 사용하여 훈련시킨다.
  • AF 탐색 및 ASR 작업 모두에서 비교를 위해 MFCC를 기준선으로 사용한다.
  • AF 탐색 성능과 음소 인식 정확도 사이의 피어슨 상관계수를 계산하여 예측 능력을 평가한다.
  • 분석에는 8개의 AF 차원에 대한 매크로 평균 F1 점수와 ASR의 단어 수준 오류율(WER/PER)이 포함된다.
  • 실험 설정은 영어 평가에 TIMIT 데이터셋을, 교차어휘 평가에 막보시 데이터셋을 사용한다.

실험 결과

연구 질문

  • RQ1RQ1: 자기지도 학습 음성 사전학습 모델이 예비음운적 특징(AF) 정보를 어떻게 모델링하는가? 그리고 같은 언어(영어)에서 음소 인식 성능과의 상관관계는 어떠한가?
  • RQ2RQ2: 영어로 사전학습된 SSL 모델이 다른 언어(막보시)의 AF 정보를 어느 정도 모델링하는가? 그리고 그 언어에서 음소 인식 성능과의 상관관계는 어떠한가?
  • RQ3RQ3: 프레임 수준의 AF 탐색 성능이 내어휘 및 교차어휘 시나리오 양쪽에서 후행 음소 인식 정확도를 예측할 수 있는가?

주요 결과

  • 내어휘 시나리오에서 HuBert는 MFCC보다 34.4% 상대적 향상된 AF 탐색 성능를 기록했으며, 가장 낮은 음소 오류율(PER)인 10.2%를 달성했다.
  • 교차어휘 시나리오에서 HuBert는 MFCC보다 26.7% 상대적 향상된 AF 탐색 성능를 기록했으며, 막보시에서 가장 낮은 PER인 23.0%를 달성했다.
  • 교차어휘 시나리오에서 AF 탐색 성능과 음소 인식 정확도 사이의 피어슨 상관계수는 0.990이었으며, 강한 예측 관계를 나타냈다.
  • 모든 SSL 모델(CPC, wav2vec 2.0, HuBert)은 MFCC보다 더 많은 AF 정보를 캡처했으며, 내어휘 및 교차어휘 설정 모두에서 MFCC보다 낮은 PER를 기록했다.
  • 영어와 막보시 간 성능 격차의 일부는 막보시 데이터셋의 더 많은 음소 수와 더 적은 화자 수로 인해 인식이 더 어려워졌기 때문이다.
  • HuBert의 뛰어난 성능은 음성 단위 발견(AUD) 모듈 덕분이며, 이는 표현 학습을 향상시키는 가짜 레이블을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.