Skip to main content
QUICK REVIEW

[논문 리뷰] An Investigation Into On-device Personalization of End-to-end Automatic Speech Recognition Models

Khe Chai Sim, Petr Zadrazil|arXiv (Cornell University)|2019. 09. 14.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

이 논문은 데이터 프라이버시와 확장성을 유지하기 위해 모바일 기기에서 직접 개인화된 엔드 투 엔드 음성 인식(ASR) 모델을 훈련시키는 방법을 조사한다. 슬라이딩 윈도우 기반의 데이터 소비 모델과 기울기 계산 분할을 통해 모바일 훈련 환경의 제약 조건을 시뮬레이션한 결과, 음성 장애가 있는 사용자에 대해 상대적 단어 오류율(WER)을 58.1% 감소시켰다. 이는 서버 기반 훈련 대비 18.7%의 WER 상승과 비교해도 여전히 안전하고 확장 가능한 서버 기반 개인화의 대안이 된다.

ABSTRACT

Speaker-independent speech recognition systems trained with data from many users are generally robust against speaker variability and work well for a large population of speakers. However, these systems do not always generalize well for users with very different speech characteristics. This issue can be addressed by building personalized systems that are designed to work well for each specific user. In this paper, we investigate the idea of securely training personalized end-to-end speech recognition models on mobile devices so that user data and models never leave the device and are never stored on a server. We study how the mobile training environment impacts performance by simulating on-device data consumption. We conduct experiments using data collected from speech impaired users for personalization. Our results show that personalization achieved 63.7\\% relative word error rate reduction when trained in a server environment and 58.1% in a mobile environment. Moving to on-device personalization resulted in 18.7% performance degradation, in exchange for improved scalability and data privacy. To train the model on device, we split the gradient computation into two and achieved 45% memory reduction at the expense of 42% increase in training time.

연구 동기 및 목표

  • 사용자 데이터를 서버로 전송하지 않고도 모바일 기기에서 직접 개인화된 엔드 투 엔드 ASR 모델을 훈련시키는 것이 가능한지와 성능 상호 간의 타협 여부를 조사하기 위해.
  • 제한된 메모리, 스토리지 및 데이터 접근성 등의 모바일 훈련 제약 조건이 서버 기반 훈련 대비 ASR 모델 성능에 미치는 영향을 평가하기 위해.
  • 데이터 윈도잉 및 기울기 계산 분할과 같은 기법을 개발하고 벤치마킹하여, 메모리 사용량을 줄이면서도 모델 정확도를 유지할 수 있도록 하기 위해.
  • 음성 장애가 있는 사용자에게만 현장 내 데이터와 계산 자원을 사용하여 ASR 모델을 개인화하는 데의 효과성을 평가하기 위해.

제안 방법

  • 제한된 크기(Nw)의 캐시에 저장된 데이터를 반복적으로 사용하는 슬라이딩 윈도우 메커니즘을 사용해 모바일 환경의 데이터 소비를 시뮬레이션하였다.
  • 훈련 중 메모리 사용량을 줄이기 위해 기울기 계산을 두 부분으로 나누어 처리하였으며, 이는 훈련 시간 증가를 수반한다.
  • 음성 장애가 있는 사용자로부터 수집한 소량의 사용자 전용 음성 데이터를 사용해 RNN-T 모델의 특정 구성 요소(특히 인코더 레이어)를 미세조정하였다.
  • 다양한 배경 환경의 사용자 데이터로 사전 훈련된 기본 RNN-T 모델을 사용자 기반으로 미세조정하여, 다양한 정도의 레이어 적응(예: 레이어 1–7 또는 모든 8개의 인코더 레이어)을 수행하였다.
  • 단어 오류율(WER)을 성능 측정 지표로 사용하였으며, Pixel 3 기기에서 단어당 평균 메모리 사용량과 훈련 시간을 기록하여 훈련 효율성을 추적하였다.
  • 윈도우 크기(Nw), 세션 수(Ns), 유효 에포크 수를 변화시켜 데이터 재사용 빈도가 모델 성능에 미치는 영향을 분리 분석하기 위해 분석 실험을 수행하였다.

실험 결과

연구 질문

  • RQ1제한된 캐시 메모리와 제한된 데이터 접근성으로 인해 데이터 캐싱이 제약을 받는 현장 내 훈련 환경에서, 개인화된 ASR 모델의 WER 성능이 서버 기반 훈련 대비 어떻게 영향을 받는가?
  • RQ2현장 내 훈련에서 최적의 데이터 재사용 전략은 무엇이며, 이는 모델 수렴과 정확도에 어떤 영향을 미치는가?
  • RQ3기울기 계산 분할을 통해 현장 내 훈련 시 메모리 사용량을 얼마나 줄일 수 있으며, 이로 인해 발생하는 훈련 시간 증가의 교환 조건은 어떠한가?
  • RQ4음성 장애가 있는 사람과 같은 비표준 음성 특성을 가진 사용자에게 현장 내 개인화가 얼마나 효과적인가?

주요 결과

  • 현장 내 개인화로 기준 모델 대비 상대적 WER 감소율이 58.1%에 달했으며, 서버 환경에서는 63.7%였기에, 이는 모바일 환경 제약으로 인해 WER가 18.7% 상승한 결과이다.
  • 윈도우 크기(Nw)를 100에서 500으로 증가시켰을 때 WER 성능이 19.6%에서 15.3%로 향상되어 상대적 개선율 22.0%를 기록하였으며, 세션 수(Ns)만 증가시켜도 추가로 성능 향상이 없었다.
  • 기울기 계산 분할을 통해 메모리 사용량을 45% 감소시켰다(1,187MB → 649MB), 그러나 단어당 훈련 시간이 42% 증가하였다.
  • 최고 성능을 보인 설정은 Nw=500, Ns=10일 때 레이어 1–7만 미세조정한 것으로, WER가 14.8%를 기록하여 기준 모델 대비 58.1%의 상대적 향상률을 달성하였다.
  • Pixel 3 기기에서 세션당 약 3.5시간(윈도우 크기 Nw=500, 배치 크기=10)이 소요되었으며, 전체 크기의 모델일 경우 단어당 평균 12.5초가 소요되었다.
  • 결과적으로 현장 내 개인화가 실현 가능하고 효과적이며, 성능의 약간의 흐름을 감수하더라도 강력한 개인정보 보호성과 확장성의 이점을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.