Skip to main content
QUICK REVIEW

[논문 리뷰] Private Language Model Adaptation for Speech Recognition

Zhe Liu, Ke Li|arXiv (Cornell University)|2021. 09. 28.
Privacy-Preserving Technologies in Data참고 문헌 29인용 수 4
한 줄 요약

이 논문은 자동 음성 인식(ASR)에서 신경망 언어모델(NNLM)의 개인 정보 보호적 적응을 위한 연합학습(FL)-기반 접근법을 제안한다. 이는 토큰 수준의 신뢰도 점수를 사용하여 현장에서 생성된 번역 가설의 오류를 완화한다. 신뢰도 점수에 따라 교차 엔트로피 손실을 가중함으로써, 두 평가 세트에서 각각 상대적으로 2.6%와 10.8%의 단어 오류율(WER) 감소를 달성하여, 사용자 프라이버시를 유지하면서도 ASR 정확도를 향상시킨다.

ABSTRACT

Speech model adaptation is crucial to handle the discrepancy between server-side proxy training data and actual data received on local devices of users. With the use of federated learning (FL), we introduce an efficient approach on continuously adapting neural network language models (NNLMs) on private devices with applications on automatic speech recognition (ASR). To address the potential speech transcription errors in the on-device training corpus, we perform empirical studies on comparing various strategies of leveraging token-level confidence scores to improve the NNLM quality in the FL settings. Experiments show that compared with no model adaptation, the proposed method achieves relative 2.6% and 10.8% word error rate (WER) reductions on two speech evaluation datasets, respectively. We also provide analysis in evaluating privacy guarantees of our presented procedure.

연구 동기 및 목표

  • 현장 장치에서의 사용자 음성과 서버 측 학습 데이터 간의 도메인 이탈 문제를 해결하기 위해.
  • 원시 사용자 데이터를 폭로하지 않고도 프라이버시를 보장하는 연합학습(FL)을 활용해 NNLM을 현장에서 개인화하기 위해.
  • ASR가 생성한 가설에서 발생하는 번역 오류를 완화하기 위해 토큰 수준의 신뢰도 점수를 활용해 적응 품질을 향상시키기 위해.
  • 레니 지니미 differential privacy(RDP)를 사용하여 제안된 FL 기반 적응의 프라이버시 보장을 평가하기 위해.
  • 신뢰도 기반 손실 가중치가 오류가 발생할 수 있는 번역 데이터에 대해 단순 학습보다 우수한 성능을 보임을 입증하기 위해.

제안 방법

  • 이 방법은 사용자가 생성한 음성 번역문을 사용하여 현장에서 사전에 학습된 NNLM을 연합학습을 통해 미세조정하며, 모델 업데이트는 중앙 서버에서 집계된다.
  • 현장에서 ASR 시스템은 사용자 발화에 대해 가설을 생성하며, 이를 NNLM의 비지도 학습 데이터로 사용한다.
  • 신뢰도 분류기가 ASR 가설 내 각 토큰의 정확성 가능성을 추정하여 토큰 수준의 신뢰도 점수를 제공한다.
  • 이 신뢰도 점수를 사용하여 교차 엔트로피 손실을 가중함으로써, 낮은 신뢰도를 가진 토큰의 영향을 감소시킨다.
  • 이 방법은 번역 오류에 대한 내성적 저항력을 향상시키기 위해 문장 수준 및 토큰 수준의 신뢰도 가중 전략을 모두 지원한다.
  • 프라이버시 분석은 레니 지니미 미분적 프라이버시(RDP)를 사용하며, 모델 집계 과정에서 L2 기울기 클리핑과 가우시안 노이즈 주입을 수행한다.

실험 결과

연구 질문

  • RQ1연합학습이 원시 데이터를 폭로하지 않고 사용자 특화 음성 도메인에 맞게 신경망 언어모델을 효과적으로 적응시킬 수 있는가?
  • RQ2다양한 신뢰도 기반 가중 전략(예: 토큰 수준 대비 문장 수준)이 ASR 번역 오류가 존재하는 상황에서 NNLM 적응 품질에 어떤 영향을 미치는가?
  • RQ3신뢰도 점수가 종합적인 음성 인식 시스템의 최종 단어 오류율(WER)에 어떤 영향을 미치는가?
  • RQ4레니 지니미 프라이버시(RDP)로 측정한 프라이버시 보장이 연합학습 기반 NNLM 적응 환경에서 모델 성능과 어떻게 상충되는가?

주요 결과

  • 제안된 방법은 비적응 모델 대비 대화 평가 세트에서 상대적으로 2.6%의 WER 감소와 음성 명령 세트에서 10.8%의 WER 감소를 달성한다.
  • 토큰 수준의 신뢰도 가중 전략이 모든 다른 전략보다 우수하며, 두 데이터셋 모두에서 가장 낮은 WER 성능을 기록한다.
  • 신뢰도 기반으로 문장을 하드 임계화하는 전략은 짧은 음성 명령 세트에서 가장 우수한 성능을 보이며, 토큰 수준의 가중 전략은 더 긴 대화에서 뛰어난 성능을 발휘한다.
  • 사전에 학습된 모델에서 미세조정하는 것 대비 FL 환경에서부터 학습을 시작하면 약 1%의 WER 성능 저하가 발생함을 확인하여 사전 학습의 유용성을 입증한다.
  • 강한 프라이버시 제약 조건(ε ≈ 0.9) 하에서도 적응된 모델은 비적응 서버 사전 학습 모델을 능가하는 WER 성능을 보이며, 성능 향상은 감소하지만 여전히 유의미하다.
  • 레니 지니미 DP를 사용한 프라이버시 분석 결과, 이 방법은 의미 있는 프라이버시 보장을 제공하며, 노이즈 수준에 따라 ε 값은 0.9에서 248.6 사이에서 변동한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.