Skip to main content
QUICK REVIEW

[논문 리뷰] Maximum a Posteriori Adaptation of Network Parameters in Deep Models

Zhen Huang, Sabato Marco Siniscalchi|arXiv (Cornell University)|2015. 03. 06.
Speech Recognition and Synthesis참고 문헌 37인용 수 15
한 줄 요약

이 논문은 제한된 적응 데이터 하에서 파arameter 업데이트를 안정화하기 위해 확장된 선형 은닉망(LHN)을 사용하는 딥 뉴럴 네트워크(DNN) 파라미터에 대한 베이지안 최대사후확률(MAP) 적응 프레임워크를 제안한다. 이 방법은 전통적인 변환 기반 적응 및 특성 공간 MAP 선형 회귀보다 뛰어나며, 월 스트리트 저널 20k어휘 사양에서 상대적 단어 오류율(WER) 감소율이 10% 이상을 기록한다. 초기 성공을 거두며 계층적 사전분포를 통해 자료 효율성을 향상시켰다.

ABSTRACT

We present a Bayesian approach to adapting parameters of a well-trained context-dependent, deep-neural-network, hidden Markov model (CD-DNN-HMM) to improve automatic speech recognition performance. Given an abundance of DNN parameters but with only a limited amount of data, the effectiveness of the adapted DNN model can often be compromised. We formulate maximum a posteriori (MAP) adaptation of parameters of a specially designed CD-DNN-HMM with an augmented linear hidden networks connected to the output tied states, or senones, and compare it to feature space MAP linear regression previously proposed. Experimental evidences on the 20,000-word open vocabulary Wall Street Journal task demonstrate the feasibility of the proposed framework. In supervised adaptation, the proposed MAP adaptation approach provides more than 10% relative error reduction and consistently outperforms the conventional transformation based methods. Furthermore, we present an initial attempt to generate hierarchical priors to improve adaptation efficiency and effectiveness with limited adaptation data by exploiting similarities among senones.

연구 동기 및 목표

  • 편향된 학습 및 테스트 조건 하에서 DNN-HMM 시스템의 성능 저하 문제를 해결하기 위해, 특히 제한된 적응 데이터 상황에서의 성능을 향상시키기 위해.
  • 베이지안 파라미터 추정을 통해 사전 지식을 통합함으로써 DNN 적응에서의 치명적 기억 상실 문제를 해결하기 위해.
  • 센온 간의 구조적 유사성을 활용하여 저자원 적응 환경에서의 적응 효율성과 효과를 향상시키기 위해.
  • 이전에 GMM-HMM에서 사용된 베이지안 적응 기법을 하이브리드 ASR 시스템의 딥 뉴럴 네트워크로 확장하기 위해.
  • 센온 클러스터링 기반의 계층적 사전분포를 탐색하여, 최소한의 적응 데이터로도 파라미터 추정을 향상시키기 위해.

제안 방법

  • 최종 비선형 은닉층 이후에 DNN 파라미터 적응을 모델링하기 위해 확장된 선형 은닉망(LHN)을 도입한다.
  • LHN 가중치를 정규 사전분포를 가진 랜덤 변수로 간주하여, MAP 추정을 통해 적응을 정규화하고 과적합을 줄인다.
  • LHN 가중치와 그 계층적 부모 노드에 대한 교차 엔트로피 손실 및 L2 정규화 항을 포함하는 공동 목적함수를 유도한다.
  • 공통된 음소적 맥락을 가진 센온을 그룹화하기 위해 고정된 이중층 트리 구조를 사용하여, 센온 임베딩에 대한 계층적 사전분포를 가능하게 한다.
  • 각 센온 임베딩이 부모 노드 평균 주변으로 조건부 분포를 가지며, 두 수준 모두에 정규 사전분포를 할당하는 계층적 사전분포 모델을 사용한다.
  • 주 DNN 가중치를 고정한 채로 경사 하강법을 통해 MAP 목적함수를 최적화한다.

실험 결과

연구 질문

  • RQ1제한된 적응 데이터 하에서 LHN 파라미터의 베이지안 MAP 적응이 DNN-HMM 성능 향상에 기여할 수 있는가?
  • RQ2MAP 기반 LHN 적응은 기존의 변환 기반 및 특성 공간 MAP 선형 회귀 방법과 비교해 어떻게 성능을 냅니다?
  • RQ3센온 구조 기반의 계층적 사전분포는 작은 적응 세트에서 적응 효율성을 향상시킬 수 있는가?
  • RQ4계층적 사전분포 사용이 DNN 적응에서 과적합과 치명적 기억 상실을 줄이는 데 기여하는가?
  • RQ5센온 유사성 클러스터로부터의 사전 지식이 낮은 데이터 환경에서의 파라미터 추정을 향상시킬 수 있는가?

주요 결과

  • 제안된 MAP LHN 적응은 월 스트리트 저널 20k어휘 사양에서 강력한 발화자 독립적 CD-DNN-HMM 기준선 대비 10% 이상의 상대적 단어 오류율(WER) 감소를 달성한다.
  • MAP LHN은 감독적 적응 설정에서 기존의 변환 기반 적응 기법과 특성 공간 MAP 선형 회귀보다 일관되게 뛰어난 성능을 보인다.
  • 단지 5개의 적응 문장으로도 계층적 사전분포가 WER을 평탄한 사전분포의 8.54%에서 8.48%로 감소시켜, 자료 부족 환경에서의 초기 성공 가능성을 보여준다.
  • 10개의 적응 문장으로도 WER은 8.52%에서 8.45%로 감소하여, 구조적 사전분포의 점진적 성능 향상이 확인된다.
  • 계층적 사전분포 구조는 유사한 센온 간에 통계적 강도를 공유함으로써 더 안정적인 파라미터 업데이트를 가능하게 하여 과적합을 줄인다.
  • 이 방법은 하이브리드 ASR에서 대규모 DNN에 베이지안 파라미터 추정을 적용할 수 있음을 입증하며, 특히 저자원 적응 시나리오에서의 타당성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.