Skip to main content
QUICK REVIEW

[논문 리뷰] Language Identification with Deep Bottleneck Features

Zhanyu Ma, Hong Yu|arXiv (Cornell University)|2018. 09. 18.
Natural Language Processing Techniques참고 문헌 61인용 수 3
한 줄 요약

이 논문은 깊이 있는 블로킹(DNN-BN) 특징과 LSTM 네트워크를 사용한 엔드 투 엔드 음성 언어 식별(SLD) 시스템을 제안하며, 짧은 발화를 연장하기 위해 단위 주파수 기반 시간 스케일 변환(TSM)을 통합한다. 1초 및 3초 발화의 원본, 속도 증가, 속도 감소 버전을 조합함으로써 짧은 입력에서 SLD 정확도를 최대 50% 향상시켰으며, AP17-OLR 테스트 세트에서 C_avg는 0.006, EER은 0.08%를 기록하였다.

ABSTRACT

In this paper we proposed an end-to-end short utterances speech language identification(SLD) approach based on a Long Short Term Memory (LSTM) neural network which is special suitable for SLD application in intelligent vehicles. Features used for LSTM learning are generated by a transfer learning method. Bottle-neck features of a deep neural network (DNN) which are trained for mandarin acoustic-phonetic classification are used for LSTM training. In order to improve the SLD accuracy of short utterances a phase vocoder based time-scale modification(TSM) method is used to reduce and increase speech rated of the test utterance. By splicing the normal, speech rate reduced and increased utterances, we can extend length of test utterances so as to improved improved the performance of the SLD system. The experimental results on AP17-OLR database shows that the proposed methods can improve the performance of SLD, especially on short utterance with 1s and 3s durations.

연구 동기 및 목표

  • 지능형 차량 응용 분야에서 매우 짧은 발화에 대해 낮은 정확도를 보이는 음성 언어 식별(SLD) 문제를 해결한다.
  • 기존 모델이 통계적 정보가 부족하여 실패하는 짧은 지속시간 입력(1초 및 3초)에서 성능을 향상시킨다.
  • 지능형 차량에서 실시간 배포에 적합한 경량이며 빠른 반응 속도를 가진 SLD 시스템을 개발한다.
  • 재학습 없이도 특징 표현과 모델의 강건성을 향상시키기 위해 전이 학습과 신호 전처리를 활용한다.

제안 방법

  • 모르산어 음소 분류를 위한 미리 훈련된 DNN를 사용하여 음성적 특징을 추출하며, 이는 음소 구별 정보를 포함한 깊이 있는 블로킹(DNN-BN) 특징을 생성한다.
  • 단위 주파수 기반 시간 스케일 변환(TSM)을 적용하여 말하기 속도가 변경된(α = 0.8 및 1.2) 여러 발화 버전을 생성한다.
  • 원본, 속도 증가, 속도 감소된 발화를 결합하여 짧은 입력의 입력 길이를 연장하고 시간적 맥락을 풍부하게 한다.
  • 길이가 확장된 발화에서 100프레임 크기의 PLP+피치 특징 블록을 이중층 LSTM 분류기로 입력한다.
  • 고정 크기의 블록에 프레임 수준의 DNN-BN 특징를 반복 팯딩하여 가변 길이 입력을 처리한다.
  • 음소 분류기에서 추출한 DNN-BN 특징을 사용하여 엔드 투 엔드 SLD 시스템을 훈련하고, 언어 예측을 위한 LSTM 기반 분류기를 적용한다.

실험 결과

연구 질문

  • RQ1TSM 기반의 입력 길이 연장이 매우 짧은 발화(1초 및 3초)에서 SLD 성능을 향상시키는가?
  • RQ2음소 분류기에서 추출한 DNN-BN 특징을 원음 특징과 비교해 SLD 정확도를 향상시키는가?
  • RQ3원본, 속도 증가, 속도 감소된 발화의 조합이 SLD 성능에 어떤 영향을 미치는가?
  • RQ4경량이며 엔드 투 엔드 LSTM 기반 SLD 시스템이 최소한의 모델 크기로 고정확도를 달성하고 빠른 추론을 수행할 수 있는가?

주요 결과

  • 제안된 TSM-DNN-BN-LSTM 모델은 전체 테스트 세트에서 C_avg를 0.006으로 줄이고 EER을 0.08%로 낮혀 i-vector 및 LSTM 기반 모델보다 뛰어난 성능을 보였다.
  • 1초 발화에서 EER은 i-vector 기반 모델의 17.24%에서 6.76%로 감소하여 상대적 향상률이 60.6%에 달했다.
  • 3초 발화에서 EER은 i-vector 기반 모델의 8.67%에서 2.62%로 감소하여 상대적 향상률이 69.5%에 달했다.
  • 모델 재학습 없이도 TSM 방법이 긴 및 중간 길이 발화에서는 약 50% 향상시키고, 매우 짧은 발화에서는 약 30% 향상시켰다.
  • 원본, 속도 증가, 속도 감소된 발화를 각각 한 개씩 연결하는 것이 가장 우수한 성능을 보였으며, α = 0.8 및 1.2가 최적의 설정이었다.
  • 모델는 약 20MB의 디스크 공간만 차지하여 지능형 차량과 같은 자원 제약 환경에서 실시간 배포에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.