Skip to main content
QUICK REVIEW

[논문 리뷰] LipReading with 3D-2D-CNN BLSTM-HMM and word-CTC models

Dilip Kumar Margam, Rohith Aralikatti|arXiv (Cornell University)|2019. 06. 25.
Speech and Audio Processing참고 문헌 23인용 수 14
한 줄 요약

이 논문은 종단간 립리딩을 위한 3D-2D-CNN-BLSTM 아키텍처를 제안하며, 문자 수준의 CTC(ch-CTC)와 단어 수준의 CTC(w-CTC) 학습 방식을 비교한다. w-CTC 접근 방식은 Grid의 본문 집합에서 1.3% WER, 비본문 집합에서 8.6% WER를 기록하여 각각 LCANet 및 LipNet 대비 55%와 24.5%의 상대적 향상률을 보이며, 문맥 기반의 단어 수준 모델링을 통해 유사 발음어를 더 잘 해소함으로써 최신 기술 수준의 성능을 입증한다.

ABSTRACT

In recent years, deep learning based machine lipreading has gained prominence. To this end, several architectures such as LipNet, LCANet and others have been proposed which perform extremely well compared to traditional lipreading DNN-HMM hybrid systems trained on DCT features. In this work, we propose a simpler architecture of 3D-2D-CNN-BLSTM network with a bottleneck layer. We also present analysis of two different approaches for lipreading on this architecture. In the first approach, 3D-2D-CNN-BLSTM network is trained with CTC loss on characters (ch-CTC). Then BLSTM-HMM model is trained on bottleneck lip features (extracted from 3D-2D-CNN-BLSTM ch-CTC network) in a traditional ASR training pipeline. In the second approach, same 3D-2D-CNN-BLSTM network is trained with CTC loss on word labels (w-CTC). The first approach shows that bottleneck features perform better compared to DCT features. Using the second approach on Grid corpus' seen speaker test set, we report $1.3\%$ WER - a $55\%$ improvement relative to LCANet. On unseen speaker test set we report $8.6\%$ WER which is $24.5\%$ improvement relative to LipNet. We also verify the method on a second dataset of $81$ speakers which we collected. Finally, we also discuss the effect of feature duplication on BLSTM-HMM model performance.

연구 동기 및 목표

  • 3D-2D-CNN-BLSTM 아키텍처에서 얻은 딥 네트워크 뱃지 특징을 전통적인 DCT 특징으로 대체하여 립리딩 성능을 향상시키는 것.
  • 문맥 정보를 활용해 유사 발음어의 모호함을 해소하기 위해 문자 수준의 CTC(ch-CTC) 대비 단어 수준의 CTC(w-CTC) 손실로 학습하는 것이 성능 향상에 기여하는지 조사하는 것.
  • 시각적 단독 립리딩 환경에서 BLSTM-HMM 모델에 특징 복제 기법을 적용하여 효과를 평가하고, 이전의 음성-시각 융합 연구 결과를 순수 시각적 환경으로 확장하는 것.
  • 제안된 아키텍처가 표준(GRID) 및 더 도전적인 비제약적(인도 영어) 데이터셋 모두에서 강건성과 확장성을 보여주는지 평가하는 것.

제안 방법

  • 3D-2D-CNN-BLSTM 네트워크를 캐릭터 레이블에 대한 CTC 손실(ch-CTC)로 교육하고, 커리큘럼 학습을 적용한 후, 후속 BLSTM-HMM 학습을 위한 뱃지 특징을 추출한다.
  • 동일한 3D-2D-CNN-BLSTM 네트워크를 단어 수준의 레이블에 대한 CTC 손실(w-CTC)로 종단간 학습하여 직접 단어 예측이 가능하고, 외관상 유사한 단어의 해소가 향상된다.
  • ch-CTC 모델의 뱃지 특징을 사용하여 BLSTM-HMM 하이브리드 시스템을 학습시켜 기존의 DCT 기반 BLSTM-HMM 기반선과 비교할 수 있도록 한다.
  • 특징 복제를 적용하여 시각 프레임 빈도를 HMM 상태 전이 시간과 일치시켜, 순수 립리딩 환경에서도 BLSTM-HMM 성능 향상을 이룬다.
  • 데이터 증강에는 랜덤 프레임 반복/제거 및 수평 반전을 포함하여, 변동하는 프레임 빈도와 데이터 변동성에 대한 강건성을 향상시킨다.
  • 워드 에러 비율(WER)은 ch-CTC 예측 결과에 편집 거리 기반 철자 교정을 적용하여 계산하며, 모델은 Grid 및 인도 영어 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ13D-2D-CNN-BLSTM ch-CTC 모델에서 유도된 뱃지 특징을 사용하면 기존 DCT 특징 대비 BLSTM-HMM 성능이 향상되는가?
  • RQ23D-2D-CNN-BLSTM 네트워크를 단어 수준의 CTC 손실(w-CTC)로 학습시키면 문자 수준의 CTC(ch-CTC) 및 기존 최신 기술 수준 모델 대비 WER를 상당히 감소시킬 수 있는가?
  • RQ3특징 복제가 순수 시각적 립리딩 환경에서 BLSTM-HMM 모델 성능에 미치는 영향은 무엇이며, 이 효과는 음성-시각 융합 외부로 일반화 가능한가?
  • RQ4제안된 아키텍처는 제약 있는(GRID) 및 비제약적인(인도 영어) 데이터셋 모두에서 어떻게 성능을 보이며, 화자 변동성과 환경 노이즈에 대한 강건성을 어떻게 입증하는가?

주요 결과

  • 3D-2D-CNN-BLSTM w-CTC 모델은 Grid 본문 화자 테스트 세트에서 1.3% WER를 기록하여 LCANet 대비 55.1% 상대적 향상률을 보였다.
  • 비본문 화자 테스트 세트에서는 w-CTC 모델이 8.6% WER를 기록하여 LipNet 대비 24.5% 상대적 향상률을 기록했다.
  • 3D-2D-CNN-BLSTM ch-CTC 모델은 본문 세트에서 WER를 3.2%로 감소시키고, 비본문 세트에서는 5.2%로 감소시켜 DCT BLSTM-HMM 기반선(각각 8.9% 및 16.5% WER) 대비 상당한 향상을 보였다.
  • 특징 복제로 인해 Grid 데이터셋에서 BLSTM-HMM 성능이 53% 향상되었고, 인도 영어 데이터셋에서는 44% 향상되어 순수 시각적 환경에서도 유용함을 입증했다.
  • 인도 영어 데이터셋에서 3D-2D-CNN-BLSTM w-CTC 모델은 ch-CTC 모델 대비 25.0% 더 뛰어난 성능을 보였으며, 실제 환경의 변동성에 대한 강건성을 확인했다.
  • 우수한 성능에도 불구하고 w-CTC 모델은 대규모 어휘에 대해 확장성이 떨어지므로, 저자들은 향후 하위어 단위 CTC 손실을 고려할 것을 제안한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.