[논문 리뷰] Resource aware design of a deep convolutional-recurrent neural network for speech recognition through audio-visual sensor fusion
이 논문은 청각 및 시각(입술 읽기) 특징을 경량 CNN-LSTM 아키텍처와 주의 메커니즘을 사용하여 융합하는 자원 인지적인 음성 인식을 위한 오디오-시각 딥 러닝 모델을 제안한다. TCD-TIMIT 데이터셋에서 청결한 오디오에서 75.70%의 음소 정확도를 기록하고, 0 dB SNR에서 58.55%를 기록하며, 이는 이전 최고 성능보다 14个百分点 이상 높으며, 임베디드 배포를 위한 계산 효율성과 메모리 사용을 균형 있게 유지한다.
Today's Automatic Speech Recognition systems only rely on acoustic signals and often don't perform well under noisy conditions. Performing multi-modal speech recognition - processing acoustic speech signals and lip-reading video simultaneously - significantly enhances the performance of such systems, especially in noisy environments. This work presents the design of such an audio-visual system for Automated Speech Recognition, taking memory and computation requirements into account. First, a Long-Short-Term-Memory neural network for acoustic speech recognition is designed. Second, Convolutional Neural Networks are used to model lip-reading features. These are combined with an LSTM network to model temporal dependencies and perform automatic lip-reading on video. Finally, acoustic-speech and visual lip-reading networks are combined to process acoustic and visual features simultaneously. An attention mechanism ensures performance of the model in noisy environments. This system is evaluated on the TCD-TIMIT 'lipspeaker' dataset for audio-visual phoneme recognition with clean audio and with additive white noise at an SNR of 0dB. It achieves 75.70% and 58.55% phoneme accuracy respectively, over 14 percentage points better than the state-of-the-art for all noise levels.
연구 동기 및 목표
- 임베디드 배포에 적합한 저자원, 고성능 오디오-시각 음성 인식 시스템을 설계하기 위해.
- 딥 러닝을 활용해 청각 및 시각 모odal을 융합하여 노이즈 환경에서의 강건성을 향상시키기 위해.
- 모든 구성 요소에서 모델 성능, FLOPS, 메모리 사용량 간의 트레이드오프를 최적화하기 위해.
- 다양한 노이즈 수준에서 주의 메커니즘이 오디오 및 시각 특징을 동적으로 가중하는 영향을 평가하기 위해.
- TCD-TIMIT '립스피커' 데이터셋에서 오디오-시각 음소 인식의 새로운 최고 성능 기록을 수립하기 위해.
제안 방법
- TCD-TIMIT 데이터셋에서 교차 엔트로피 손실과 Adam 최적화를 사용하여 단일 청각 모델을 위한 양방향 LSTM 네트워크를 훈련한다.
- 3D-CNN-LSTM 아키텍처를 사용하여 영상 프레임에서 시공간적 특징을 추출하고, 비세미 및 음소 인식 성능을 평가한다.
- 청각 및 시각 네트워크는 별도로 사전 훈련된 후 공유 주의 메커니즘을 갖는 단일 오디오-시각 모델로 통합된다.
- 세 개의 512뉴런 퍼셉트론 완전 연결층을 갖는 주의 네트워크는 입력 품질에 따라 청각 및 시각 특징에 가중치를 동적으로 할당하여 노이즈에서의 강건성을 향상시킨다.
- 전체 모델은 학습률 감소와 함께 백프로파게이션을 사용하여 엔드 투 엔드로 미세조정되며, 검증 손실 향상이 5 에포크 동안 없을 경우 훈련을 중단한다.
- 자원 효율성이 전 과정에서 우선시되며, 각 단계에서 FLOPS와 모델 크기를 측정하고 최소화한다. 최종 시스템은 30×10⁹ FLOPS와 137.4 MB의 메모리 크기를 요구한다.
실험 결과
연구 질문
- RQ1고성능을 유지하면서 계산 및 메모리 비용을 최소화할 수 있는 딥 오디오-시각 ASR 시스템을 어떻게 설계할 수 있는가?
- RQ2청각 및 시각 신경망 구성 요소에서 성능와 자원 사용량 간 최적의 트레이드오프는 무엇인가?
- RQ3주의 기반 융합이 고정 가중치 융합 대비 노이즈가 있는 오디오 조건에서 정확도 향상에 어떻게 기여하는가?
- RQ4청각-시각 융합이 청결한 환경과 노이즈 환경 모두에서 단모달 시스템보다 얼마나 뛰어나게 성능을 향상시키는가?
- RQ5주어진 주의 메커니즘을 사용하여 CNN-LSTM 시각 모델링과 양방향 LSTM 청각 모델링을 융합함으로써 달성할 수 있는 성능 향상은 무엇인가?
주요 결과
- 주의 메커니즘을 갖춘 오디오-시각 모델은 청결한 TCD-TIMIT 오디오에서 75.70%의 음소 정확도를 기록하였으며, 이는 이전 최고 성능(59.09%)보다 16.6 포인트 향상된 것이다.
- 0 dB SNR에서 모델은 58.55%의 음소 정확도를 기록하였으며, 이는 이전 최고 성능(44.03%)보다 14.5 포인트 향상된 것이다.
- 시각 전용 네트워크는 0 dB SNR에서 51.02%의 정확도를 기록하지만, 주의 메커니즘이 없는 융합에서는 노이즈에서 성능이 크게 떨어지므로, 적응형 융합의 필요성이 뚜렷하다.
- 주의 메커니즘이 오디오 및 시각 특징에 대한 동적 가중치를 부여함으로써 강건성을 향상시켰으며, 모든 노이즈 수준에서 고정 가중치 융합 또는 단모달 시스템보다 성능이 뚜렷이 뛰어나다.
- 최종 시스템은 30×10⁹ FLOPS와 137.4 MB의 모델 크기를 요구하며, 임베디드 배포를 위한 성능와 자원 효율성 간 균형 잡힌 트레이드오프를 나타낸다.
- CNN-LSTM 시각 네트워크는 CNN 전용 아키텍처보다 비세미 정확도에서 11.15 포인트 높은 68.46%를 기록하였으며(비세미 정확도 56.31%), 시간적 모델링의 유용성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.