[논문 리뷰] Hearing Lips: Improving Lip Reading by Distilling Speech Recognizers
이 논문은 사전 훈련된 음성 인식기에서 입술 읽기 모델로 다중 군집 지식을 전이함으로써 입술 읽기 성능을 향상시키는 새로운 지식 정련 프레임워크인 Lip by Speech (LIBS)를 제안한다. 음성과 영상 시퀀스를 정렬하고, 음성 예측을 정제하기 위한 필터링 전략을 적용함으로써, LIBS는 CMLR에서 7.66% 감소한 문자 오류율과 LRS2에서 2.75% 감소한 문자 오류율을 달성하여 최신 기술 수준에 도달한다.
Lip reading has witnessed unparalleled development in recent years thanks to deep learning and the availability of large-scale datasets. Despite the encouraging results achieved, the performance of lip reading, unfortunately, remains inferior to the one of its counterpart speech recognition, due to the ambiguous nature of its actuations that makes it challenging to extract discriminant features from the lip movement videos. In this paper, we propose a new method, termed as Lip by Speech (LIBS), of which the goal is to strengthen lip reading by learning from speech recognizers. The rationale behind our approach is that the features extracted from speech recognizers may provide complementary and discriminant clues, which are formidable to be obtained from the subtle movements of the lips, and consequently facilitate the training of lip readers. This is achieved, specifically, by distilling multi-granularity knowledge from speech recognizers to lip readers. To conduct this cross-modal knowledge distillation, we utilize an efficacious alignment scheme to handle the inconsistent lengths of the audios and videos, as well as an innovative filtering strategy to refine the speech recognizer's prediction. The proposed method achieves the new state-of-the-art performance on the CMLR and LRS2 datasets, outperforming the baseline by a margin of 7.66% and 2.75% in character error rate, respectively.
연구 동기 및 목표
- 딥 러닝의 발전에도 불구하고 여전히 입술 읽기와 음성 인식 간의 성능 격차를 해소하기 위해.
- 단일 시각 모달에서의 특징 추출을 방해하는 모호한 입술 운동에 대처하기 위해.
- 사전 훈련된 음성 인식기에서 유용한 보완 정보를 활용하여 입술 읽기 훈련을 안내하고 향상시키기 위해.
- 모달 간 비일치와 불완전한 음성 예측을 다룰 수 있는 다중 모달 지식 정련 프레임워크를 개발하기 위해.
- 특히 저자료 환경에서 대규모 입술 읽기 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 시퀀스 수준, 맥락 수준, 프레임 수준의 다중 군집 지식 정련을 통해 음성 인식기에서 입술 읽기 모델로 지식을 전이한다.
- 다른 샘플링 속도를 가진 음성과 영상 시퀀스를 동기화하기 위한 다중 모달 정렬 전략을 구현하여 세밀한 특징 매칭을 가능하게 한다.
- 지식 정련 이전에 노이즈 또는 신뢰할 수 없는 특징을 제거하기 위해 음성 인식기 예측을 정제하는 필터링 전략을 도입한다.
- 양방향 어텐션 메커니즘을 갖춘 시퀀스-투-시퀀스 아키텍처를 음성 및 입술 읽기 모델 모두에 적용하여 지식 정련과 함께 종단 간 훈련을 가능하게 한다.
- 지식 정련 손실과 CTC 손실을 동시에 최적화하기 위해 진짜 전사본과 음성 특징에서 유도된 정련 지식을 조합하여 입술 읽기 모델을 훈련시킨다.
- 어 attention 시각화와 민감도 맵을 활용하여 모델이 분류 가능한 시각적 특징에 집중하는지 분석하고 검증한다.
실험 결과
연구 질문
- RQ1사전 훈련된 음성 인식기에서의 지식 정련이 입술 읽기 모델의 성능 향상에 기여하는가?
- RQ2다중 군집 지식 정련(시퀀스, 맥락, 프레임 수준)이 입술 읽기에서 특징 학습에 어떻게 기여하는가?
- RQ3음성과 영상 시퀀스 간의 다중 모달 정렬이 정련 효과에 얼마나 기여하는가?
- RQ4음성 인식기 예측을 정제하는 것이 더 신뢰성 있고 효과적인 지식 전이를 이끌어내는가?
- RQ5기본 모델 대비 저자료 훈련 조건에서 제안된 방법의 성능은 어떻게 되는가?
주요 결과
- LIBS는 CMLR 데이터셋에서 새로운 최신 기술 수준의 문자 오류율(CER) 31.27%를 달성하여 기준 모델 대비 7.66% 상대적 향상률을 기록한다.
- LRS2 데이터셋에서는 CER를 45.53%로 낮추어 기준 모델 대비 2.75% 향상되었으며, 다양한 벤치마크에서 일관된 성능 향상을 보였다.
- 학습 데이터를 20%로 줄였을 때, CMLR에서 기준 모델 대비 성능 향상률이 9.63%로 증가하여 자료 부족 조건에서도 뛰어난 일반화 능력을 입증했다.
- 주의 투시도와 민감도 맵 분석 결과, LIBS가 기준 모델보다 더 정확하게 입술 영역에 집중하는 것으로 나타났다.
- 제거 실험 결과, 시퀀스, 맥락, 프레임 수준의 각 지식 정련 수준이 점진적으로 더 나은 정렬과 특징 분류 능력을 향상시킴을 확인했다.
- RNN 기반 아키텍처를 사용했음에도 불구하고, LRS2에서 TM-seq2seq와 같은 트랜스포머 기반 모델을 초월하는 CER 성능을 기록하여 정련 전략의 효과성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.