Skip to main content
QUICK REVIEW

[논문 리뷰] A Study on Lip Localization Techniques used for Lip reading from a Video

S. D. Lalitha, K. K. Thyagharajan|arXiv (Cornell University)|2020. 09. 28.
Speech and Audio Processing참고 문헌 13인용 수 5
한 줄 요약

이 논문은 영상 기반 입술 읽기에서 얼굴 비대칭성, 이가, 혀, 얼굴 털 등에 대해 강건한 다양한 입술 위치 추정 기법을 조사하고 비교한다. 첫 번째 프레임에서의 초기 입술 검출, 프레임 간 시간적 추적, 문자에 대한 시각적 특징 매핑을 결합한 파이프라인을 제안하며, 소음이 심하거나 음성 정보가 없는 조건을 포함한 도전적인 실생활 환경에서 평가한다.

ABSTRACT

In this paper some of the different techniques used to localize the lips from the face are discussed and compared along with its processing steps. Lip localization is the basic step needed to read the lips for extracting visual information from the video input. The techniques could be applied on asymmetric lips and also on the mouth with visible teeth, tongue & mouth with moustache. In the process of Lip reading the following steps are generally used. They are, initially locating lips in the first frame of the video input, then tracking the lips in the following frames using the resulting pixel points of initial step and at last converting the tracked lip model to its corresponding matched letter to give the visual information. A new proposal is also initiated from the discussed techniques. The lip reading is useful in Automatic Speech Recognition when the audio is absent or present low with or without noise in the communication systems. Human Computer communication also will require speech recognition.

연구 동기 및 목표

  • 영상 기반 입술 읽기 시스템에 활용 가능한 효과적인 입술 위치 추정 기법을 식별하고 평가하는 것.
  • 얼굴 비대칭성, 드러난 이, 혀, 얼굴 털과 같은 입술 검출 과제를 해결하는 것.
  • 정확한 위치 추정과 시간적 추적, 시각-문자 매핑을 결합한 강건한 입술 읽기 파이프라인을 개발하는 것.
  • 시각적 정보를 활용하여 소음이 많거나 음성 품질이 떨어지는 환경에서 자동 음성 인식(ASR) 성능을 향상시키는 것.
  • 실생활 조건에서 향상된 시각적 언어 인식을 통해 인간-컴퓨터 상호작용을 지원하는 것.

제안 방법

  • 영상의 첫 프레임에서 색상 기반 분할과 윤곽 검출을 사용하여 초기 입술 위치 추정을 수행한다.
  • 활동형 외형 모델(AAM) 또는 변형 모델을 적용하여 얼굴 변화 상황에서도 입술 경계 검출을 정밀하게 개선한다.
  • 초기로 검출된 입술 영역을 기반으로 광학 흐름 또는 평균 이동 추적을 사용하여 이후 프레임에서의 입술 추적을 수행한다.
  • 시간-공간적 모델링을 통해 입술 모양 변화를 분석하여 추적된 입술 영역을 정규화하고 음소 특징으로 매핑한다.
  • 새로운 제안은 저조도 및 가림 상황에서 정확도를 향상시키기 위해 다중 척도 특징 추출과 적응형 임계값 설정을 통합한다.
  • 학습된 시각-음소 사전를 사용하여 추적된 입술 형태를 해당 문자나 음소로 매핑한다.

실험 결과

연구 질문

  • RQ1얼굴 털, 이, 혀의 노출과 같은 실생활 조건에서 다양한 입술 위치 추정 기법의 성능은 어떻게 되는가?
  • RQ2얼굴 비대칭성은 영상 시퀀스에서 입술 검출 및 추적 정확도에 어떤 영향을 미치는가?
  • RQ3두통 이동이 있는 프레임 간에 제안된 추적 방법이 입술 영역의 일관성을 유지하는 데 얼마나 효과적인가?
  • RQ4제안된 시스템은 저SNR 또는 음성 품질이 떨어지는 환경에서 자동 음성 인식(ASR) 성능을 어느 정도 향상시킬 수 있는가?
  • RQ5적응형 전처리는 다양한 영상 입력에서 입술 위치 추정의 강건성 향상에 어떤 역할을 하는가?

주요 결과

  • 제안된 방법은 드러난 이나 얼굴 털과 같은 도전적인 조건에서도 입술 검출의 강건성을 향상시킨다.
  • 광학 흐름을 사용한 시간적 추적은 중간 수준의 두통 이동이 있는 프레임 간에 일관된 입술 영역 검출을 유지한다.
  • 색상 기반 분할과 윤곽 검출의 조합은 단일 방법 대비 더 높은 정밀도를 보이며 初기 입술 검출을 수행한다.
  • 적응형 임계값 설정과 다중 척도 특징의 통합은 저조도 상황에서 검출 정확도를 향상시킨다.
  • 신뢰할 수 있는 시각적 언어 신호를 제공함으로써, 소음이 많은 환경에서 ASR 성능 향상 잠재력을 보여준다.
  • 제안된 파이프라인이 추적된 입술 형태를 성공적으로 음소 출력으로 매핑하여 후속 시각적 언어 인식 작업을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.