Skip to main content
QUICK REVIEW

[논문 리뷰] Face Recognition with Machine Learning in OpenCV_ Fusion of the results with the Localization Data of an Acoustic Camera for Speaker Identification

Johannes Reschke, Armin Sehr|arXiv (Cornell University)|2017. 07. 04.
Speech and Audio Processing참고 문헌 11인용 수 3
한 줄 요약

이 논문은 OpenCV의 머신러닝 모델을 사용한 얼굴 인식과 오디오 카메라에서의 음향 소스 정위를 융합하여 실시간으로 말하는 사람을 식별하는 시스템을 제시한다. 얼굴 인식 결과와 소리의 위치를 결합함으로써 누가 언제 말하고 있는지 정확히 식별할 수 있으며, 음성 향상에 적응형 빔포밍을 구현하는 등의 애플리케이션을 가능하게 한다.

ABSTRACT

This contribution gives an overview of face recogni-tion algorithms, their implementation and practical uses. First, a training set of different persons' faces has to be collected and used to train a face recognizer. The resulting face model can be utilized to classify people in specific individuals or unknowns. After tracking the recognized face and estimating the acoustic sound source's position, both can be combined to give detailed information about possible speakers and if they are talking or not. This leads to a precise real-time description of the situation, which can be used for further applications, e.g. for multi-channel speech enhancement by adaptive beamformers.

연구 동기 및 목표

  • 동적 음향-시각 환경에서 실시간으로 말하는 사람을 식별하는 시스템을 개발하는 것.
  • 얼굴 인식과 음향 소스 정위를 융합하여 말하는 사람 추적 성능을 향상시키는 것.
  • 누가 언제 말하고 있는지 정확히 감지할 수 있도록 하여 빔포밍과 같은 응용 프로그램을 지원하는 것.
  • 실제 환경에서 융합된 시각 및 음향 데이터의 실용적 구현을 보여주는 것.

제안 방법

  • OpenCV의 머신러닝 알고리즘을 사용하여 레이블이 부여된 얼굴 이미지 데이터셋을 기반으로 얼굴 식별기 모델을 학습시켰다.
  • 영상 프레임 간에 식별된 얼굴를 추적하여 정체성 일관성을 유지했다.
  • 음향 카메라를 사용하여 소리의 원천을 정위하여 말이 어디서 나는지 파악했다.
  • 얼굴 인식 결과를 음향 정위 데이터와 융합하여 얼굴와 소리의 원천을 연결했다.
  • 시간적 정렬을 적용하여 음향-시각 동기화를 바탕으로 사람이 말하고 있는 시점을 결정했다.
  • 융합된 출력을 활용하여 적응형 빔포밍과 같은 후속 응용 프로그램을 지원했다.

실험 결과

연구 질문

  • RQ1얼굴 인식과 음향 소스 정위를 효과적으로 융합하여 말하는 사람 식별 성능을 향상시킬 수 있는가?
  • RQ2실시간으로 시각 및 음향 데이터를 융합하면 말하는 사람 추적 정확도가 향상되는가?
  • RQ3얼굴 정체성과 소리의 원천 위치를 융합했을 때 활성 말하는 사람을 식별하는 데 어떤 영향을 미치는가?
  • RQ4이 시스템은 다인의 동적 환경에서 어떻게 성능을 발휘하는가?

주요 결과

  • 얼굴 인식과 음향 정위의 융합은 누가 말하고 있는지 정확한 실시간 식별을 가능하게 한다.
  • 시스템은 다이나믹한 장면에서 특정 개인을 그에 해당하는 소리의 원천과 성공적으로 연결한다.
  • 시각 및 음향 데이터의 시간적 정렬을 통해 사람들이 실제로 말하고 있는 시점을 감지할 수 있다.
  • 이 방법은 고급 신호 처리 응용 프로그램에 적합한 상세하고 실시간의 음향-시각 장면 기술을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.