Skip to main content
QUICK REVIEW

[논문 리뷰] Human Attention Detection Using AM-FM Representations

Wenjing Shi|arXiv (Cornell University)|2022. 03. 09.
Infrared Target Detection Methodologies인용 수 8
한 줄 요약

이 논문은 제약 없는 비디오 환경에서 얼굴 방향, 뒷통수 존재 여부, 시선 방향을 감지하기 위해 진폭 변조-주파수 변조(AM-FM) 모델을 사용하는 단계 기반 인간 주의 감지 방법을 제안한다. AOLME 데이터셋의 19,387장의 이미지에서 평가한 결과, 카메라를 향해 있는 경우 왼쪽 및 오른쪽 시선 감지 정확도가 각각 97.1%와 95.9%였으며, 뒷통수 케이스에서는 각각 87.6%와 93.3%였고, 제어된 영상 기하학적 조건 없이도 실제 환경에서 뛰어난 강건성을 입증하였다.

ABSTRACT

Human activity detection from digital videos presents many challenges to the computer vision and image processing communities. Recently, many methods have been developed to detect human activities with varying degree of success. Yet, the general human activity detection problem remains very challenging, especially when the methods need to work 'in the wild' (e.g., without having precise control over the imaging geometry). The thesis explores phase-based solutions for (i) detecting faces, (ii) back of the heads, (iii) joint detection of faces and back of the heads, and (iv) whether the head is looking to the left or the right, using standard video cameras without any control on the imaging geometry. The proposed phase-based approach is based on the development of simple and robust methods that rely on the use of Amplitude Modulation- Frequency Modulation (AM-FM) models. The approach is validated using video frames extracted from the Advancing Out-of-school Learning in Mathematics and Engineering (AOLME) project. The dataset consisted of 13,265 images from ten students looking at the camera, and 6,122 images from five students looking away from the camera. For the students facing the camera, the method was able to correctly classify 97.1% of them looking to the left and 95.9% of them looking to the right. For the students facing the back of the camera, the method was able to correctly classify 87.6% of them looking to the left and 93.3% of them looking to the right. The results indicate that AM-FM based methods hold great promise for analyzing human activity videos.

연구 동기 및 목표

  • 제어된 영상 기하학적 조건 없이 제약 없는 비디오 환경에서 강력하고 단계 기반의 인간 주의 감지 방법을 개발하기 위해.
  • 일반적인 비디오 카메라를 사용하여 실제 환경에서 인간의 머리 자세와 시선 방향을 감지하는 데 도전하는 데 목적이 있다.
  • AM-FM 모델이 동시에 얼굴, 뒷통수, 시선 방향을 감지할 수 있는지 탐색하기 위해.
  • 학생들이 교육 환경에서 수집한 실제 세계 데이터셋을 바탕으로 방법을 검증하기 위해.

제안 방법

  • 이 방법은 영상 프레임에서 단계 기반 특징을 추출하기 위해 진폭 변조-주파수 변조(AM-FM) 모델을 사용하여 구조적이고 방향성 있는 정보에 중점을 둔다.
  • 진폭 및 주파수 변조를 모델링하기 위해 경험적 모드 분해(EMD)와 힐버트 변환을 사용하여 단계 정보를 추출한다.
  • 지역적 단계 일치도 및 방향 특징을 사용하여 머리 영역을 감지하고 머리 자세를 추정한다.
  • 분류 파이프라인을 적용하여 머리가 앞을 향하고 있는지(얼굴 또는 뒷통수)와 시선 방향(왼쪽 또는 오른쪽)을 감지한다.
  • 정밀한 캘리브레이션이나 제어된 조명 조건에 의존을 최소화하는 단순하고 강건한 방법으로 설계되었다.
  • 영상 프레임에서 특징를 추출하고, AOLME 데이터셋의 레이블이 부여된 데이터로 훈련된 분류기에 입력한다.

실험 결과

연구 질문

  • RQ1AM-FM 표현 방식은 제약 없는 영상 프레임에서 인간의 얼굴과 뒷통수를 효과적으로 감지할 수 있는가?
  • RQ2제어된 영상 기하학적 조건 없이 단계 기반 특징을 사용하여 시선 방향(왼쪽 또는 오른쪽)을 얼마나 정확하게 추정할 수 있는가?
  • RQ3다양한 조명 조건과 카메라 각도를 가진 실제 영상 데이터에 적용했을 때 AM-FM 모델이 강건성을 유지하는가?
  • RQ4통합된 단계 기반 프레임워크는 동시에 얼굴, 뒷통수, 시선과 같은 여러 주의 관련 신호를 감지할 수 있는가?
  • RQ5비제어 환경에서 AM-FM 방법의 성능은 기존의 방법과 비교해 어떻게 되는가?

주요 결과

  • 카메라를 향해 있는 학생들에 대해 왼쪽 시선 분류 정확도가 97.1%를 기록했다.
  • 카메라를 향해 있는 학생들에 대해 오른쪽 시선 케이스의 95.9%가 정확하게 분류되었다.
  • 뒷통수 자세 감지 시, 왼쪽 시선 케이스의 87.6%가 정확하게 식별되었다.
  • 뒷통수 케이스에서는 오른쪽 시선 케이스의 93.3%가 정확하게 분류되었다.
  • 전반적인 결과는 실제 세계의 제약 없는 영상 환경에서 강력한 강건성과 일반화 능력을 입증한다.
  • AM-FM 기반 접근 방식은 복잡하고 제어되지 않은 환경에서 전통적인 강도 기반 방법보다 성능이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.