Skip to main content
QUICK REVIEW

[논문 리뷰] Analyzing the Affect of a Group of People Using Multi-modal Framework

Xiaohua Huang, Abhinav Dhall|arXiv (Cornell University)|2016. 10. 12.
Face and Expression Recognition참고 문헌 37인용 수 3
한 줄 요약

이 논문은 새로운 정보 집약 방법을 사용하여 얼굴, 상체 및 환경 수준의 신호를 융합함으로써 그룹 수준의 정서 인식(GER)을 위한 다중 모odal 프레임워크를 제안한다. 이 방법은 두 개의 도전적인 데이터베이스에서 최신 기술 수준의 성능을 달성하였으며, HAPPEI에서 평균 절대 오차(MAE)가 0.4835이고, GAFF에서 정확도가 66.67%를 기록하여 다중 모달 융합이 실제 비구속 환경에서 정확성과 강인성을 크게 향상시킨다는 것을 입증한다.

ABSTRACT

Millions of images on the web enable us to explore images from social events such as a family party, thus it is of interest to understand and model the affect exhibited by a group of people in images. But analysis of the affect expressed by multiple people is challenging due to varied indoor and outdoor settings, and interactions taking place between various numbers of people. A few existing works on Group-level Emotion Recognition (GER) have investigated on face-level information. Due to the challenging environments, face may not provide enough information to GER. Relatively few studies have investigated multi-modal GER. Therefore, we propose a novel multi-modal approach based on a new feature description for understanding emotional state of a group of people in an image. In this paper, we firstly exploit three kinds of rich information containing face, upperbody and scene in a group-level image. Furthermore, in order to integrate multiple person's information in a group-level image, we propose an information aggregation method to generate three features for face, upperbody and scene, respectively. We fuse face, upperbody and scene information for robustness of GER against the challenging environments. Intensive experiments are performed on two challenging group-level emotion databases to investigate the role of face, upperbody and scene as well as multi-modal framework. Experimental results demonstrate that our framework achieves very promising performance for GER.

연구 동기 및 목표

  • 얼굴 감지가 가림, 조명, 자세 변화 등의 이유로 실패할 수 있는 비구속적이고 실제 환경에서의 그룹 수준 정서 인식 문제를 해결하기 위해.
  • 얼굴 수준의 정보가 신뢰할 수 없을 때 상체 및 환경 수준의 신호가 정서 인식에 어떻게 보완적인 역할을 하는지 조사하기 위해.
  • 여러 개인의 정서 상태를 통합하여 집단 수준의 정서 상태를 표현할 수 있는 강인한 정보 집약 방법을 개발하기 위해.
  • 얼굴, 상체, 환경 특징를 융합하여 그룹 수준 정서 인식 성능을 향상시키는 다중 모달 융합 프레임워크를 설계하고 평가하기 위해.
  • HAPPEI 및 GAFF 두 개의 도전적인 데이터베이스에서 회귀(행복 강도) 및 분류(긍정/중립/부정) 작업을 수행하여 프레임워크를 검증하기 위해.

제안 방법

  • 프레임워크는 세 가지 유형의 특징을 추출한다: 얼굴 수준(표정을 사용), 상체 수준(자세 및 자세를 사용), 환경 수준(환경적 맥락 정보를 사용).
  • 여러 개인의 정서 상태를 통합하여 집단 수준의 표현으로 변환하는 정보 집약 방법을 제안한다.
  • 다중 커널 학습(MKL)을 사용하여 얼굴, 상체, 환경 특징를 융합하는 다중 모달 융합 전략을 적용하며, 일반화 성능 향상을 위해 재검토된 局소화된 MKL 방법을 사용한다.
  • 사회심리학 원리에 영감을 얻어 하향식(개인 특성)과 상향식(환경 및 집단 구조) 모델링 접근 방식을 융합한 하이브리드 방식을 채택한다.
  • 프레임워크는 HAPPEI의 평균 절대 오차(MAE)를 사용한 회귀 및 GAFF의 정확도를 사용한 분류 평가 지표를 통해 평가된다.
  • 모델 설정의 일관성을 확보하기 위해 HAPPEI 데이터베이스에서 하이퍼파라미터 튜닝을 수행하고, 그 결과를 GAFF 데이터베이스에 적용한다.

실험 결과

연구 질문

  • RQ1실제 환경의 도전 요소로 인해 얼굴 감지에 실패할 경우, 상체 및 환경 수준의 특징이 그룹 수준의 정서 인식 성능을 향상시키는가?
  • RQ2얼굴, 상체, 환경 정보의 다중 모달 융합이 비구속적 환경에서의 정서 인식 정확성과 강인성을 어떻게 향상시키는가?
  • RQ3다양한 사회적 환경에서 그룹 수준의 정서 예측에 있어 얼굴, 상체, 환경 모odal의 상대적 기여도는 어떠한가?
  • RQ4제안된 정보 집약 방법이 그룹 이미지 내 여러 개인의 정서 상태를 효과적으로 통합하여 집단 수준의 정서 상태를 표현하는가?
  • RQ5제안된 다중 모달 프레임워크는 기존 최신 기술 수준의 모델들인 GEM 및 CCRF 기반 모델들과 비교해 보다 우수한 성능을 보이는가?

주요 결과

  • 제안된 다중 모달 프레임워크는 HAPPEI 데이터베이스에서 평균 절대 오차(MAE) 0.4835를 기록하여 모든 단일 모달 기반 베이스라인 및 기존 GEM 모델들을 초월한다.
  • 얼굴 전용 성능(MAE = 0.5187)은 최신 기술 수준의 GEM 모델들과 유사하지만, 다중 모달 융합을 통해 MAE가 0.0457 감소하여 뚜렷한 향상이 있음을 입증한다.
  • 상체 및 환경 특징의 포함이 성능 향상에 기여하며, 환경 특징만으로도 HI 커널에서 MAE 0.7273를 기록하여 맥락 인식 기반 정서 추론에서의 가치를 확인한다.
  • GAFF 데이터베이스에서 다중 모달 시스템은 66.67%의 정확도를 기록하여 얼굴 전용(58.33%) 및 상체 전용(46.57%) 기반 모델들을 능가하며, 더 복잡한 특징 조합(67.64%)에도 근접한 성능을 보였다.
  • 제안된 정보 집약 방법은 개인 수준의 신호를 통합하여 통합된 표현으로 변환함으로써 집단 수준의 정서 상태를 효과적으로 포착하여 도전적인 환경에서의 강인성을 향상시킨다.
  • 결과는 얼굴 수준의 데이터가 가림, 자세, 조명 변화 등의 이유로 신뢰할 수 없을 경우 다중 모달 융합이 그룹 수준 정서 인식에 필수적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.