[논문 리뷰] Facial Expression Phoenix (FePh): An Annotated Sequenced Dataset for Facial and Emotion-Specified Expressions in Sign Language
이 논문은 공개적으로 이용 가능한 시퀀스형 수어 얼굴 표정 데이터셋인 FePh를 소개한다. 이는 RWTH-PHOENIX-Weather 2014 데이터셋에서 유래한 것으로, 다양한 머리 자세, 움직임, 일곱 가지 기본 감정과 'None' 클래스를 포함한 감정 레이블이 부여된 3,000개 이상의 반투명한 동적 얼굴 영상으로 구성되어 있으며, 다중 모odal 수어 및 제스처 인식 연구를 가능하게 한다.
Facial expressions are important parts of both gesture and sign language recognition systems. Despite the recent advances in both fields, annotated facial expression datasets in the context of sign language are still scarce resources. In this manuscript, we introduce an annotated sequenced facial expression dataset in the context of sign language, comprising over $3000$ facial images extracted from the daily news and weather forecast of the public tv-station PHOENIX. Unlike the majority of currently existing facial expression datasets, FePh provides sequenced semi-blurry facial images with different head poses, orientations, and movements. In addition, in the majority of images, identities are mouthing the words, which makes the data more challenging. To annotate this dataset we consider primary, secondary, and tertiary dyads of seven basic emotions of "sad", "surprise", "fear", "angry", "neutral", "disgust", and "happy". We also considered the "None" class if the image's facial expression could not be described by any of the aforementioned emotions. Although we provide FePh as a facial expression dataset of signers in sign language, it has a wider application in gesture recognition and Human Computer Interaction (HCI) systems.
연구 동기 및 목표
- 다중 모달 수어 인식 연구를 저해하는 수어 맥락에서의 감정 레이블이 부여된 얼굴 표정 데이터셋의 부족 문제를 해결한다.
- 실제 환경 기반의 시각 기반 데이터셋을 제공하여 동적 얼굴 표정, 머리 자세 변화 및 움직임을 반영함으로써 자연스러운 수어 사용을 더 잘 반영한다.
- 일곱 가지 기본 감정과 'None' 클래스를 포함한 세부적인 감정 레이블을 제공함으로써 수어 내에서 얼굴 표정 인식 연구를 가능하게 한다.
- RWTH-PHOENIX-Weather 2014 데이터셋의 기존 손형 레이블과 결합함으로써 다중 모달 시스템 개발을 지원한다.
- 수어 인식을 넘어서 제스처 인식 및 인간-컴퓨터 상호작용(HCI) 분야의 광범위한 적용을 촉진한다.
제안 방법
- 공영 텔레비전 방송국 PHOENIX의 일상 뉴스 및 날씨 예보 영상에서 수어를 사용하는 수어자들의 명확한 얼굴 표정이 보이는 영상을 중심으로 3,000개 이상의 얼굴 영상을 추출했다.
- 일곱 가지 기본 감정인 '슬픔', '놀람', '공포', '분노', '중립', '혐오', '행복'과 분류할 수 없는 표현을 위한 'None' 클래스를 사용하여 각 영상에 주요, 보조, 보조2차 감정 쌍을 레이블링했다.
- 원본 영상 프레임 순서를 유지함으로써 시간적 순서를 보존하여 동적 얼굴 표정 전환 분석을 가능하게 하였다.
- 지속적인 수어 인식 분야에서 널리 사용되는 기준 기준 데이터셋인 RWTH-PHOENIX-Weather 2014 다중 수어자 데이터셋에서 데이터를 선택하여 일관성을 확보하였다.
- 복합 감정(예: '놀람_공포')을 포함한 미세한 감정 표현을 포괄하기 위해 다단계 레이블링 체계를 적용하여 감정의 정교함을 향상시켰다.
- 자연스러운 방송 영상에서 프레임을 선별함으로써 머리 자세, 방향성 및 움직임의 다양성을 확보하여 데이터셋의 현실성과 도전도를 높였다.
실험 결과
연구 질문
- RQ1방송 영상 데이터에서 실생활 기반의 대규모 시퀀스형 얼굴 표정 데이터셋을 수어 맥락에서 효과적으로 구축할 수 있는가?
- RQ2수어에서 얼굴 표정이 특정 손형과 얼마나 관련이 있으며, 이러한 관련성은 정량적으로 측정할 수 있는가?
- RQ3머리 움직임과 다양한 자세를 동반한 동적 얼굴 표정은 수어에서 얼굴 표정 인식 모델의 성능에 어떤 영향을 미치는가?
- RQ4얼굴 표정 데이터와 손형 데이터를 통합하면 다중 모달 수어 인식 시스템의 정확도가 향상되는가?
- RQ5수어에서 다양한 손형 클래스 간에 얼굴 표정의 분포 및 빈도는 어떻게 되며, 이는 의미적 또는 문법적 연관성을 시사하는가?
주요 결과
- FePh 데이터셋은 실제 방송 영상에서 추출된 3,000개 이상의 얼굴 영상로 구성되어 있으며, 다양한 머리 자세, 움직임 및 반투명한 조건을 포함한다.
- 손형 클래스와 특정 얼굴 표정 간에 유의미한 상관관계가 발견되었으며, 손형 클래스 '3'은 '공포'와 0.697의 상관관계, '놀람'과 0.383의 상관관계를 보였다.
- 히트맵 분석을 통해 특정 얼굴 표정(예: '공포')이 특정 손형과 함께 비율이 높게 나타나며, 이는 문법적 또는 감정적 의미를 지닌다는 것을 확인하였다.
- 동일한 손형이 다른 얼굴 표정과 짝지어질 수 있음을 통해, 의미의 해석을 명확히 하기 위해 얼굴 표정의 핵심적 역할을 입증하였다.
- 'None' 클래스 레이블의 포함은 실제 환경에서의 얼굴 표정 레이블링이 기본 감정 범주에 모두 포함되지 않는 복잡성을 반영한다.
- 기존의 RWTH-PHOENIX-Weather 2014 MS 손형 데이터셋과 얼굴 표정 데이터를 결합함으로써 향후 다중 모달 학습을 위한 포괄적인 자원을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.