Skip to main content
QUICK REVIEW

[논문 리뷰] EmoSet: A Large-scale Visual Emotion Dataset with Rich Attributes

Jingyuan Yang, Qirui Huang|arXiv (Cornell University)|2023. 07. 16.
Advanced Computing and Algorithms인용 수 5
한 줄 요약

EmoSet는 118,102장의 이미지에 대해 밝기, 색채도, 장면 유형, 물체 유형, 얼굴 표정, 인간의 동작 등 심리학적으로 동기를 부여한 풍부한 속성을 포함한 최초의 대규모 시각적 정서 데이터셋을 소개한다. 속성 인식 모델링을 통해 시각적 정서 인식에서 뛰어난 성능을 달성하였으며, EmoSet 사전학습에서 FI에 대해 미세조정했을 때 정확도가 20.09% 감소하여 일반화 및 해석 가능성 측면에서 뛰어난 성능을 입증하였다.

ABSTRACT

Visual Emotion Analysis (VEA) aims at predicting people's emotional responses to visual stimuli. This is a promising, yet challenging, task in affective computing, which has drawn increasing attention in recent years. Most of the existing work in this area focuses on feature design, while little attention has been paid to dataset construction. In this work, we introduce EmoSet, the first large-scale visual emotion dataset annotated with rich attributes, which is superior to existing datasets in four aspects: scale, annotation richness, diversity, and data balance. EmoSet comprises 3.3 million images in total, with 118,102 of these images carefully labeled by human annotators, making it five times larger than the largest existing dataset. EmoSet includes images from social networks, as well as artistic images, and it is well balanced between different emotion categories. Motivated by psychological studies, in addition to emotion category, each image is also annotated with a set of describable emotion attributes: brightness, colorfulness, scene type, object class, facial expression, and human action, which can help understand visual emotions in a precise and interpretable way. The relevance of these emotion attributes is validated by analyzing the correlations between them and visual emotion, as well as by designing an attribute module to help visual emotion recognition. We believe EmoSet will bring some key insights and encourage further research in visual emotion analysis and understanding. Project page: https://vcc.tech/EmoSet.

연구 동기 및 목표

  • 풍부한 주석이 달린 대규모, 다양한, 균형 잡힌 시각적 정서 데이터셋의 부족을 해결하기 위해.
  • 심리학 이론에 기반한 기술 가능한 시각적 속성을 도입하여 시각적 정서 분석의 정서적 격차를 해소하기 위해.
  • 보조 속성 감독을 통해 더 해석 가능하고 강력한 시각적 정서 인식을 가능하게 하기 위해.
  • 정서 인식을 넘어서 정서 자극에 대한 깊은 이해를 위한 연구를 촉진하기 위해.
  • 풍부한 이미지-텍스트 및 속성 주석을 통해 다중 모odal 및 약한 지도 학습을 지원하기 위해.

제안 방법

  • Mikels의 정서 모델을 사용해 810개의 정서 키워드를 통해 검색한 330만 장의 이미지에서 EmoSet-3.3M를 구축하였다.
  • 8개의 정서 카테고리와 6개의 시각적 속성을 포함한 118,102장의 이미지를 수집하고 인간 주석을 제공하였다.
  • 밝기, 장면 유형, 얼굴 표정에서 정서 관련 특징을 추출하고 통합하기 위해 다중 분지 속성 모듈을 설계하였다.
  • t-SNE 시각화를 통해 속성 특징이 분류 가능한, 정서에 민감한 표현을 학습하고 있음을 입증하였다.
  • ImageNet 사전학습 여부에 따라 ResNet-50을 사용해 FI 및 Artphoto 데이터셋에서 교차 데이터셋 일반화 성능을 평가하였다.
  • 정서 인식 성능에 대한 상관 분석과 추론 실험을 통해 속성의 관련성을 검증하였다.

실험 결과

연구 질문

  • RQ1밝기 및 얼굴 표정과 같은 풍부한 시각적 속성이 시각적 자극에서 특정 정서 카테고리와 어떻게 관련되어 있는가?
  • RQ2기본적인 인식 방법에 비해 속성 인식 모델링이 시각적 정서 인식 성능을 얼마나 향상시킬 수 있는가?
  • RQ3EmoSet에서 사전학습한 모델이 FI 및 Artphoto와 같은 다른 시각적 정서 데이터셋으로 일반화되는 정도는 어떠한가?
  • RQ4속성 특징을 시각화하여 다양한 정서 상태 간에 의미 있는 분리가 이루어지는가?
  • RQ5스케일, 다양성, 균형, 주석의 풍부함 측면에서 EmoSet는 기존 데이터셋과 비교해 어떤가?

주요 결과

  • EmoSet-118K는 8개의 정서 카테고리에 걸쳐 균형 잡힌 분포를 보이며, 기존 최대 데이터셋(FI)의 5배 이상인 118,102장의 인간 주석이 달린 이미지를 포함한다.
  • 속성 모듈을 통해 분류 가능한, 정서 관련 표현을 학습함으로써 시각적 정서 인식 성능이 향상되었으며, t-SNE 시각화 결과 정서별로 명확한 클러스터링이 관찰되어 이를 확인하였다.
  • EmoSet에서 사전학습한 모델은 FI에서 테스트했을 때 정확도가 20.09% 감소하였고, FI에서 사전학습한 모델의 경우 26.98% 감소한 것과 비교해 EmoSet에서의 일반화 능력이 뛰어나다는 것을 보여주었다.
  • '폐허'와 '놀이방'과 같은 속성 특징은 t-SNE 투영에서 각각 슬픔과 웃음과 대응하여 공간적으로 분리되어 있으며, 이는 속성의 관련성을 검증하였다.
  • 사회적 및 예술적 콘텐츠를 포함한 다양한 이미지 원천 덕분에 EmoSet는 예술적 이미지(Artphoto)로의 일반화 능력이 뛰어나며, EmoSet로 학습한 모델이 FI로 학습한 모델보다 성능이 뛰어나다.
  • 풍부한 이미지-텍스트 및 속성 주석 덕분에 EmoSet는 약한 지도 학습, 시각-언어 모델링, 향후 시각적 정서 생성 및 편집 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.