[논문 리뷰] WEMAC: Women and Emotion Multi-modal Affective Computing dataset
이 논문은 실험 환경에서 감정 유도 가상현실 자극에 노출된 47명의 여성으로부터 생리적, 음성, 자가 보고된 정서 데이터를 포함하는 새로운 다중모달 데이터셋 WEMAC을 소개한다. 이 데이터셋은 성별 기반 폭력 예방과 관련된 공포 및 기타 정서를 탐지하는 데 초점을 맞춘 성별 특화 정서 컴퓨팅 연구를 가능하게 하며, 음성-시각 특징의 후기 융합을 사용하여 이진 공포/비공포 분류에서 67.59의 F1 스코어를 달성한다.
Among the seventeen Sustainable Development Goals (SDGs) proposed within the 2030 Agenda and adopted by all the United Nations member states, the Fifth SDG is a call for action to turn Gender Equality into a fundamental human right and an essential foundation for a better world. It includes the eradication of all types of violence against women. Within this context, the UC3M4Safety research team aims to develop Bindi. This is a cyber-physical system which includes embedded Artificial Intelligence algorithms, for user real-time monitoring towards the detection of affective states, with the ultimate goal of achieving the early detection of risk situations for women. On this basis, we make use of wearable affective computing including smart sensors, data encryption for secure and accurate collection of presumed crime evidence, as well as the remote connection to protecting agents. Towards the development of such system, the recordings of different laboratory and into-the-wild datasets are in process. These are contained within the UC3M4Safety Database. Thus, this paper presents and details the first release of WEMAC, a novel multi-modal dataset, which comprises a laboratory-based experiment for 47 women volunteers that were exposed to validated audio-visual stimuli to induce real emotions by using a virtual reality headset while physiological, speech signals and self-reports were acquired and collected. We believe this dataset will serve and assist research on multi-modal affective computing using physiological and speech information.
연구 동기 및 목표
- 정서 컴퓨팅 분야에서 여성과 공포 관련 상태에 특화된 균형 잡힌 현실적인 정서 데이터셋의 부족을 해결하기 위해.
- 성별 기반 폭력(GBV) 위험 상황을 조기에 탐지하기 위한 지능형 웨어러블 시스템 개발을 지원하기 위해.
- 생리적, 음성, 자가 보고 데이터를 포함한 공개 가능한 윤리적으로 정제된 데이터셋을 제공하여 다중모달 정서 분석을 위해.
- GBV 예방 맥락에서 다중모달 융합, 전이 학습, 주의 메커니즘을 활용한 정서 인식 연구를 가능하게 하기 위해.
- 여성의 정서 반응과 생리적 활성화 패tern에 초점을 맞춰 정서 컴퓨팅 분야의 성별 평등을 촉진하기 위해.
제안 방법
- 참가자들은 검증된 음성-시각 자극을 가상현실 헤드셋을 통해 노출받아 통제된 실험실 환경에서 실제 정서를 유도받았다.
- 생리적 신호(ECG, EDA, 호흡, PPG)와 음성 신호는 웨어러블 센서와 표준 하드웨어를 사용해 측정되었다.
- 음성 신호는 음성 활동 검출(Voice Activity Detection, VAD)을 거쳐 librosa, openSMILE, DeepSpectrum 툴킷을 사용해 저수준 및 고수준 특징으로 변환되었다.
- 모든 원본 음성 데이터는 개인정보 보호를 위해 제외되었으며, 공개된 것은 처리된 특징과 임베딩 뿐이며, 오픈소스 신호 처리 코드가 함께 제공되었다.
- 12,882개의 특징과 임베딩이 추출되었으며, 이는 38개의 MFCC 기반 특징, 88개의 eGeMAPS 특징, 6,373개의 ComParE 특징, 6,144차원의 DeepSpectrum 임베딩을 포함한다.
- 사전 훈련된 VGG-19 네트워크를 AudioSet에서 사용하여 128차원의 VGGish 임베딩을 추출하였다.
실험 결과
연구 질문
- RQ1여성의 실제 정서 상태를 대표하기 위해 다중모달 생리적 및 음성 신호를 효과적으로 캡처하고 처리하는 방법은 무엇인가?
- RQ2성별 특화 맥락에서 음성-시각 융합이 공포 대 비공포 상태 탐지에 얼마나 기여하는가?
- RQ3WEMAC 데이터셋은 GBV 위험 탐지용 강력하고 실시간 정서 인식 시스템 개발을 지원할 수 있는가?
- RQ4통제된 실험실 환경에서 자극에 대한 여성의 성별 특화 정서 반응은 어떻게 비교되는가?
- RQ5기본 모델의 성능은 이 새로운 성별 중심의 정서 컴퓨팅 데이터셋에서 어떻게 나타나는가?
주요 결과
- WEMAC 데이터셋은 VR 유도 자극을 통해 실험실 환경에서 47명의 여성으로부터 생리적, 음성, 자가 보고된 정서 데이터를 포함한다.
- 음성 신호에서 총 12,882개의 특징과 임베딩이 추출되었으며, 이는 38개의 MFCC 기반 특징, 88개의 eGeMAPS 특징, 6,373개의 ComParE 특징, 6,144차원의 DeepSpectrum 특징을 포함한다.
- 공식 기준 모델은 음성-시각 자극 수준에서 후기 융합을 사용하여 이진 공포/비공포 분류에서 67.59의 F1 스코어를 달성하였다.
- 데이터셋은 처리된 특징과 오픈소스 신호 처리 코드를 함께 공개하여 개인정보 보호와 재현 가능성을 확보하였다.
- 이 데이터셋은 생태학적 타당성을 높이기 위해 추가로 57명의 비-GBV 여성과 GBV 생존자로부터의 지속적인 데이터 수집을 포함하는 더 큰 연구 노력의 일부이다.
- 연구 팀은 Bindi라는 실시간 GBV 위험 탐지용 사이버-물리적 AI 시스템을 활용해 시스템을 실생활 웨어러블 배포로 확장할 계획이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.