Skip to main content
QUICK REVIEW

[論文レビュー] WEMAC: Women and Emotion Multi-modal Affective Computing dataset

José A. Miranda, Esther Rituerto-González|arXiv (Cornell University)|Mar 1, 2022
Emotion and Mood Recognition被引用数 5
ひとこと要約

本論文は、実験室内の仮想現実刺激によって誘発された感情反応を示した47名の女性から得られた生理的、発話、自己報告による感情データを含む、新しいマルチモーダルデータセットWEMACを紹介する。このデータセットは、性別に特化した感情計算研究を可能にし、性別に基づく暴力防止に関連する恐怖やその他の感情の検出を目的としており、音声・視覚特徴のラテント統合を用いて二値分類(恐怖/非恐怖)で67.59のF1スコアを達成している。

ABSTRACT

Among the seventeen Sustainable Development Goals (SDGs) proposed within the 2030 Agenda and adopted by all the United Nations member states, the Fifth SDG is a call for action to turn Gender Equality into a fundamental human right and an essential foundation for a better world. It includes the eradication of all types of violence against women. Within this context, the UC3M4Safety research team aims to develop Bindi. This is a cyber-physical system which includes embedded Artificial Intelligence algorithms, for user real-time monitoring towards the detection of affective states, with the ultimate goal of achieving the early detection of risk situations for women. On this basis, we make use of wearable affective computing including smart sensors, data encryption for secure and accurate collection of presumed crime evidence, as well as the remote connection to protecting agents. Towards the development of such system, the recordings of different laboratory and into-the-wild datasets are in process. These are contained within the UC3M4Safety Database. Thus, this paper presents and details the first release of WEMAC, a novel multi-modal dataset, which comprises a laboratory-based experiment for 47 women volunteers that were exposed to validated audio-visual stimuli to induce real emotions by using a virtual reality headset while physiological, speech signals and self-reports were acquired and collected. We believe this dataset will serve and assist research on multi-modal affective computing using physiological and speech information.

研究の動機と目的

  • 感情計算分野における性別バランスの取れた、現実的でリアルな感情データセットの不足に応えること、特に女性と関連する恐怖状態に焦点を当てる。
  • 性別に基づく暴力(GBV)のリスク状況を早期に検出可能なインテリジェントでウェアラブルなシステムの開発を支援すること。
  • 生理的、発話、自己報告データを含む、公開可能で倫理的に配慮されたデータセットを提供し、マルチモーダル感情分析を促進すること。
  • GBV防止の文脈において、マルチモーダル統合、トランスファー学習、アテンションメカニズムを用いた感情認識の研究を可能にすること。
  • 女性の感情反応と生理的活性化パターンに焦点を当てることで、感情計算分野におけるジェンダー平等を推進すること。

提案手法

  • 参加者は、検証済みの音声・視覚刺激を仮想現実ヘッドセットを通じて提示され、制御された実験室内環境で本物の感情反応を示した。
  • ウェアラブルセンサーや標準的なハードウェアを用いて、生理的信号(ECG、EDA、呼吸、PPG)と発話信号が収集された。
  • 発話信号は音声活動検出(VAD)を経て、librosa、openSMILE、DeepSpectrumツールキットを用いて低レベルおよび高レベル特徴に変換された。
  • 合計12,882個の特徴量と埋め込み表現が抽出され、そのうち38個のMFCCベース特徴、88個のeGeMAPS特徴、6,373個のComParE特徴、6,144次元のDeepSpectrum埋め込みが含まれる。
  • 事前学習済みのVGG-19ネットワーク(AudioSetで学習)を用いて128次元のVGGish埋め込みが抽出された。
  • すべての生の発話データはプライバシー保護のため除外され、公開されたのは処理済みの特徴量と埋め込み表現のみであり、信号処理のオープンソースコードも併記された。

実験結果

リサーチクエスチョン

  • RQ1女性の本物の感情状態を的確に表現するため、マルチモーダルな生理的および発話信号をどのように効果的に収集・処理できるか。
  • RQ2音声・視覚の統合は、性別に特化した文脈において、恐怖状態と非恐怖状態の検出をどの程度向上できるか。
  • RQ3WEMACデータセットは、GBVリスク検出のための堅牢でリアルタイムな感情認識システムの開発を支援できるか。
  • RQ4制御された実験室環境下での、性別に特化した感情反応の刺激に対する比較はどのようになるか。
  • RQ5この新しい性別に特化した感情計算データセットにおけるベースラインモデルの性能はいかほどか。

主な発見

  • WEMACデータセットは、VR誘発の刺激を用いた制御された実験室内環境で得られた47名の女性の生理的、発話、自己報告感情データを含む。
  • 合計12,882個の特徴量と埋め込み表現が発話信号から抽出され、そのうち38個のMFCCベース、88個のeGeMAPS、6,373個のComParE、6,144次元のDeepSpectrum特徴が含まれる。
  • 公式ベースラインは、音声・視覚刺激レベルでの二値分類(恐怖/非恐怖)において、ラテント統合を用いて67.59のF1スコアを達成した。
  • 処理済みの特徴量とオープンソースの信号処理コードを併記することで、プライバシー保護と再現可能性を確保した形でデータセットが公開された。
  • 生態的妥当性を高めるべく、57名の非GBV関連女性の追加データ収集と、GBV生存者の継続的データ収集を含む、より大きな研究プロジェクトの一環である。
  • 研究チームは、リアルタイムのGBVリスク検出を目的としたサイバーフィジカルAIシステム「Bindi」を用いた、実世界でのウェアラブルデプロイメントへのシステム拡張を計画している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。