Skip to main content
QUICK REVIEW

[論文レビュー] Emotions Beyond Words: Non-Speech Audio Emotion Recognition With Edge Computing

Ibrahim Malik, Siddique Latif|arXiv (Cornell University)|May 1, 2023
Emotion and Mood Recognition被引用数 5
ひとこと要約

本稿では、エッジコンピューティングに最適化された知識蒸留ベースの非音声音声感情認識システムを提案し、リソース制限のあるデバイス上で叫び声や泣き声などの非音声の感情を効率的に検出可能にする。学生モデルは叫び声検出で78.60%の精度、叫び声の種別分類で66.42%の精度を達成し、MobileNetV3sを上回る性能を示した。また、教師モデルと比較してモデルサイズを53%削減し、推論遅延をほぼ50%短縮した。

ABSTRACT

Non-speech emotion recognition has a wide range of applications including healthcare, crime control and rescue, and entertainment, to name a few. Providing these applications using edge computing has great potential, however, recent studies are focused on speech-emotion recognition using complex architectures. In this paper, a non-speech-based emotion recognition system is proposed, which can rely on edge computing to analyse emotions conveyed through non-speech expressions like screaming and crying. In particular, we explore knowledge distillation to design a computationally efficient system that can be deployed on edge devices with limited resources without degrading the performance significantly. We comprehensively evaluate our proposed framework using two publicly available datasets and highlight its effectiveness by comparing the results with the well-known MobileNet model. Our results demonstrate the feasibility and effectiveness of using edge computing for non-speech emotion detection, which can potentially improve applications that rely on emotion detection in communication networks. To the best of our knowledge, this is the first work on an edge-computing-based framework for detecting emotions in non-speech audio, offering promising directions for future research.

研究の動機と目的

  • 非音声感情認識のためのエッジコンピューティング最適化システムの不足に対処すること。特に、重要なリアルタイム応用を想定する。
  • 個人アシスタントなどの低リソースエッジデバイスに展開可能な感情認識モデルにおける計算およびメモリのオーバーヘッドを低減すること。
  • カフェ、キッチン、メトロ、オフィス環境などの実世界のノイズ環境下での耐性を評価すること。
  • 知識蒸留が、モデルサイズと推論遅延を顕著に削減しながらも高い性能を維持できることを示すこと。
  • 医療、安全、スマートホームアプリケーションにおけるリアルタイム感情検出のための展開可能なフレームワークを提供すること。

提案手法

  • 大規模で高精度な教師モデルから小規模で計算効率の良い学生モデルへ、知識蒸留を用いて知識を転送する。
  • 学生モデルは教師モデルからのソフトラベルを用いて学習され、パrameter数を削減しつつも複雑な感情パターンを学習可能となる。
  • フレームワークは、叫び声検出と感情分類に焦点を当てた2つの公開非音声音声データセットを用いて評価された。
  • ノイズ増幅はテスト時のみに適用され、実世界の音響条件を模擬し、耐性を評価する。
  • 推論遅延、ロード時間、モデルサイズを測定するために、Intel Atom E3940 CPU搭載のUpBoard上でモデル効率をベンチマークした。
  • 精度、パrameter数、メモリフットプリントを主な指標として、MobileNetV3sおよび教師モデルと性能を比較した。

実験結果

リサーチクエスチョン

  • RQ1知識蒸留は、エッジデバイスにおける非音声音声のための大きな感情認識モデルを効果的に圧縮しつつ、性能を維持できるか?
  • RQ2提案された学生モデルは、カフェ、キッチン、メトロなどの実世界のノイズ環境下でどのように性能を発揮するか?
  • RQ3エッジ展開可能な非音声感情認識システムにおいて、モデルサイズ、推論遅延、精度のトレードオフはどのように変化するか?
  • RQ4計算効率および背景ノイズに対する耐性の観点から、本システムはMobileNetV3sと比較してどう異なるか?
  • RQ5低消費電力ハードウェア上で、リアルタイムに叫び声や泣き声などの非音声感情表現を信頼性高く検出・分類できるか?

主な発見

  • 提案された学生モデルは、叫び声検出で78.60%の精度、叫び声の種別分類で66.42%の精度を達成し、MobileNetV3s(76.92%および60.15%)を上回った。
  • 学生モデルはモデルサイズを2.719MBに、パrameter数を712,778にまで削減し、教師モデルと比較して93.6%の削減を達成した。
  • 推論遅延は、MobileNetV3sより約20ms速く、教師モデルのほぼ半分まで短縮され、全テストモデルの中で最も速いロード時間となった。
  • ノイズ環境下でも良好な一般化性能を示し、叫び声検出の精度はカフェで72.86%(最低)~オフィスで80.13%(最高)の範囲、分類精度はノイズタイプごとに63.10%~65.68%の間で安定した。
  • 実世界のノイズに対して高い耐性を示し、テスト時のみに背景ノイズを追加した場合でも、性能低下が最小限に抑えられた。
  • 結果から、リアルタイムアラートや監視アプリケーションに向けた、効率的で高精度な非音声感情認識をエッジデバイスに展開可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。