Skip to main content
QUICK REVIEW

[論文レビュー] ResMoNet: A Residual Mobile-based Network for Facial Emotion Recognition in Resource-Limited Systems.

Rodolfo Ferro-Pérez, Hugo Mitre‐Hernandez|arXiv (Cornell University)|May 15, 2020
Emotion and Mood Recognition参考文献 20被引用数 8
ひとこと要約

ResMoNetは、深さ方向に分離可能な畳み込みと残差ブロックを用いた、リソース制限のあるデバイス向けの軽量で残差型のモバイルベースCNNを提案する。RaFDデータセット上で評価した結果、MobileNet、PeleeNet、EDNN、IDNNと比較して、FLOPs、パラメータ数、推論速度、メモリ使用量が削減され、高い精度を達成した。

ABSTRACT

The Deep Neural Networks (DNNs) models have contributed a high accuracy for the classification of human emotional states from facial expression recognition data sets, where efficiency is an important factor for resource-limited systems as mobile devices and embedded systems. There are efficient Convolutional Neural Networks (CNN) models as MobileNet, PeleeNet, Extended Deep Neural Network (EDNN) and Inception-Based Deep Neural Network (IDNN) in terms of model architecture results: parameters, Floating-point OPerations (FLOPs) and accuracy. Although these results are satisfactory, it is necessary to evaluate other computational resources related to the trained model such as main memory utilization and response time to complete the emotion recognition. In this paper, we compare our proposed model inspired in depthwise separable convolutions and residual blocks with MobileNet, PeleeNet, EDNN and IDNN. The comparative results of the CNN architectures and the trained models --with Radboud Faces Database (RaFD)-- installed in a resource-limited device are discussed.

研究の動機と目的

  • モバイルおよび組み込みデバイスなどのリソース制限のあるシステムにおける効率的なディープラーニングモデルの需要に対応すること。
  • FLOPs やパラメータ数といった伝統的な指標を超えて、メモリ使用量と推論時間の評価を含め、計算効率を向上させること。
  • 深さ方向に分離可能な畳み込みと残差ブロックを組み合わせた、低リソース環境でのパフォーマンス向上を図る新しいCNNアーキテクチャの開発。
  • 顔の感情認識タスクにおいて、MobileNet、PeleeNet、EDNN、IDNNといった既存の軽量モデルと比較するベンチマークの実施。

提案手法

  • 計算複雑性を低減するため、深さ方向に分離可能な畳み込みを活用した残差型モバイルベースネットワーク(ResMoNet)の設計。
  • 深層ネットワークにおける訓練の安定化と勾配の流れの改善を図るため、残差ブロックを統合。
  • 低FLOPs、最小限のパラメータ数、およびメモリフットプリントの削減を目的としたモデルアーキテクチャの最適化。
  • 実際のデプロイメント制約下で、Radboud Faces Database(RaFD)上でモデルを学習および評価。
  • 複数の軽量CNNにおける推論性能(応答時間およびメインメモリ使用量)を比較。
  • 顔の感情認識タスクに適応させるために、トランスファー学習およびファインチューニング技術を活用。

実験結果

リサーチクエスチョン

  • RQ1ResMoNetは、顔の感情認識において、MobileNet、PeleeNet、EDNN、IDNNと比較して、FLOPsおよびモデルパラメータ数の点でどのように異なるか?
  • RQ2リソース制限のあるデバイスにデプロイされた際、ResMoNetの推論速度およびメインメモリ使用量はどの程度か?
  • RQ3ResMoNetにおける残差ブロックおよび深さ方向に分離可能な畳み込みの統合は、ベースラインモデルと比較して、精度および効率性を向上させるか?
  • RQ4FLOPs、パラメータ数、メモリ使用量、応答時間といった計算指標が、モバイルシステムにおける感情認識モデルのデプロイメント可能性にどのように影響を与えるか?

主な発見

  • ResMoNetは、RaFDデータセットにおいて、MobileNet、PeleeNet、EDNN、IDNNと比較して高い精度を達成しながらも、FLOPsとパラメータ数を低く抑えている。
  • ベースラインモデルと比較して、推論時間が短縮されていることから、モバイルデバイスにおけるリアルタイム性能が向上していることが示された。
  • メインメモリ使用量が、比較対象のモデルと比較して顕著に低く抑えられており、組み込みシステムへの適性が高まっている。
  • ResMoNetにおける深さ方向に分離可能な畳み込みと残差ブロックの組み合わせにより、精度と計算効率の間でより良いトレードオフが達成された。
  • 精度、FLOPs、パラメータ数、メモリ使用量の観点から、ResMoNetはすべてのベースラインモデルを上回る総合的な効率性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。