Skip to main content
QUICK REVIEW

[論文レビュー] Revealing the Invisible with Model and Data Shrinking for Composite-database Micro-expression Recognition

Zhaoqiang Xia, Wei Peng|arXiv (Cornell University)|Jun 17, 2020
Anomaly Detection Techniques and Applications参考文献 44被引用数 6
ひとこと要約

本稿では、パラメータフリーのモジュール(広範囲拡張、ショートカット接続、アテンションユニット)を備えた再帰的畳み込みネットワーク(RCN)を提案し、複合データベースにおける微表情認識の性能を向上させる。モデルと入力データの複雑さを同時に低減することで、MEGC2019データセット上で最先端の手法を上回り、学習複雑さの低減と自動化されたニューラルアーキテクチャ探索戦略によりドメインシフトに対して優れた耐性を示す。

ABSTRACT

Composite-database micro-expression recognition is attracting increasing attention as it is more practical to real-world applications. Though the composite database provides more sample diversity for learning good representation models, the important subtle dynamics are prone to disappearing in the domain shift such that the models greatly degrade their performance, especially for deep models. In this paper, we analyze the influence of learning complexity, including the input complexity and model complexity, and discover that the lower-resolution input data and shallower-architecture model are helpful to ease the degradation of deep models in composite-database task. Based on this, we propose a recurrent convolutional network (RCN) to explore the shallower-architecture and lower-resolution input data, shrinking model and input complexities simultaneously. Furthermore, we develop three parameter-free modules (i.e., wide expansion, shortcut connection and attention unit) to integrate with RCN without increasing any learnable parameters. These three modules can enhance the representation ability in various perspectives while preserving not-very-deep architecture for lower-resolution data. Besides, three modules can further be combined by an automatic strategy (a neural architecture search strategy) and the searched architecture becomes more robust. Extensive experiments on MEGC2019 dataset (composited of existing SMIC, CASME II and SAMM datasets) have verified the influence of learning complexity and shown that RCNs with three modules and the searched combination outperform the state-of-the-art approaches.

研究の動機と目的

  • ドメインシフトの影響により性能が低下する複合データベースにおける深層モデルの性能劣化を解消すること。
  • 入力解像度とモデルの深さといった学習複雑さが、複合データセットにおける表現学習に与える影響を調査すること。
  • 過学習のリスクを低減しつつ強力な表現力を維持できる、軽量で浅いアーキテクチャの再帰的畳み込みネットワーク(RCN)を開発すること。
  • パラメータを増加させずに特徴学習を向上させる3つのパラメータフリーのモジュール(広範囲拡張、ショートカット接続、アテンションユニット)を導入すること。
  • 最適なモジュールの組み合わせを自動で発見するニューラルアーキテクチャ探索(NAS)戦略を設計し、耐性と性能の向上を図ること。

提案手法

  • モデルとデータの複雑さを低減するため、浅い深さと低解像度の入力を持つ再帰的畳み込みネットワーク(RCN)を提案する。
  • 3つのパラメータフリーのモジュールを統合する:広範囲拡張により1層あたりの受容 field を拡大し、ショートカット接続により再帰層の学習を安定化させ、アテンションユニットにより微表情関連の顔領域に注目する。
  • 最適なモジュールの組み合わせを探索するための微分可能ニューラルアーキテクチャ探索(NAS)戦略を設計し、上位候補から最良の性能を示すアーキテクチャを選択する。
  • MEGC2019データセット(SMIC、CASME II、SAMMデータセットを統合した1つの複合ベンチマーク)上で、RCNおよびその変種をエンドツーエンドで学習・評価する。
  • さまざまな解像度(fs=60, 100, 200, 300)のフローマップ表現を用いて、入力複雑さの低減下での計算効率とモデルの耐性を分析する。
  • 各モジュールの寄与度とNAS最適化アーキテクチャの有効性を検証するためのアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1入力解像度とモデルの深さを低減させることで、複合データベースにおける微表情認識の深層モデル性能にどのような影響が生じるか?
  • RQ2パラメータを増加させずに、パラメータフリーのモジュール(広範囲拡張、ショートカット接続、アテンションユニット)が表現学習にどの程度向上効果をもたらすか?
  • RQ3ニューラルアーキテクチャ探索戦略は、これらのモジュールの最適な組み合わせを効果的に同定でき、耐性と精度の向上に寄与するか?
  • RQ4本稿で提案する、複雑さを低減したRCNは、MEGC2019複合データベースベンチマークで最先端の手法と比較してどのように差をつけるか?
  • RQ5多データセットにおける微表情認識(MER)においてドメインシフトが深層モデルに与える影響は何か?また、本手法はその問題をどのように緩和するか?

主な発見

  • 低解像度の入力データと浅いネットワークアーキテクチャは、複合データベースにおける微表情認識のドメインシフトに起因する性能劣化を顕著に低減する。
  • パラメータフリーのモジュールを備えた本稿のRCNは、STSTNet、OFF-ApexNet、Dual-InceptionよりもMEGC2019データセットで高い精度を達成し、耐性の向上を示している。
  • アテンションユニットにより、微表情関連の顔領域に注目できるようになり、関係のない顔の動きからの干渉が低減される。
  • NAS最適化アーキテクチャ(RCN-F)は、他のすべての変種および最先端手法を上回る性能を示し、自動化されたモジュール組み合わせの有効性を確認した。
  • 計算時間は、フローマップ解像度が高くなるほど、パラメータ数が多くなるほど増加する。これにより、データおよびモデルの縮小が学習効率の向上に寄与することが確認された。
  • 可視化結果から、本モデルは多様な被験者および表情(例:驚き、否定的、肯定的)における微表情を正しく同定しているが、アテンションが誤って向けられた場合には失敗が生じる場合がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。