Skip to main content
QUICK REVIEW

[論文レビュー] Uncertainty aware audiovisual activity recognition using deep Bayesian variational inference

Mahesh Subedar, Ranganath Krishnan|arXiv (Cornell University)|Nov 27, 2018
Human Pose and Action Recognition参考文献 49被引用数 7
ひとこと要約

本稿では、深層ベイジアン変分推論を用いて、決定論的層と変分層を組み合わせることで、不確実性を考慮したマルチモーダル音声視覚行動認識フレームワークを提案する。この手法により、UCF101およびMoments-in-Timeデータセットで、非ベイジアンベースラインに比べて10.2%のF1スコア向上を達成し、分布外のサンプルを効果的に同定できる。

ABSTRACT

Deep neural networks (DNNs) provide state-of-the-art results for a multitude of applications, but the approaches using DNNs for multimodal audiovisual applications do not consider predictive uncertainty associated with individual modalities. Bayesian deep learning methods provide principled confidence and quantify predictive uncertainty. Our contribution in this work is to propose an uncertainty aware multimodal Bayesian fusion framework for activity recognition. We demonstrate a novel approach that combines deterministic and variational layers to scale Bayesian DNNs to deeper architectures. Our experiments using in- and out-of-distribution samples selected from a subset of Moments-in-Time (MiT) dataset show a more reliable confidence measure as compared to the non-Bayesian baseline and the Monte Carlo dropout (MC dropout) approximate Bayesian inference. We also demonstrate the uncertainty estimates obtained from the proposed framework can identify out-of-distribution data on the UCF101 and MiT datasets. In the multimodal setting, the proposed framework improved precision-recall AUC by 10.2% on the subset of MiT dataset as compared to non-Bayesian baseline.

研究の動機と目的

  • 深層ニューラルネットワークを用いたマルチモーダル音声視覚行動認識において、予測不確実性モデリングの欠如を解消すること。
  • より深いモデルに適応可能な、決定論的層と変分層を統合したスケーラブルなベイジアンディープラーニングアーキテクチャの開発。
  • モダリティ固有の不確実性を定量化することで、信頼性のある不確実性を伴うマルチモーダル統合を実現すること。
  • 音声視覚認識タスクにおける不確実性推定を用いて、分布外のサンプルを同定すること。
  • ノイズや曖昧な入力が存在する実世界の展開環境において、モデルの信頼性と耐障害性を向上させること。

提案手法

  • 決定論的層と変分層を組み合わせたハイブリッドベイジアンDNNアーキテクチャを提案し、ベイジアンディープラーニングをより深いネットワークにスケーリングする。
  • 重みの事後分布を近似するために確率的変分推論(SVI)を採用し、不確実性の定量化を可能にする。
  • 重みの事後分布を周辺化することでベイジアンニューラルネットワーク推論を実施し、予測不確実性を計算する。
  • BALDや予測エントロピーなどの不確実性指標を用いて、分布外入力を検出する。
  • モダリティ固有の不確実性推定値をマルチモーダル統合戦略に統合し、意思決定の信頼性と精度を向上させる。
  • モデルをMoments-in-Time(MiT)データセットで学習し、MiTおよびUCF101の分布内・分布外サンプルの両方で評価する。

実験結果

リサーチクエスチョン

  • RQ1変分推論を用いたベイジアンディープラーニングフレームワークは、音声視覚行動認識において、非ベイジアンDNNやMCドロップアウトに比べてより信頼性の高い不確実性推定を提供できるか?
  • RQ2提案された決定論的・変分層ハイブリッドアーキテクチャは、不確実性推定性能を維持したまま、より深いネットワークにスケーリングできるか?
  • RQ3提案フレームワークからの不確実性推定は、音声視覚認識タスクにおいて分布外サンプルを効果的に同定できるか?
  • RQ4不確実性を考慮したマルチモーダル統合は、標準の非ベイジアン統合に比べて、精度-再現率AUCを向上させるか?
  • RQ5異なる不確実性指標(例:BALD、予測エントロピー)は、分布内と分布外の入力をどのように区別できるか?

主な発見

  • 提案された確率的変分推論を用いたベイジアンDNNは、MiTデータセットにおいて非ベイジアンDNNベースラインに比べて10.2%のF1スコア向上を達成した。
  • ベイジアンDNNモデルは、音声視覚統合タスクにおいて、非ベイジアンDNN(56.61%と79.39%)に比べ、トップ1精度(58.2%)とトップ5精度(83.8%)が向上した。
  • 提案フレームワークからの不確実性推定は、BALDと予測エントロピーの密度ヒストグラムを通じて、分布内と分布外のサンプルの明確な分離を示した。
  • 精度と不確実性のキャリブレーションの両面で、MCドロップアウトベースのベイジアンDNNを上回り、音声視覚タスクにおけるF1スコアが3.8%高い結果を示した。
  • 確率的VIを用いたベイジアンDNNは、視覚のみのモデルに比べて9.2%のトップ1精度向上を達成し、モダリティ固有の不確実性の有効な統合を示した。
  • MiTデータセットの分布外データをUCF101の分布内サンプルでテストした際、フレームワークは分布シフトに対して高い耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。