[論文レビュー] Latent hypernet: Exploring all Layers from Convolutional Neural Networks
本稿では、畳み込みニューラルネットワーク(ConvNets)の性能を向上させるため、すべての畳み込み層からの特徴マップを部分最小二乗法(PLS)を用いて共有の潜在空間に射影し、その後連結して分類するLatent HyperNet(LHN)という手法を提案する。この手法により、推論時間に追加コストをかけずに最先端の手法よりも最大5.1パーセンテージポイントの認識精度向上が達成された。
Since Convolutional Neural Networks (ConvNets) are able to simultaneously learn features and classifiers to discriminate different categories of activities, recent works have employed ConvNets approaches to perform human activity recognition (HAR) based on wearable sensors, allowing the removal of expensive human work and expert knowledge. However, these approaches have their power of discrimination limited mainly by the large number of parameters that compose the network and the reduced number of samples available for training. Inspired by this, we propose an accurate and robust approach, referred to as Latent HyperNet (LHN). The LHN uses feature maps from early layers (hyper) and projects them, individually, onto a low dimensionality space (latent). Then, these latent features are concatenated and presented to a classifier. To demonstrate the robustness and accuracy of the LHN, we evaluate it using four different networks architectures in five publicly available HAR datasets based on wearable sensors, which vary in the sampling rate and number of activities. Our experiments demonstrate that the proposed LHN is able to produce rich information, improving the results regarding the original ConvNets. Furthermore, the method outperforms existing state-of-the-art methods.
研究の動機と目的
- 標準的なConvNetsが人間活動認識(HAR)において直面する限界、例えばパラメータ数の多さや小さな訓練データセットに対する感受性を解消すること。
- ConvNetsの浅層特徴が、深層特徴と組み合わせることで分類性能を向上させるのに有用な識別的情報を含んでいるかどうかを検証すること。
- ネットワークアーキテクチャの変更や再訓練を必要とせず、軽量かつ即座に統合可能な、ConvNetの性能を向上させるプラグアンドプレイ型の手法を開発すること。
- 異なるセンサ構成やアクティビティ数を有する多様なHARデータセットにおいて、本手法の頑健性と一般化性能を実証すること。
提案手法
- 事前に訓練済みのConvNetの各マックスプーリング層から特徴マップを抽出する。
- 各層の特徴マップを、教師あり次元削減手法である部分最小二乗法(PLS)を用いて低次元の潜在空間に射影する。
- 全層の潜在特徴を連結し、単一の表現として統合する。
- 分類器は連結された潜在特徴上で学習され、元のConvNetの重みは固定されたまま保持される。
- 本手法はアーキテクチャに依存せず、再訓練やアーキテクチャ変更なしに任意のConvNetに適用可能である。
- 本手法は、サンプリングレートやアクティビティクラス数が異なる5つの公開HARデータセットを用いて評価された。
実験結果
リサーチクエスチョン
- RQ1浅層特徴が深層特徴と組み合わせることで、HARの分類に補足的な識別的情報を提供できるか?
- RQ2複数層の特徴を共通の潜在空間に射影することで、最終層のみを用いる場合と比較して認識精度が向上するか?
- RQ3推論時間における計算コストを増加させることなく、本手法が性能向上を達成できるか?
- RQ4多様なデータセットにおいて、LHN手法は最先端のConvNetベースのHAR手法と比較してどのように性能を発揮するか?
主な発見
- LHN手法は、5つのHARデータセット全体で、既存の最先端手法よりも平均して5.1パーセンテージポイントの認識精度向上を達成した。
- USCHADデータセットでは、LHNは前回のSOTAを5.1 p.p.上回り、認識率98.7%を達成した。
- UTD-MHAD1データセットでは、アクティビティクラス数が多くてもLHNは前回最良手法より5.3 p.p.の向上を達成した。
- 予測時間について、元のConvNetと統計的に同等であり、推論コストに顕著な増加は認められなかった。
- LHNを適用しなくても、本研究で提案されたConvNet3アーキテクチャは、より大きなカーネルサイズが長時間スケールのパターンを捉えられるため、文献に登場する既存のConvNetアーキテクチャを上回る性能を示した。
- MHEALTHデータセットでは、最高精度を示したベースラインモデル(HaとChoi, 2017)にLHNを適用することで、認識精度が7.3 p.p.向上し、前回のSOTAを上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。