Skip to main content
QUICK REVIEW

[論文レビュー] Subject Cross Validation in Human Activity Recognition

Akbar Dehghani, Tristan Glatard|arXiv (Cornell University)|Apr 4, 2019
Context-Aware Activity Recognition Systems参考文献 14被引用数 12
ひとこと要約

本稿は、交差検証手法が人体活動認識(HAR)性能に与える影響を調査し、標準的なk分割交差検証がi.i.d.仮定に違反するため、正解率を10%(重複するウィンドウを用いる場合は最大16%)過大評価していることを示している。著者らは、より信頼性の高い評価手法として「被験者交差検証」を提案し、重複するスライディングウィンドウは性能向上に寄与せず、無駄な計算コストを追加すると結論づけている。

ABSTRACT

K-fold Cross Validation is commonly used to evaluate classifiers and tune their hyperparameters. However, it assumes that data points are Independent and Identically Distributed (i.i.d.) so that samples used in the training and test sets can be selected randomly and uniformly. In Human Activity Recognition datasets, we note that the samples produced by the same subjects are likely to be correlated due to diverse factors. Hence, k-fold cross validation may overestimate the performance of activity recognizers, in particular when overlapping sliding windows are used. In this paper, we investigate the effect of Subject Cross Validation on the performance of Human Activity Recognition, both with non-overlapping and with overlapping sliding windows. Results show that k-fold cross validation artificially increases the performance of recognizers by about 10%, and even by 16% when overlapping windows are used. In addition, we do not observe any performance gain from the use of overlapping windows. We conclude that Human Activity Recognition systems should be evaluated by Subject Cross Validation, and that overlapping windows are not worth their extra computational cost.

研究の動機と目的

  • k分割交差検証が被験者固有のデータ相関のため、人体活動認識(HAR)の性能をどの程度過大評価するかを調査すること。
  • 異なる検証方式下でのスライディングウィンドウの重複あり/なしの影響が分類器性能に与える影響を評価すること。
  • HARの評価におけるk分割交差検証の代替として、より現実的で頑健な手法として「被験者交差検証」を提案すること。
  • 再現性を高め、将来的なHAR評価に関する研究を支援するため、公開可能なスクリプトを提供すること。
  • HAR分野における再現性の危機を是正し、透明性があり、方法論的に妥当な評価慣行を促進すること。

提案手法

  • 著者らは、Banosら(2014)が提供したベンチマークHARデータセット(17名の被験者、33種類の活動)を用いた。
  • センサデータを時間ウィンドウに分割するために、非重複および重複スライディングウィンドウ手法を適用した。
  • 各ウィンドウから特徴量ベクトルを抽出し、複数の分類器(例:k-NN、SVM、決定木)を訓練・評価した。
  • 性能は、標準的なk分割交差検証と被験者交差検証の2つの検証方式でF1スコアを用いて測定した。
  • 被験者交差検証では、被験者が訓練セットとテストセットの両方に含まれないよう保証し、データの独立性を維持した。
  • すべての実験は再現可能なコードで実装され、透明性と再現性を高めるためにGitHubで公開された。

実験結果

リサーチクエスチョン

  • RQ1k分割交差検証が被験者固有のデータ相関のため、HARシステムの性能をどの程度過大評価するか?
  • RQ2k分割交差検証と被験者交差検証の下で、重複スライディングウィンドウの使用が性能推定に与える影響は?
  • RQ3被騟能者交差検証で評価した場合、重複ウィンドウ処理が測定可能な性能向上をもたらすか?
  • RQ4被験者交差検証は、k分割交差検証と比較して、より信頼性があり現実的である評価フレームワークか?
  • RQ5被験者交差検証の使用により、HARにおける分類器性能の過大評価を低減できるか?

主な発見

  • k分割交差検証は、i.i.d.仮定の違反のため、HAR分類器の性能を約10%過大評価している。
  • 重複スライディングウィンドウを用いる場合、k分割交差検証下での性能過大評価は16%にまで増加する。
  • 被験者交差検証で評価した場合、重複ウィンドウ処理による顕著な性能向上は観察されなかった。
  • 被験者交差検証は、現実世界の展開状況に近いより現実的で頑健な評価フレームワークを提供する。
  • 重複ウィンドウ処理は、分類精度を向上させない一方で、学習時間をほぼ9倍に増加させる。
  • 本研究は、評価手法の選択が性能推定に顕著に影響することを確認し、k分割交差検証はHAR評価には適さないことを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。