Skip to main content
QUICK REVIEW

[論文レビュー] On the Nature and Types of Anomalies: A Review.

Ralph Foorthuis|arXiv (Cornell University)|Jul 30, 2020
Anomaly Detection Techniques and Applications参考文献 245被引用数 8
ひとこと要約

本稿では、データ型、関係の基数、データ構造、データ分布の4つのデータ中心的次元を用いて、理論的根拠に基づきドメインに依存しないデータ異常の分類体系を提案する。これにより、3つの広範なグループ、9つの基本的タイプ、61のサブタイプが得られる。このフレームワークは、異常検出アルゴリズムの体系的評価を可能にするとともに、局所的異常とグローバル異常という概念の明確化により、説明可能なデータ科学を前進させる。

ABSTRACT

Anomalies are occurrences in a dataset that are in some way unusual and do not fit the general patterns. The concept of the anomaly is generally ill-defined and perceived as vague and domain-dependent. Moreover, no comprehensive and concrete overviews of the different types of anomalies have hitherto been published. By means of an extensive literature review this study therefore offers the first theoretically principled and domain-independent typology of data anomalies, and presents a full overview of anomaly types and subtypes. To concretely define the concept of the anomaly and its different manifestations the typology employs four dimensions: data type, cardinality of relationship, data structure and data distribution. These fundamental and data-centric dimensions naturally yield 3 broad groups, 9 basic types and 61 subtypes of anomalies. The typology facilitates the evaluation of the functional capabilities of anomaly detection algorithms, contributes to explainable data science, and provides insights into relevant topics such as local versus global anomalies.

研究の動機と目的

  • 長年のデータ異常の包括的で理論的根拠に基づく分類体系の欠如に応えること。
  • 現在の異常理解に内在する曖昧さとドメイン依存性を解消すること。
  • 根本的なデータ特性に基づいて異常を分類する、原則的でデータ中心のフレームワークを確立すること。
  • 構造的な分類体系を提供することにより、異常検出アルゴリズムの評価を支援すること。
  • 局所的異常とグローバル異常といった区別の明確化により、説明可能なデータ科学を強化すること。

提案手法

  • 広範な文献レビューを実施し、多様な分野にわたる異常タイプを同定・分類する。
  • データ型、関係の基数、データ構造、データ分布の4次元フレームワークを定義する。
  • これらの次元を用いて、3つの広範な異常グループ、9つの基本的タイプ、61のサブタイプを体系的に導出する。
  • 応用分野に依存しないように設計され、データ中心の特性に基づく。
  • 異常はその構造的・統計的特性に基づいて分類可能である。
  • 異常検出アルゴリズムの機能的特性を特定の異常サブタイプにマッピングすることにより、分析を支援する。

実験結果

リサーチクエスチョン

  • RQ1どのような基本的次元が、原則的かつドメインに依存しない方法でデータ異常を体系的に分類可能か?
  • RQ2データ中心の特性に基づいて、異常を明確なタイプとサブタイプに分類できるか?
  • RQ3提案された分類体系内において、局所的異常とグローバル異常との関係は何か?
  • RQ4提案されたフレームワークは、異常検出アルゴリズムの評価と説明可能性をどのように向上させるか?
  • RQ5この分類体系は、複雑なデータ構造や分布における異常理解にどのような意味を持つのか?

主な発見

  • 本研究では、4つのコアデータ次元に基づき、3つの広範なグループ、9つの基本的タイプ、61のサブタイプを含む包括的な分類体系を確立した。
  • フレームワークは、データ型、構造的関係、分布パターンに基づく異常の明確な区別を可能にする。
  • 分類体系は、特定の文脈における逸脱(局所的異常)と、全データセット全体で稀な現象(グローバル異常)の識別と分類を支援する。
  • アプローチは、異常検出アルゴリズムの機能的範囲を、さまざまな異常サブタイプに対して標準化された基盤で評価可能にする。
  • フレームワークは、曖昧または曖昧な異常定義を明確にする原則的分類体系を提供するため、説明可能なデータ科学を強化する。
  • 本研究では、異常は一様なものではなく、構造的・統計的側面において多様な顕現を示し、これらを体系的に分類可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。