Skip to main content
QUICK REVIEW

[論文レビュー] An Adaptive Oversampling Learning Method for Class-Imbalanced Fault Diagnostics and Prognostics

Wenfang Lin, Zhenyu Wu|arXiv (Cornell University)|Nov 19, 2018
Imbalanced Data Classification Techniques参考文献 4被引用数 4
ひとこと要約

本稿では、EMに基づく補完と重み付けされた少数クラスサンプリングを組み合わせることで、クラス不均衡な産業システムにおける故障診断および予知に優れた性能を発揮する、適応的合成オーバーサンプリング手法EWMOTEを提案する。本手法は、さまざまな不均衡比において、バイナリおよびマルチクラスの故障分類タスクにおいてベースライン手法を上回る優れた性能を達成する。

ABSTRACT

Data-driven fault diagnostics and prognostics suffers from class-imbalance problem in industrial systems and it raises challenges to common machine learning algorithms as it becomes difficult to learn the features of the minority class samples. Synthetic oversampling methods are commonly used to tackle these problems by generating the minority class samples to balance the distributions between majority and minority classes. However, many of oversampling methods are inappropriate that they cannot generate effective and useful minority class samples according to different distributions of data, which further complicate the process of learning samples. Thus, this paper proposes a novel adaptive oversampling technique: EM-based Weighted Minority Oversampling TEchnique (EWMOTE) for industrial fault diagnostics and prognostics. The methods comprises a weighted minority sampling strategy to identify hard-to-learn informative minority fault samples and Expectation Maximization (EM) based imputation algorithm to generate fault samples. To validate the performance of the proposed methods, experiments are conducted in two real datasets. The results show that the method could achieve better performance on not only binary class, but multi-class imbalance learning task in different imbalance ratios than other oversampling-based baseline models.

研究の動機と目的

  • 産業システムにおけるデータ駆動型故障診断および予知において、少数クラスの故障サンプルが乏しく、学習が困難であるというクラス不均衡の課題に対処すること。
  • データ分布に適応し、学習が難しい情報量の多い少数クラスサンプルを特定することで、合成少数クラスサンプルの品質を向上させること。
  • アルゴリズムレベルの変更に依存せずに、分類器の性能を向上させるデータレベルのオーバーサンプリング技術を開発すること。
  • 変動する不均衡比を有する実世界の産業データセットにおいて、提案手法の有効性を検証すること。

提案手法

  • EWMOTEは、合成生成の対象とする少数クラス故障サンプルのうち、学習が難しいものを優先する重み付けされた少数クラスサンプリング戦略を採用する。
  • 期待値最大化(EM)アルゴリズムを用いて欠損値を補完し、既存の少数クラスサンプルの潜在的分布に基づいて新たな少数クラスサンプルを生成する。
  • MWMOTEの改良として、EM補完を統合することで、データ分布を保持し、生成されたサンプルのノイズを低減する。
  • 次元削減を伴わない特徴抽出を組み合わせることで診断情報の損失を最小限に抑え、分類の前段階でデータレベルのオーバーサンプリングを実施する。
  • 少数クラスの統計的構造に適応して合成サンプルを生成することで、多数クラスの境界を歪めることを最小限に抑える。
  • パイプラインとして特徴抽出、EWMOTEによるデータレベルのオーバーサンプリング、分類の順に処理を実施し、複数の不均衡比において性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1高不均衡データを有する産業システムにおいて、適応的オーバーサンプリング手法は故障検出性能を向上させ得るか?
  • RQ2さまざまな不均衡比において、EWMOTEはSMOTE、MWMOTE、EMICILと比較して、精度、再現率、F-measureの観点で優れた性能を示すか?
  • RQ3EMに基づく補完と重み付けされた少数クラスサンプリングの統合は、標準的なオーバーサンプリング手法と比較して、より効果的な合成サンプルを生成するか?
  • RQ4多クラス故障分類において、さまざまな程度のクラス不均衡を扱う際、EWMOTEはどれほど頑健か?
  • RQ5ベースライン手法と比較して、EWMOTEはノイズが多いまたは誤解を招く少数クラスサンプルの生成をどれほど低減できるか?

主な発見

  • 風力タービンの凍結故障データセットでは、EWMOTEは再現率0.8302、精度0.8573、FAM 0.8326を達成し、SMOTE、MWMOTE、EMICILを上回った。
  • マルチフォールトプラントデータセットでは、EWMOTEは故障クラスF3において最高のF-measure(0.8793)を記録し、全故障タイプにおいても強力な性能を維持した。
  • F5のような高不均衡クラスにおいて、EWMOTEはMWMOTEと比較してより高い真正陽性率を示し、EMICILと比較してより低い偽陽性率を示した。これは、より高い頑健性を示している。
  • 風力タービンデータセットにおいて、EWMOTEはSMOTE比でF-measureを1.8%、MWMOTE比で0.7%向上させ、バランスの取れた性能指標において一貫した向上を示した。
  • 混同行列の分析から、EWMOTEは特に高不均衡状況において、より正確でノイズの少ないサンプルを生成していることが確認され、少数クラスの誤分類が低減された。
  • 正常サンプルに関しては、EWMOTEは精度0.9536、再現率0.9614を維持しており、多数クラスの分布に対する干渉が最小限に抑えられていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。