Skip to main content
QUICK REVIEW

[論文レビュー] A Unified Plug-and-Play Framework for Effective Data Denoising and Robust Abstention

Krishanu Sarker, Xiulong Yang|arXiv (Cornell University)|Sep 25, 2020
Image and Signal Denoising Methods参考文献 26被引用数 5
ひとこと要約

この論文は、DNNアーキテクチャや損失関数を変更せずに、特徴空間における学習済みのデータ密度を活用して訓練データのノイズ除去と予測の不確実性が高いテストサンプルの予測を控える統合的で即挿し可能なフレームワークを提案する。クラス固有のデータ分布から離れたサンプルを特定することで、CIFAR-10 や ImageNet における複数のCNNとデータセットで、DAC や SelectiveNet といった最先端手法を上回るノイズ除去とロバストな予測控除性能を達成する。

ABSTRACT

The success of Deep Neural Networks (DNNs) highly depends on data quality. Moreover, predictive uncertainty makes high performing DNNs risky for real-world deployment. In this paper, we aim to address these two issues by proposing a unified filtering framework leveraging underlying data density, that can effectively denoise training data as well as avoid predicting uncertain test data points. Our proposed framework leverages underlying data distribution to differentiate between noise and clean data samples without requiring any modification to existing DNN architectures or loss functions. Extensive experiments on multiple image classification datasets and multiple CNN architectures demonstrate that our simple yet effective framework can outperform the state-of-the-art techniques in denoising training data and abstaining uncertain test data.

研究の動機と目的

  • 実世界のDNNデプロイメントにおけるノイズのある訓練データと予測不確実性の二重の課題に対処すること。
  • 既存のモデルや損失関数を変更せずに、モデルの信頼性を向上させる統合的でエンドツーエンドのフレームワークを開発すること。
  • 内在的なデータ密度を用いて、ノイズのある訓練サンプルと不確実なテスト予測を効果的にフィルタリングできること。
  • DAC や SelectiveNet といった最先端手法を上回る性能を、ノイズ除去と控除の両タスクで示すこと。

提案手法

  • 事前学習済みDNNを用いて特徴を抽出し、特徴空間におけるクラス固有のデータ密度をモデル化する。
  • サンプルが任意のクラス分布からも離れている、または複数の分布と等距離にある場合、ノイズありまたは不確実と分類する。
  • モダリティ解析と適応的しきい値戦略を用いて、データクラスタへの距離に基づき、クリーンとノイズのあるサンプルを区別する。
  • 再トレーニングやアーキテクチャ変更なしに、既存の最先端モデルに即挿し可能なモジュールとして動作する。
  • DNNは訓練の初期段階で頑健な特徴を学習するため、ノイズのあるデータでも信頼性の高い密度推定が可能であるという観察を活用する。
  • 同じ密度基準を用いて、訓練時(データノイズ除去)と推論時(不確実性控除)の両方でフレームワークを適用する。

実験結果

リサーチクエスチョン

  • RQ1DNNアーキテクチャを変更せずに、統合的フレームワークが訓練データのノイズ除去と不確実なテスト予測の控除を効果的に行えるか?
  • RQ2特徴空間におけるデータ密度は、ラベルノイズと予測不確実性とどのように相関するか?
  • RQ3DAC や SelectiveNet といった特化型最先端モデルを上回るシンプルで即挿し可能な手法が、ノイズ除去と控除の両方で優れた性能を発揮できるか?
  • RQ4事前学習済み特徴表現は、フィルタリングのための信頼性の高いデータ分布モデリングをどのように可能にするか?

主な発見

  • 提案フレームワークは、人工的なラベルノイズを含むCIFAR-10 および ImageNet で、DAC よりも高い精度を達成し、訓練データのノイズ除去性能を上回る。
  • テストデータの控除において、すべてのカバレッジレベルで、SelectiveNet を上回り、優れたキャリブレーションと性能を示す。
  • t-SNEを用いた可視化により、訓練およびテストセットの両方で、ノイズのあるおよび曖昧なサンプルを効果的に同定・フィルタリングしていることが確認された。
  • ノイズ除去済みデータで学習することで収束が早まり、特に重度のラベルノイズ(アンバレーションスタディで60%)下でも最終テスト精度が向上する。
  • フィルタリングに1回のモデルフォワードパスのみを要するため、計算オーバーヘッドが最小限で、競争力のある性能を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。