Skip to main content
QUICK REVIEW

[論文レビュー] Exploiting Context for Robustness to Label Noise in Active Learning

Sudipta Paul, Shivkumar Chandrasekaran|arXiv (Cornell University)|Oct 18, 2020
Machine Learning and Algorithms参考文献 54被引用数 4
ひとこと要約

本稿では、ラベルノイズ下におけるロバストなマルチクラスアクティブラーニングを実現するため、文脈に配慮したノイジーサンプル検出(CNLD)手法を提案する。データポイント間の相互関係をグラフィカル表現でモデル化し、新しいラベルが誘発する関係と事前知識に基づく関係を比較することで、不一致スコアを用いて誤ったラベルを検出する。この手法により、シーン分類、アクティビティ分類、ドキュメント分類の各タスクにおいて、ラベルノイズが存在する状況でも顕著な認識精度の向上が達成される。

ABSTRACT

Several works in computer vision have demonstrated the effectiveness of active learning for adapting the recognition model when new unlabeled data becomes available. Most of these works consider that labels obtained from the annotator are correct. However, in a practical scenario, as the quality of the labels depends on the annotator, some of the labels might be wrong, which results in degraded recognition performance. In this paper, we address the problems of i) how a system can identify which of the queried labels are wrong and ii) how a multi-class active learning system can be adapted to minimize the negative impact of label noise. Towards solving the problems, we propose a noisy label filtering based learning approach where the inter-relationship (context) that is quite common in natural data is utilized to detect the wrong labels. We construct a graphical representation of the unlabeled data to encode these relationships and obtain new beliefs on the graph when noisy labels are available. Comparing the new beliefs with the prior relational information, we generate a dissimilarity score to detect the incorrect labels and update the recognition model with correct labels which result in better recognition performance. This is demonstrated in three different applications: scene classification, activity classification, and document classification.

研究の動機と目的

  • アノテーターのばらつきにより人為的ラベルがしばしば誤りとなるアクティブラーニングにおけるラベルノイズという重要な課題に対処すること。
  • 特に、先行研究が主に二値分類に焦点を当てている中で、マルチクラス設定において、どのクエリラベルが誤りである可能性が高いかを特定する手法を開発すること。
  • 不確実なラベルにかかわらずモデルのロバスト性とパフォーマンスを向上させるために、ノイジーラベル検出を統合したアクティブラーニングフレームワークを形式化すること。
  • 複数のアノテーターが利用できない低リソースおよび大規模なシナリオにおいて、効果的な学習を可能にすること。

提案手法

  • オブジェクト・シーンやアクティビティ・アクティビティの共起関係といった、データポイント間の文脈的関係を符号化するため、未ラベルデータのグラフィカル表現を構築する。
  • 初期スティークモデルから得られる事前の関係的情報を用いて、クラス間の期待される関係を定義し、一貫性チェックの基準とする。
  • ノイジーラベルが導入された際に、グラフ上で条件付き推論を実行し、新たなエッジ信念を計算することで、更新された関係構造を捉える。
  • 事前の関係的信念と更新後の信念との間の不一致スコアを計算し、期待される文脈から著しく逸脱するラベルを特定する。
  • 不一致スコアが大きい(おそらく誤りな)ラベルをフィルタリングし、高信頼性で文脈的一致性を持つラベルのみを用いて分類モデルを更新する。
  • 人為的ラベルと疑似ラベルを統合したアクティブラーニングパイプラインにCNLDを統合し、誤った疑似ラベルを除去することでパフォーマンスを向上させる。

実験結果

リサーチクエスチョン

  • RQ1ラベルノイズが広く存在するマルチクラスアクティブラーニング環境において、どのように誤ったラベルを検出できるか?
  • RQ2データポイント間の文脈的関係をどの程度活用することで、一貫性のないもしくはノイジーラベルを特定できるか?
  • RQ3文脈に配慮したラベルフィルタリング機構は、多様な視覚的およびテキスト分類タスクにおいて、ラベルノイズが存在する状況でも認識性能を向上させることができるか?
  • RQ4ノイズラベルが存在する状況において、提案されたフレームワークのパフォーマンスは、標準的なアクティブラーニングおよび疑似ラベル化アプローチと比べてどの程度優れているか?

主な発見

  • 提案手法CNLDは、ラベルノイズ率が高くなる状況(Ω = 0.50)において、ベースラインのアクティブラーニングに比べ、シーン分類で1.0%〜3.81%、ドキュメント分類で最大6.51%の絶対的精度向上を達成した。
  • アクティビティ分類においても、高ノイズ率下で1.21%〜4.25%の絶対的精度向上を達成し、異なるデータモダリティにおいても高いロバスト性を示した。
  • CNLDを用いた疑似ラベルのフィルタリングは、直接的な疑似ラベル化よりも顕著なパフォーマンス向上をもたらし、特にドキュメント分類およびシーン分類タスクで最良の結果が得られた。
  • 本フレームワークは、シーン分類、アクティビティ分類、ドキュメント分類という多様な応用分野においても高いパフォーマンスを維持しており、特定の特徴量や分類器に依存しない汎用性と一般化能力を示した。
  • ラベル検出における精度-再現度トレードオフを制御するβパラメータは、高ノイズ条件下でβ ∈ {0.80, 0.85, 0.90} の広い範囲において一貫した性能向上を示した。
  • 定性的な結果から、低不一致スコアは正しくラベル付けされたデータと強く相関しており、本手法が文脈的に一貫性のないラベルを正しく検出できることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。