Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating Multi-label Classifiers with Noisy Labels

Wenting Zhao, Carla P. Gomes|arXiv (Cornell University)|Feb 16, 2021
Text and Document Classification Technologies参考文献 60被引用数 11
ひとこと要約

本論文では、事前学習された単語埋め込みを用いた文脈に配慮した正則化と非対称損失関数を活用することで、ノイズのあるラベルへの過学習を軽減する文脈ベースのマルチラベル分類器CbMLCを提案する。清浄ラベルや追加の監視情報が不要な状況でも、ラベル依存関係を効果的に学習でき、ノイズのあるマルチラベルデータセットにおいて最先端の手法を上回る性能を発揮する。

ABSTRACT

Multi-label classification (MLC) is a generalization of standard classification where multiple labels may be assigned to a given sample. In the real world, it is more common to deal with noisy datasets than clean datasets, given how modern datasets are labeled by a large group of annotators on crowdsourcing platforms, but little attention has been given to evaluating multi-label classifiers with noisy labels. Exploiting label correlations now becomes a standard component of a multi-label classifier to achieve competitive performance. However, this component makes the classifier more prone to poor generalization - it overfits labels as well as label dependencies. We identify three common real-world label noise scenarios and show how previous approaches per-form poorly with noisy labels. To address this issue, we present a Context-Based Multi-LabelClassifier (CbMLC) that effectively handles noisy labels when learning label dependencies, without requiring additional supervision. We compare CbMLC against other domain-specific state-of-the-art models on a variety of datasets, under both the clean and the noisy settings. We show CbMLC yields substantial improvements over the previous methods in most cases.

研究の動機と目的

  • 現実世界のノイズのあるラベル設定下におけるマルチラベル分類(MLC)の評価不足とロバスト性の欠如に取り組む。
  • 既存の手法が失敗する、特に非対称的および複合的なノイズタイプを含む、3つの一般的な現実世界のラベルノイズ状況を特定・モデル化する。
  • 清浄ラベルや追加の監視情報が不要な状況でも、ノイズのあるラベルにかかわらずラベル相関関係をロバストに学習する手法を開発する。
  • 事前学習された単語埋め込みを用いた文脈ベースの正則化を組み込むことで、MLCにおける一般化性能を向上させる。

提案手法

  • CbMLCは、ドメイン固有のエンコーダーを備えたエンコーダ-デコーダー構造を採用し、入力特徴を潜在表現にマッピングする。
  • ラベルグラフ上でメッセージパッシングデコーダーを用い、グラフニューラルネットワーク(GNN)を介してラベル依存関係をモデル化する。
  • 正例と負例のラベル予測に対して異なる重みを付与する非対称損失関数を適用し、ラベルノイズに対して高いロバスト性を実現する。
  • 入力特徴とラベルの単語埋め込みを比較することで文脈ベースの正則化を実装し、埋め込み空間全体にわたる距離を正規化することで、過剰に滑らかになるのを防ぐ。
  • ラベル表現は事前学習された単語埋め込みで初期化されるが、学習中にデータセット固有の意味論に適応するために微調整される。
  • ラベル埋め込みを入力コンテキストとの意味的類似度に基づいて正則化することで、ノイズの多い共起統計に依存するのを回避し、過学習を防ぐ。

実験結果

リサーチクエスチョン

  • RQ1既存の最先端のMLCモデルは、現実的で非対称的および複合的なラベルノイズ状況下でどのように性能を発揮するか?
  • RQ2ノイズのあるマルチラベルデータセット上で学習された際、ラベル相関学習手法はどの程度過学習を示すか?
  • RQ3事前学習された単語埋め込みを用いた文脈ベースの正則化は、ノイズのあるラベル下でのマルチラベル分類における一般化性能を向上させるか?
  • RQ4非対称損失関数と文脈に配慮した正則化を組み合わせた場合、対称的または標準的なBCE損失関数よりもノイズのあるMLC設定で優れた性能を発揮するか?

主な発見

  • CbMLCは、Pascal VOCを含むベンチマークデータセットのノイズありバージョンにおいて、さまざまな非対称的および複合的なノイズ設定下で最先端のモデルを顕著に上回る。
  • Pascal VOCデータセットに非対称ノイズを注入した状況において、CbMLCはmAP性能を高い水準で維持する一方で、ML-GCNは急速に過学習を示し、顕著に小さい一般化ギャップを示す。
  • 清浄データセットにおいても、CbMLCは最先端の性能を達成または上回る。これは、文脈ベースの正則化が清浄データでも性能を損なわないことを示している。
  • アブレーションスタディの結果、文脈ベースの正則化と非対称損失関数が重要な構成要素であることが確認され、いずれかを削除すると性能が著しく低下する。
  • 単語埋め込みによるラベル類似度学習は、5つのデータセットのうち4つで精度を向上させ、効果的な意味的ラベル関係の捉え込みを示している。
  • 本手法はドメインを越えて一般化が良く、コンピュータビジョンおよび自然言語処理の両方のベンチマークで、ノイズのある条件下でも一貫した性能向上を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。