Skip to main content
QUICK REVIEW

[論文レビュー] Beyond Cats and Dogs: Semi-supervised Classification of fuzzy labels with overclustering

Lars Schmarje, Johannes Brünger|arXiv (Cornell University)|Dec 3, 2020
Machine Learning and Data Classification参考文献 46被引用数 8
ひとこと要約

本稿では、生物学的・医療画像など、現実世界のデータに一般的に見られる曖昧なラベルにおける部分構造を、新しい逆交差エントロピー損失を用いた過クラスタリングを活用することで特定する、Fuzzy Overclustering (FOC) と呼ばれる新規な半教師あり枠組みを提案する。本手法は、最大9倍の高速化を達成し、予測の一貫性が5–10%向上し、曇ったラベルを有するSTL-10および現実世界のプランクトンデータセットにおいて、最先端の性能を達成する。

ABSTRACT

A long-standing issue with deep learning is the need for large and consistently labeled datasets. Although the current research in semi-supervised learning can decrease the required amount of annotated data by a factor of 10 or even more, this line of research still uses distinct classes like cats and dogs. However, in the real-world we often encounter problems where different experts have different opinions, thus producing fuzzy labels. We propose a novel framework for handling semi-supervised classifications of such fuzzy labels. Our framework is based on the idea of overclustering to detect substructures in these fuzzy labels. We propose a novel loss to improve the overclustering capability of our framework and show on the common image classification dataset STL-10 that it is faster and has better overclustering performance than previous work. On a real-world plankton dataset, we illustrate the benefit of overclustering for fuzzy labels and show that we beat previous state-of-the-art semisupervised methods. Moreover, we acquire 5 to 10% more consistent predictions of substructures.

研究の動機と目的

  • 専門家が合意しない、明確に分離できないクラスに分けられない現実世界のデータの分類課題に対処すること。
  • ラベルを硬直的なカテゴリに押し込めるのではなく、曇ったデータ内の意味のある部分構造を検出することで、半教師あり学習を改善すること。
  • 曇ったラベルと不均衡なクラス分布を有するデータセットにおいて、既存の半教師あり手法を上回るフレームワークを開発すること。
  • ラベルなしデータにおける過クラスタリング性能を維持または向上させながら、学習時間を短縮すること。

提案手法

  • 本フレームワークは、信頼性の高いラベルが付与された画像の少量と、曇ったラベルが付与された(ラベルなしとして扱う)画像の大量を用いて半教師あり学習を実施する。
  • 曇ったラベル付きデータ内に細分化された部分構造を検出するために、過クラスタリングを採用し、より一貫性のある専門家の分析を可能にする。
  • クラスタ割り当てを明確にするために、異なるクラスタ割り当てを促進する新しい損失関数、逆交差エントロピーを導入する。
  • 通常の分類ヘッドと過クラスタリングヘッドを備えたマルチヘッドアーキテクチャを採用し、事前学習タスク、相互情報量損失、および新規のCE-1損失を組み合わせて訓練する。
  • 重み初期化の影響を慎重に評価した結果、CIFAR-20の重みがImageNetの重みよりもSTL-10で優れていることが判明し、データセット固有の最適化が極めて重要であることが示された。
  • 本フレームワークは、エポックごとのデータ制限を柔軟に設定でき、従来手法と比較して最大9倍の学習時間短縮が可能である。

実験結果

リサーチクエスチョン

  • RQ1専門家間の合意が低い曇ったラベルが付与された現実世界のデータにおいて、過クラスタリングは部分構造を効果的に検出できるか?
  • RQ2提案された逆交差エントロピー損失は、半教師あり学習における標準的な損失関数と比較して、過クラスタリング性能をどのように向上させるか?
  • RQ3FOCは、曇ったデータにおける分類およびクラスタリングの正確性を維持または向上させながら、どの程度学習時間を短縮できるか?
  • RQ4FOCは、曇ったラベルと不均衡なクラス分布を有するデータセットにおいて、FixMatchなどの最先端の半教師あり手法を上回る性能を示すか?
  • RQ5FOCを用いることで、曇ったデータにおける部分構造の予測の一貫性は、従来手法と比較してどの程度向上するか?

主な発見

  • FOCは、エポックごとのデータ使用制限により、STL-10における学習時間を数日から数時間に短縮し、最大9倍の高速化を達成した。
  • STL-10データセットでは、全損失設定下で過クラスタリングF1スコア70.57%を達成し、IICを11%以上上回る過クラスタリング性能を示した。
  • 現実世界のプランクトンデータセットでは、過クラスタリングF1スコア77.60%を達成し、FixMatchや他の最先端手法を著しく上回った。
  • FOCは曇ったラベルにおいて予測の一貫性を5–10%向上させ、より信頼性の高い下流の専門家分析を可能にした。
  • 逆交差エントロピー損失(CE-1)は、STL-10では過クラスタリング性能を10%向上させ、プランクトンデータセットでは最大7%向上させ、重み初期化の影響に関わらず有効であった。
  • CIFAR-20の重み(弱い初期化)を用いても、FOCはImageNetで事前学習されたモデルを上回った。これは、損失関数が不適切な初期化を補う能力を有することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。