[論文レビュー] Instance-Dependent Noisy Label Learning via Graphical Modelling
本稿では、画像再構成に連続ベルヌーイ分布を用いた変分オートエンコーダと、継承ラベルとノイズラベルの両方を活用する DivideMix を組み合わせた、インスタンス依存ノイズラベル学習のためのグラフィカルモデリング手法である InstanceGM を提案する。この手法は、CIFAR10 において 50% のノイズ率でも 95.90% の精度を達成し、訓練の安定性と全データの活用性の向上により、先行手法を著しく上回る結果を示した。
Noisy labels are unavoidable yet troublesome in the ecosystem of deep learning because models can easily overfit them. There are many types of label noise, such as symmetric, asymmetric and instance-dependent noise (IDN), with IDN being the only type that depends on image information. Such dependence on image information makes IDN a critical type of label noise to study, given that labelling mistakes are caused in large part by insufficient or ambiguous information about the visual classes present in images. Aiming to provide an effective technique to address IDN, we present a new graphical modelling approach called InstanceGM, that combines discriminative and generative models. The main contributions of InstanceGM are: i) the use of the continuous Bernoulli distribution to train the generative model, offering significant training advantages, and ii) the exploration of a state-of-the-art noisy-label discriminative classifier to generate clean labels from instance-dependent noisy-label samples. InstanceGM is competitive with current noisy-label learning approaches, particularly in IDN benchmarks using synthetic and real-world datasets, where our method shows better accuracy than the competitors in most experiments.
研究の動機と目的
- 画像の内容に依存する誤分類(インスタンス依存ノイズ)の課題に取り組むこと。これは現実のデータセットで一般的であるが、先行研究では十分に検討されていない。
- 訓練にクリーンなサンプルのみを用いるなど、インスタンス非依存のノイズ仮定に依存する既存手法の限界を克服すること。
- 真のラベルと画像特徴を潜在変数として扱い、画像とノイズラベルの生成を同時にモデリングする統合的グラフィカルモデルフレームワークを構築すること。
- 画像再構成に平均二乗誤差(MSE)の代わりに連続ベルヌーイ分布を用いることで、訓練の安定性と精度を向上させること。
- co-teaching を DivideMix に置き換えることで、半教師あり学習においてクリーンかつノイズラベルの両方を活用し、訓練データをフルに活用すること。
提案手法
- InstanceGM は真のラベル $Y$ と画像特徴 $Z$ を潜在変数とし、観測データとして画像 $X$ とそのノイズラベル $\hat{Y}$ を用いるグラフィカルモデルを採用する。
- 生成モデルでは、標準的な MSE 損失に代わり、連続ベルヌーイ分布を用いた変分オートエンコーダ(VAE)を用い、再構成画像の尤度をモデル化することで、訓練の安定性を向上させるとともに、ハイパーパramータのチューニングを不要にする。
- 連続ベルヌーイ分布は画素レベルの再構成をモデル化し、最適化中の勾配の流れと安定性を向上させる。
- 判別的部は、疑似ラベル付けと一貫性正則化を活用して、クリーンラベルとノイズラベルの両方を用いて学習する半教師あり学習手法である DivideMix を採用する。
- このフレームワークは、生成的および判別的部をエンドツーエンドの訓練手続きで同時に最適化することで、高比率のインスタンス依存ノイズ下でも頑健な学習を可能にする。
- 本手法は、合成および実世界の IDN ベンチマーク(CIFAR10、CIFAR100、Red Mini-ImageNet、ANIMAL-10N、CLOTHING-1M)で評価され、一貫した性能向上が確認された。

実験結果
リサーチクエスチョン
- RQ1画像とノイズラベルの生成を同時にモデリングするグラフィカルモデルは、従来の手法と比較してインスタンス依存ノイズラベル学習の性能を向上させることができるか?
- RQ2標準的な MSE 再構成損失に代えて連続ベルヌーイ分布を用いることで、ノイズラベル学習に適した VAE ベースの生成モデルにおける訓練の安定性と精度が向上するか?
- RQ3クリーンとノイズラベルの両方を活用する DivideMix を判別的分類器として用いることで、クリーンサンプルのみを用いる co-teaching ベースの手法を上回る性能が得られるか?
- RQ4InstanceGM は、高ノイズの合成データセットや CLOTHING-1M や ANIMAL-10N のような実世界のノイズラベルデータセットを含む多様な IDN ベンチマークでどのように性能を発揮するか?
- RQ5連続ベルヌーイ再構成と DivideMix の各コンポーネントが、CausalNL などのベースライン手法に対する全体の性能向上にどの程度寄与しているか?
主な発見
- CIFAR10 において 50% のインスタンス依存ノイズ下で InstanceGM は 95.90% のテスト精度を達成し、CausalNL(78.63%)および CausalNL に DivideMix を適用したバージョン(88.62%)を著しく上回った。
- ANIMAL-10N では VGG バックボーンを用いて 84.6% の精度を達成し、ResNet(82.2%)および ConvNeXt(84.7%)を用いることでさらなる向上が得られ、アーキテクチャにわたる強力な一般化性能を示した。
- Red Mini-ImageNet では、自己教師あり事前学習を施した場合・しない場合の両方で最先端の性能を達成し、PropMix や他の最近の手法を上回った。
- アブレーションスタディでは、co-teaching を DivideMix に置き換えることで精度が約 10% 向上し、MSE から連続ベルヌーイ再構成に切り替えることでさらに約 7% の性能向上が得られた。
- CLOTHING-1M では 74.40% の精度を達成し、DivideMix(74.76%)や Nested-CoTeaching(74.90%)と同等の競争力を持つ結果を示し、大規模な実世界のノイズラベルデータセットでも頑健であることを示した。
- アブレーションスタディの結果、連続ベルヌーイ再構成損失と DivideMix を用いた判別的分類器の両方が、InstanceGM の成功に不可欠であり、それぞれが最終的な性能向上に顕著な寄与をしていることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。