Skip to main content
QUICK REVIEW

[論文レビュー] Confident Multiple Choice Learning

Kimin Lee, Chang Ho Hwang|arXiv (Cornell University)|Jun 12, 2017
Pharmacy and Medical Practices被引用数 18
ひとこと要約

本論文は、深層ニューラルネットワークのアンサンブル手法として、予測の過信を軽減しながら高い多様性と正確性を維持する、新しい手法Confident Multiple Choice Learning (CMCL)を提案する。自信あるオラクル損失、特徴共有、確率的ラベリングを導入することで、CIFAR-10とSVHNではそれぞれ独立アンサンブル比で14.05%および6.60%の相対的誤差低減を達成し、iCosegセグメンテーションでは最大6.77%の向上を達成した。

ABSTRACT

Ensemble methods are arguably the most trustworthy techniques for boosting the performance of machine learning models. Popular independent ensembles (IE) relying on naive averaging/voting scheme have been of typical choice for most applications involving deep neural networks, but they do not consider advanced collaboration among ensemble models. In this paper, we propose new ensemble methods specialized for deep neural networks, called confident multiple choice learning (CMCL): it is a variant of multiple choice learning (MCL) via addressing its overconfidence issue.In particular, the proposed major components of CMCL beyond the original MCL scheme are (i) new loss, i.e., confident oracle loss, (ii) new architecture, i.e., feature sharing and (iii) new training method, i.e., stochastic labeling. We demonstrate the effect of CMCL via experiments on the image classification on CIFAR and SVHN, and the foreground-background segmentation on the iCoseg. In particular, CMCL using 5 residual networks provides 14.05% and 6.60% relative reductions in the top-1 error rates from the corresponding IE scheme for the classification task on CIFAR and SVHN, respectively.

研究の動機と目的

  • 予測の過信が生じるMultiple Choice Learning (MCL)の問題を解決し、オラクル誤差は低く抑えられてもトップ-1精度が低いという事態を是正すること。
  • 多様で自信があり、高品質な予測を生成する、深層ニューラルネットワークのための新しいアンサンブル学習方式を開発すること。
  • 第2段階で単純な投票や平均化が可能なように、従来の独立アンサンブル(IE)とオリジナルMCLを上回る性能を実現すること。
  • 計算コストを低く保ちつつ、予測精度を顕著に向上させる訓練手法を設計すること。

提案手法

  • 過信を軽減するために、標準的なMCL損失と予測分布から一様分布へのKullback-Leibler発散を最小化する、自信あるオラクル損失と呼ばれる新しい損失関数を導入する。
  • 最初のプーリング層より前の非線形活性化特徴をアンサンブルモデル間で共有することで、予測の正則化と一般化性能の向上を図る。
  • 最適化中にラベルをランダムに割り当てることで、訓練中にアンサンブルメンバー間の多様性を高める確率的ラベリングを適用する。
  • 新しい損失関数の下で効率的にモデルを訓練するため、確率的交互最小化を用いる。これにより、MCLやIEと同等の訓練複雑度を維持する。
  • 個々のモデルが異なるデータサブセットに特化するようにアンサンブルアーキテクチャを設計し、明示的なゲーティング機構を用いずに「エキスパートの混合」を模倣する。
  • ResNet、VGGNet、GoogLeNet、FCNsなど、さまざまなアーキテクチャに本手法を適用し、画像分類およびセグメンテーションタスクで一貫した性能向上を達成した。

実験結果

リサーチクエスチョン

  • RQ1MCLフレームワークを変更することで、深層ニューラルネットワークアンサンブルにおける過信を軽減しつつ、高い予測多様性を維持できるか?
  • RQ2過信をペナルティとして課す自信あるオラクル損失を導入することで、アンサンブルモデルのトップ-1精度が向上するか?
  • RQ3特徴共有と確率的ラベリングは、画像分類およびセグメンテーションタスクにおけるアンサンブルモデルの性能と一般化能力にどのように影響するか?
  • RQ4CMCLは、複数のベンチマークで従来の独立アンサンブル(IE)とオリジナルMCLを上回るトップ-1誤差率を達成できるか?
  • RQ5CMCLは、実世界のビジョンタスクにおいてトップ-1誤差率を顕著に改善する一方で、オラクル誤差率を低く保てるか、その程度はどの程度か?

主な発見

  • 5つのResNet-20モデルを用いたCIFAR-10では、CMCLが独立アンサンブル比でトップ-1誤差率を14.05%相対的に低減した。
  • SVHNでは、対応する独立アンサンブルベースライン比でトップ-1誤差率が6.60%相対的に低減した。
  • iCosegにおける前景・背景セグメンテーションでは、5つのFCNモデルを用いたIE比でトップ-1誤差率が最大6.77%相対的に低減した。
  • CMCLは、オリジナルMCLと同等の低いオラクル誤差率を維持しており、過信が軽減されたにもかかわらず予測の多様性が保持されていることが示された。
  • 特徴共有はIEよりもCMCLに対してより大きな向上効果をもたらし、アンサンブルサイズが増加するほどCMCLの性能向上が顕著になるのに対し、IEではその傾向は顕著でない。
  • 可視化分析により、CMCLで訓練された個々のモデルが異なる画像タイプに特化していることが確認された(例:1つのモデルは「ロブスター」に、別のモデルは「アヒル」に特化)。一方、IEモデルではこのような特化は見られなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。