Skip to main content
QUICK REVIEW

[論文レビュー] ConvNets and ImageNet Beyond Accuracy: Understanding Mistakes and Uncovering Biases

Pierre Stock, Moustapha Cissé|arXiv (Cornell University)|Nov 30, 2017
Adversarial Robustness in Machine Learning参考文献 36被引用数 16
ひとこと要約

この論文は、ImageNetにおける最先端のConvNetが従来の測定値よりも著しく正確かつ頑丈であることを示している。人的評価によりトップ1誤差が22.69%から9.47%に低下した。敵対的例を用いたモデル批評により、隠れた人種的および意味的バイアスを特定し、説明が誤分類を緩和し、エンドユーザー視点からモデルの欠陥を明らかにした。

ABSTRACT

ConvNets and Imagenet have driven the recent success of deep learning for image classification. However, the marked slowdown in performance improvement combined with the lack of robustness of neural networks to adversarial examples and their tendency to exhibit undesirable biases question the reliability of these methods. This work investigates these questions from the perspective of the end-user by using human subject studies and explanations. The contribution of this study is threefold. We first experimentally demonstrate that the accuracy and robustness of ConvNets measured on Imagenet are vastly underestimated. Next, we show that explanations can mitigate the impact of misclassified adversarial examples from the perspective of the end-user. We finally introduce a novel tool for uncovering the undesirable biases learned by a model. These contributions also show that explanations are a valuable tool both for improving our understanding of ConvNets' predictions and for designing more reliable models.

研究の動機と目的

  • 標準的な精度指標を超えて、ImageNetにおけるSOTA ConvNetの真の性能を再評価すること。
  • 人的判断が、従来想定されてきたよりも深刻でないモデルの誤りを明らかにできるかを調査すること。
  • 説明がエンドユーザーの信頼と敵対的例に対する頑丈さを向上させる役割を評価すること。
  • モデルがImageNetで学習した望ましくないバイアス(特に人種的および意味的バイアス)を検出・特定すること。
  • 敵対的例を用いた新しいモデル批評フレームワークを開発・検証すること。

提案手法

  • 5名のアノテーターが、誤分類されたImageNet画像がモデルによって正しく分類されているかどうかを判断する人間被験を実施し、4名以上が合意した場合を基準としたコンセンサス閾値を設定した。
  • サリエンシーマップによる特徴ベースの説明と、プロトタイプおよび批判(モデル批評)を用いた例ベースの説明を用いて予測を解釈した。
  • 敵対的例を用いて、モデルの直感的でない、あるいはバイアスのある意思決定パターンを強調する批判を生成した。
  • 複数の説明ベースラインを用いた:敵対的選択、MMDクリティック、確率ベース選択を用いたモデル批評。
  • 肌の色を除き同一のコンテンツを持つ画像ペアをインターネットから収集し、人種的バイアスの有無をテストした。
  • ResNet-101をImageNetで訓練し、内部表現を用いてプロトタイプおよび批判を抽出し、バイアス分析に用いた。

実験結果

リサーチクエスチョン

  • RQ1人的コンセンサスによる評価では、SOTA ConvNetのImageNetにおける真の精度がどの程度低估されているか?
  • RQ2説明は、特に敵対的例に対してエンドユーザーの認識と信頼にどのように影響を与えるか?
  • RQ3敵対的例を用いて、隠れたバイアスを明らかにするモデル批評を効果的に生成できるか?
  • RQ4モデルがImageNetで学習するバイアス(特に人種的または意味的バイアス)の種類は何か、そしてどのように検出できるか?
  • RQ5モデル批評は、他の説明手法と比較して、モデルの欠陥やバイアスをどの程度効果的に明らかにできるか?

主な発見

  • 人的コンセンサスにより、ResNet-101のImageNetにおけるトップ1誤差が22.69%から9.47%に低下した。これは、モデルの誤りが著しく低估されていることを示している。
  • トップ5誤差も人的評価下で6.44%から1.94%に低下し、人的コンセンサスによる測定ではImageNetがほぼ解けたと見なせることを示唆している。
  • 説明を提供することで、敵対的例がエンドユーザーの認識に与える影響が顕著に軽減され、誤分類の信頼度が低下した。
  • 敵対的例を用いたモデル批評により人種的バイアスが効果的に特定された:「バスケットボール」クラスのプロトタイプの78%が少なくとも1名の黒人を含んでいたが、白人の場合は44%にとどまった。
  • 批判では白人の含み率が90%であったのに対し、黒人は20%にとどまり、モデルが黒人プレーヤーをクラスの典型的な例と見なしている強いバイアスが示された。
  • 肌の色のみが異なる画像ペアでは、黒人プレーヤーがいる画像が100%「バスケットボール」と分類された一方、肌の色が明るいプレーヤーがいる類似画像は他のクラスに誤分類された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。