Skip to main content
QUICK REVIEW

[論文レビュー] Angular Visual Hardness

Beidi Chen, Weiyang Liu|arXiv (Cornell University)|Dec 4, 2019
Optical measurement and interference techniques参考文献 82被引用数 10
ひとこと要約

この論文では、特徴埋め込みと分類器重みの間の正規化された角距離を用いて、CNNにおけるサンプルの難易度を測る新しいスコアであるAngular Visual Hardness (AVH) を導入する。AVH は人間の視覚的難易度と強く相関しており、自己学習およびドメイン一般化において、従来の信頼度測定法を上回り、硬い例においてもより良好なキャリブレーションと性能を示す。

ABSTRACT

Recent convolutional neural networks (CNNs) have led to impressive performance but often suffer from poor calibration. They tend to be overconfident, with the model confidence not always reflecting the underlying true ambiguity and hardness. In this paper, we propose angular visual hardness (AVH), a score given by the normalized angular distance between the sample feature embedding and the target classifier to measure sample hardness. We validate this score with an in-depth and extensive scientific study, and observe that CNN models with the highest accuracy also have the best AVH scores. This agrees with an earlier finding that state-of-art models improve on the classification of harder examples. We observe that the training dynamics of AVH is vastly different compared to the training loss. Specifically, AVH quickly reaches a plateau for all samples even though the training loss keeps improving. This suggests the need for designing better loss functions that can target harder examples more effectively. We also find that AVH has a statistically significant correlation with human visual hardness. Finally, we demonstrate the benefit of AVH to a variety of applications such as self-training for domain adaptation and domain generalization.

研究の動機と目的

  • ディープラーニングにおける意思決定境界付近の硬い例に対して、信頼性が高く意味的認識を反映する信頼度測定法の欠如に取り組むこと。
  • 明示的な人間ラベルを必要とせず、スケーラブルな人間の視覚的難易度の代理指標を構築すること。
  • 硬い例における性能向上が、一般化性能およびモデルキャリブレーションの向上と因果関係にあるかどうかを調査すること。
  • AVH の自己学習によるドメイン適応およびドメイン一般化への応用価値を評価すること。
  • 標準的な交差エントロピー損失が、角マージンの最適化や硬いサンプルにおける一般化性能の向上にどう寄与するかを検討すること。

提案手法

  • AVH は、入力の深層特徴埋め込みとその真のクラスの分類器重みベクトルとの間の正規化された角距離として計算される。
  • 正規化は、他のすべてのクラスとの角距離を用いて行われ、ロバストネスとスケール不変性を確保する。
  • AVH スコアは、特徴ベクトルとターゲット分類器重みのコサイン類似度に基づき、他のすべてのクラスとの角距離によって調整される。
  • AVH は自己学習フレームワークにおける信頼度の代理として用いられ、より硬く、信頼度が低いサンプルのプシポラベル選択を促進する。
  • ドメイン一般化のための AVH を用いた損失関数が提案され、温度スケーリングを施したソフトマックス関数として定義される:$\mathcal{L}_{AVH} = \sum_i \frac{\exp(s(\pi - \mathcal{A}(\mathbf{x}_i, \mathbf{w}_{y_i})))}{\sum_k \exp(s(\pi - \mathcal{A}(\mathbf{x}_i, \mathbf{w}_k)))}$。
  • 本手法は、標準的なCNNと自己学習プロトコルを用いて、ImageNet、PACS、およびドメイン適応ベンチマークで評価された。

実験結果

リサーチクエスチョン

  • RQ1AVH は、ソフトマックススコアや特徴ノルムといった従来の信頼度測定法よりも、人間の視覚的難易度とより強く相関しているか?
  • RQ2AVH はトレーニング中にどのように変化するか? トレーニング損失とは対照的に、角距離の整合性が早期に安定するか?
  • RQ3自己学習によるドメイン適応において、AVH を用いた選択により、プシポラベル化される硬いサンプルの割合が向上し、より良いキャリブレーションが達成されるか?
  • RQ4AVH を用いた損失関数は、標準的な交差エントロピー損失と比較して、ドメイン一般化タスクにおける一般化性能を向上させるか?
  • RQ5硬いサンプルにおける性能向上と、全体のモデル精度およびキャリブレーションの向上との間に因果関係があるか?

主な発見

  • AVH スコアは、トレーニング損失がまだ減少を続ける中で早期に飽和する。これは、角距離の整合性がノルムスケーリングよりも早く安定することを示唆している。
  • 最先端の精度を達成するモデルは、最高の AVH スコアを示しており、硬い例における性能向上が一般化を促進するという仮説を裏付けている。
  • AVH は、ソフトマックススコアや特徴ノルムよりも、人間の選択頻度(HSF)と統計的に有意に強い相関を示しており、人間の視覚的難易度の代理としての有効性が検証された。
  • ドメイン適応の自己学習において、AVH を用いた選択は、平均信頼度が 0.961(対照群:0.976)と低く、真陽性率は 0.844(対照群:0.848)と同等を維持するという点で、より良いキャリブレーションを達成した。
  • PACS データセットでは、AVH を用いた損失関数で学習した単純な10層CNNが、72.46% の平均精度を達成し、より複雑なベースラインを上回り、最先端の手法と同等またはそれを上回った。
  • AVH を用いた損失関数は、特にスケッチドメイン(61.26% の精度)において、硬いサンプルに対する性能を向上させ、ドメインシフトに対してより高いロバストネスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。