[論文レビュー] Not all Failure Modes are Created Equal: Training Deep Neural Networks for Explicable (Mis)Classification
本稿では、人間の期待に基づく意味的類似性に基づいて誤分類をペナルティ化する重み付き損失関数を用いて深層ニューラルネットワークを訓練する手法を提案している。WordNetなどの人間が整備した知識ベースを活用してクラスレベルの意味的距離を定義することで、特に明白な失敗に対してモデルの説明可能性を向上させるとともに、従来の手法と比較してラベル付けコストを削減しながら高い精度を維持する。
Deep Neural Networks are often brittle on image classification tasks and known to misclassify inputs. While these misclassifications may be inevitable, all failure modes cannot be considered equal. Certain misclassifications (eg. classifying the image of a dog to an airplane) can perplex humans and result in the loss of human trust in the system. Even worse, these errors (eg. a person misclassified as a primate) can have odious societal impacts. Thus, in this work, we aim to reduce inexplicable errors. To address this challenge, we first discuss methods to obtain the class-level semantics that capture the human's expectation ($M^h$) regarding which classes are semantically close {\em vs.} ones that are far away. We show that for popular image benchmarks (like CIFAR-10, CIFAR-100, ImageNet), class-level semantics can be readily obtained by leveraging either human subject studies or publicly available human-curated knowledge bases. Second, we propose the use of Weighted Loss Functions (WLFs) to penalize misclassifications by the weight of their inexplicability. Finally, we show that training (or fine-tuning) existing classifiers with the proposed methods lead to Deep Neural Networks that have (1) comparable top-1 accuracy, (2) more explicable failure modes on both in-distribution and out-of-distribution (OOD) test data, and (3) incur significantly less cost in the gathering of additional human labels compared to existing works.
研究の動機と目的
- 深層ニューラルネットワークにおける説明不能で、かつ危険な誤分類を低減すること、特に人間の期待や社会的規範に反する誤分類を対象とする。
- 人間がどのクラスの誤分類が妥当で、どの誤分類が深刻であると感じるかという人間の期待をモデル化することで、分類失敗における説明可能性の概念を形式化すること。
- インスタンスレベルのラベル付けを必要とせずに、人間のフィードバックを統合可能な低コストでスケーラブルな方法を考案し、DNNの学習に人間の意味的期待を組み込むこと。
- 分類器の失敗モードを人間の知覚的・意味的類似性理解と一致させることで、モデルの信頼性を向上させること。
提案手法
- 本手法は、人間の被験者調査や事前に整備された言語的知識ベース(例:WordNet)から得られる意味的距離を用いて、人間のクラス類似性に関する期待を表現する。
- 人間の認識におけるクラス間の類似度を定量化するクラスレベルの意味的類似度行列 $ M^h $ を構築する。
- 本稿では、意味的に遠く離れたクラスへの誤分類に対して高いペナルティを与える、新しい重み付き損失関数であるEKL(説明可能性に配慮した知識損失)を提案する。
- EKL損失は、標準的なモデル(例:ResNet、Inception-ResNet-v2)の訓練またはファインチューニング時に適用され、標準的なカテゴリカル交差エントロピー損失を意味的距離を反映する形に変更する。
- 本手法はCIFAR-10、CIFAR-100、ImageNetで評価され、説明可能性を測るためのハードおよびソフトメトリクスが用いられている。
- 人間による評価はAmazon Mechanical Turkを用い、EKLで訓練されたモデルが標準的なCCEや他のベースラインと比較して、より説明可能に感じられることを検証している。
実験結果
リサーチクエスチョン
- RQ1人間が整備した知識ベースから得られるクラスレベルの意味的類似性は、どの誤分類が説明可能で、どの誤分類が深刻であるかという人間の期待を効果的に表現できるか?
- RQ2意味的に遠く離れた誤分類に対してより重いペナルティを与えるように、重み付き損失関数をどのように設計すればよいか? これにより、モデルの失敗モードを人間の期待に合わせて誘導できるか?
- RQ3このような損失関数で訓練することで、分布内および分布外データの両方において、高い精度を維持しつつ失敗モードの説明可能性が著しく向上するか?
- RQ4人間による評価では、本手法で訓練されたモデルが、標準的な交差エントロピー損失で訓練されたモデルと比較して、より説明可能に感じられる程度はどの程度か?
主な発見
- ImageNetでは、EKLで訓練されたInception-ResNet-v2モデルが人間評価スコア2.897を達成し、標準的なCCEベースライン(1.456)を上回って2倍以上に改善され、説明可能性が著しく向上していることが示された。
- トップ1精度が0.95%低下したものの、EKLモデルは説明可能性メトリクスで顕著な向上を示し、精度と説明可能性を効果的にバランスさせられることを示した。
- CIFAR-10+では、EKLで訓練されたResNet-v2モデルが人間評価スコア1.743を達成し、CCEベースライン(0.741)を上回り、誤分類の妥当性が一貫して高まったことが確認された。
- 人間による評価は、EKLで訓練されたモデルがCCEや他のベースラインと比較して、より説明可能に感じられることを確認した。これは、メトリクスベースの評価結果とも一致した。
- 勾配サリエンシー解析の結果、EKLモデルはより関連性の高い画像領域に注目していることが示され、意味的に重要な特徴に適切に注目していることが示唆された。
- 本手法は、インスタンスレベルのラベル付けを必要としないため、従来のアプローチと比較してラベル付けコストを削減できる。これは、事前に整備されたクラスレベルの意味的知識に依存しているためである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。