Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Predict Trustworthiness with Steep Slope Loss

Yan Luo, Yongkang Wong|arXiv (Cornell University)|2021. 09. 30.
Adversarial Robustness in Machine Learning참고 문헌 39인용 수 4
한 줄 요약

이 논문은 ViT 및 ResNet과 같은 대규모 시각 모델에서 ImageNet에서 신뢰성 예측기의 일반화 성능을 향상시키기 위해 새로운 기울기 급격한 손실 함수를 제안한다. 올바른 예측과 잘못된 예측의 특징을 분리하기 위해 상반된 슬라이드 형태의 곡선을 사용함으로써, 진짜 양성도(TPR)와 진짜 음성도(TNR) 사이의 균형을 더 잘 확보하여, 교차 엔트로피, 포칼, 진짜 클래스 확률 손실보다 유의미하게 더 나은 성능을 보이며 신뢰할 수 없는 예측을 식별한다.

ABSTRACT

Understanding the trustworthiness of a prediction yielded by a classifier is critical for the safe and effective use of AI models. Prior efforts have been proven to be reliable on small-scale datasets. In this work, we study the problem of predicting trustworthiness on real-world large-scale datasets, where the task is more challenging due to high-dimensional features, diverse visual concepts, and large-scale samples. In such a setting, we observe that the trustworthiness predictors trained with prior-art loss functions, i.e., the cross entropy loss, focal loss, and true class probability confidence loss, are prone to view both correct predictions and incorrect predictions to be trustworthy. The reasons are two-fold. Firstly, correct predictions are generally dominant over incorrect predictions. Secondly, due to the data complexity, it is challenging to differentiate the incorrect predictions from the correct ones on real-world large-scale datasets. To improve the generalizability of trustworthiness predictors, we propose a novel steep slope loss to separate the features w.r.t. correct predictions from the ones w.r.t. incorrect predictions by two slide-like curves that oppose each other. The proposed loss is evaluated with two representative deep learning models, i.e., Vision Transformer and ResNet, as trustworthiness predictors. We conduct comprehensive experiments and analyses on ImageNet, which show that the proposed loss effectively improves the generalizability of trustworthiness predictors. The code and pre-trained trustworthiness predictors for reproducibility are available at https://github.com/luoyan407/predict_trustworthiness.

연구 동기 및 목표

  • 실제 대규모 데이터셋인 ImageNet과 같이 기존 손실 함수가 올바른 예측에 과적합되는 환경에서 신뢰성 예측 문제를 해결하기 위해.
  • 표준 손실 함수(교차 엔트로피, 포칼, TCP 신뢰도)가 고차원적이고 복잡한 데이터에서 잘못된 예측을 신뢰할 수 없다고 구분하지 못하는 이유를 규명하기 위해.
  • 올바른 예측과 잘못된 예측의 특징 간 분리 능력을 향상시켜 신뢰성 예측기의 일반화 성능을 향상시키는 새로운 손실 함수를 개발하기 위해.
  • 안전이 중요한 응용 분야에서 핵심적인 진짜 양성도(TPR)와 진짜 음성도(TNR) 사이의 민감한 균형 조정을 가능하게 하기 위해.

제안 방법

  • 신뢰할 수 있는 예측과 신뢰할 수 없는 예측 간의 결정 경계를 모델링하기 위해 두 개의 상반된 슬라이드 형태의 곡선을 사용하는 기울기 급격한 손실을 제안한다.
  • 손실 함수는 기울기와 높이를 제어하기 위한 학습 가능한 매개변수 α⁺ 및 α⁻를 사용하여 올바른 예측과 잘못된 예측의 특징 간에 민감한 분리를 가능하게 한다.
  • 손실 함수는 선형층의 출력(z = wᵀxₒᵤₜ + b)에 적용되며, 정규화된(z = (wᵀxₒᵤₜ + b)/||w||) 및 비정규화된 버전을 비교하는 실험을 수행한다.
  • ViT 및 ResNet 백본을 신뢰성 예측기로 사용하여 ImageNet에서 평가하며, 훈련 및 추론 모두에서 제안된 손실을 적용한다.
  • 손실 함수는 올바른 예측의 특징를 높은 신뢰도로, 잘못된 예측의 특징를 낮은 신뢰도로 이동시켜 분포 간 분리도를 향상시킨다.
  • 각 백본에 대해 α⁺ 및 α⁻의 최적화를 위한 초매개변수 탐색을 수행하여 TPR-TNR 균형을 최적화한다.

실험 결과

연구 질문

  • RQ1표준 손실 함수가 왜 ImageNet과 같은 대규모 데이터셋에서 잘못된 예측을 신뢰할 수 없다고 식별하지 못하는가?
  • RQ2올바른 예측이 지배하고 데이터의 복잡성이 차이를 감추는 환경에서 신뢰성 예측기의 일반화 성능을 어떻게 향상시킬 수 있는가?
  • RQ3올바른 예측과 잘못된 예측의 특징 분포를 명시적으로 분리하는 손실 함수가 표준 분류 손실보다 더 나은 성능을 낼 수 있는가?
  • RQ4실제 데이터셋에서 TPR과 TNR 사이의 최적 균형을 달성하기 위해 기울기 급격한 손실의 초매개변수 설정은 어떻게 해야 하는가?
  • RQ5결정 점수 z의 정규화가 신뢰성 예측의 성능과 분포에 어떤 영향을 미치는가?

주요 결과

  • 기울기 급격한 손실은 교차 엔트로피, 포칼, TCP 신뢰도 손실보다 TPR과 TNR 간 균형을 더 잘 확보하며, ViT에서 α⁻ = 3 및 α⁺ = 1일 때 최적 성능을 기록한다.
  • ResNet에서는 최적 초매개변수로 α⁺ = 2 및 α⁻ = 5를 사용하여 모델별 최적화가 효과적임을 입증한다.
  • 제안된 손실은 클래스 불균형 손실보다 우수한 성능을 보이며, 이는 신뢰성 예측이 표준 분류와는 다른 데이터 불균형 특성을 가짐을 시사한다.
  • 정규화된 z(z = (wᵀxₒᵤₜ + b)/||w||)를 사용할 경우 비정규화된 z보다 더 산만한 분포와 더 나은 TNR/TPR 분리 성능을 보인다.
  • 모델은 분포 내 및 분포 외 이미지 모두에서 강력한 성능을 유지하여 일반화 능력이 뛰어나다는 것을 입증한다.
  • 손실 함수는 TPR과 TNR 사이의 민감한 균형 조정을 가능하게 하여 의료 및 보안 응용 분야에서 중요한 잠재적 거짓 양성 결과를 줄인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.