Skip to main content
QUICK REVIEW

[논문 리뷰] Confidence estimation of classification based on the distribution of the neural network output layer

Abdel Aziz Taha, Leonhard Hennig|arXiv (Cornell University)|2022. 10. 14.
Neural Networks and Applications인용 수 5
한 줄 요약

이 논문은 기계학습 모델의 재학습 없이도 예측의 신뢰도를 평가할 수 있도록 출력층의 로짓 분포를 분석하는 방법을 제안한다. 이는 웹 스크래핑을 통한 실생활 데이터와 같은 노이즈가 많은 환경에서 예측의 정밀도를 높이는 데 기여한다. 두 가지의 신뢰도 추정기(KRT 및 WDF)를 도입하였으며, 특히 WDF는 정밀도를 크게 향상시키지만 재현율은 감소시키는 경향이 있다.

ABSTRACT

One of the most common problems preventing the application of prediction models in the real world is lack of generalization: The accuracy of models, measured in the benchmark does repeat itself on future data, e.g. in the settings of real business. There is relatively little methods exist that estimate the confidence of prediction models. In this paper, we propose novel methods that, given a neural network classification model, estimate uncertainty of particular predictions generated by this model. Furthermore, we propose a method that, given a model and a confidence level, calculates a threshold that separates prediction generated by this model into two subsets, one of them meets the given confidence level. In contrast to other methods, the proposed methods do not require any changes on existing neural networks, because they simply build on the output logit layer of a common neural network. In particular, the methods infer the confidence of a particular prediction based on the distribution of the logit values corresponding to this prediction. The proposed methods constitute a tool that is recommended for filtering predictions in the process of knowledge extraction, e.g. based on web scrapping, where predictions subsets are identified that maximize the precision on cost of the recall, which is less important due to the availability of data. The method has been tested on different tasks including relation extraction, named entity recognition and image classification to show the significant increase of accuracy achieved.

연구 동기 및 목표

  • 일반화 성능이 떨어지는 실생활 응용 분야에서 신뢰도가 높은 예측 신뢰도 평가의 부족을 해결한다.
  • 기존 신경망 모델을 수정하거나 재학습하지 않고도 예측의 신뢰도를 추정하는 방법을 개발한다.
  • 데이터가 많고 노이즈가 많으며 이질적인 실생활 지식 추출 파이프라인에서 정밀도를 극대화하기 위해 예측을 필터링할 수 있도록 한다.
  • 필터링된 예측 집합이 특정 신뢰도 수준(예: 90%, 95%, 99%)을 충족하도록 보장하는 임계값 기반 메커니즘을 제공한다.
  • 자연어 처리(NLP, 관계 추출, NER) 및 컴퓨터 비전(이미지 분류)을 포함한 다양한 작업에 적용 가능함을 입증한다.

제안 방법

  • 기계학습 모델의 학습 완료 후 출력층의 로짓 값 분포를 분석하여 예측의 신뢰도를 추정한다.
  • 두 가지의 신뢰도 추정 함수를 제안한다: KRT(로짓의 첨도와 왜도 기반) 및 WDF(로짓의 가중 분포 기반).
  • 모델의 원래 정확도와 추정기의 출력을 바탕으로 특정 모델과 목표 신뢰도 수준에 맞는 신뢰도 임계값을 계산한다.
  • 임계값을 적용하여 예측을 두 집합으로 분류한다: 고신뢰도(사용 대상) 및 저신뢰도(기각 대상).
  • 임계값을 통해 원래 모델 성능과 관계없이 필터링된 집합이 목표 신뢰도 수준(예: 95% 정확도)을 충족하도록 보장한다.
  • 관계 추출(TACRED, SemEval2010), 명명된 실체 인식, 이미지 분류(VGG16을 사용한 고양이 대 개 분류) 등 다양한 작업에서 방법을 검증한다.

실험 결과

연구 질문

  • RQ1기계학습 모델을 수정하지 않고도 출력층의 로짓 분포를 분석하여 예측의 신뢰도를 신뢰성 있게 추정할 수 있는가?
  • RQ2제안된 두 가지 추정기(KRT 및 WDF)가 정확도가 낮고 노이즈가 많은 환경에서 예측을 필터링할 때 정밀도 향상에 얼마나 효과적인가?
  • RQ3목표로 하는 신뢰도 수준(예: 95%)을 충족하는 필터링된 예측 집합을 확보하기 위해 임계값을 계산할 수 있는가?
  • RQ4이 방법은 자연어 처리와 컴퓨터 비전을 포함한 다양한 작업에 일반화 가능한가?
  • RQ5모델의 정확도와 신뢰도 수준에 따라 고신뢰도 예측 비율(이득 비율)은 어떻게 변하는가?

주요 결과

  • 모든 테스트된 신뢰도 수준(90%, 95%, 99%)에서 WDF 추정기가 KRT보다 정확도와 이득 비율 모두에서 뛰어난 성능을 보였다.
  • 향상된 정확도(E.ACCU)는 원래 모델의 정확도를 크게 초월하며, 특히 정확도가 낮은 모델에서 정밀도 향상 효과가 뚜렷하게 나타났다.
  • 이득 비율은 극단적인 경우(예: 매우 낮은 모델 정확도에 매우 높은 신뢰도 수준)를 제외하고는 합리적인 수준을 유지한다.
  • 원래 모델의 정확도가 낮더라도 저신뢰도 예측을 필터링함으로써 지식 추출 작업에서 정밀도를 효과적으로 향상시켰다.
  • 이 방법은 텍스트 기반의 관계 추출과 이미지 분류를 포함한 다양한 도메인에서 효과적이며, 일반화 가능성은 확인되었다.
  • 임계값 기반 메커니즘이 원래 모델 성능과 관계없이 필터링된 예측 집합이 목표 신뢰도 수준에 부합하도록 성공적으로 조정하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.