Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Estimate Without Bias

Tzvi Diskin, Yonina C. Eldar|arXiv (Cornell University)|2021. 10. 24.
Statistics Education and Methodologies인용 수 4
한 줄 요약

이 논문은 깊이 있는 학습 기반 파라미터 추정에 편향 정규화를 통합하여 모든 파라미터 값에서 渐近적으로 편향이 없고 분산이 최소화된 성능을 보장하는 편향 제약 추정기(Bias Constrained Estimator, BCE)를 제안한다. 손실 함수에서 기대 편향을 제약함으로써 BCE는 점차적으로 크래머-라오 경계에 도달하며, 신호 대 잡음비(SNR) 및 공분산 추정 작업에서 표준 학습 기반 추정기보다 뛰어난 성능을 발휘한다.

ABSTRACT

The Gauss Markov theorem states that the weighted least squares estimator is a linear minimum variance unbiased estimation (MVUE) in linear models. In this paper, we take a first step towards extending this result to non linear settings via deep learning with bias constraints. The classical approach to designing non-linear MVUEs is through maximum likelihood estimation (MLE) which often involves computationally challenging optimizations. On the other hand, deep learning methods allow for non-linear estimators with fixed computational complexity. Learning based estimators perform optimally on average with respect to their training set but may suffer from significant bias in other parameters. To avoid this, we propose to add a simple bias constraint to the loss function, resulting in an estimator we refer to as Bias Constrained Estimator (BCE). We prove that this yields asymptotic MVUEs that behave similarly to the classical MLEs and asymptotically attain the Cramer Rao bound. We demonstrate the advantages of our approach in the context of signal to noise ratio estimation as well as covariance estimation. A second motivation to BCE is in applications where multiple estimates of the same unknown are averaged for improved performance. Examples include distributed sensor networks and data augmentation in test-time. In such applications, we show that BCE leads to asymptotically consistent estimators.

연구 동기 및 목표

  • 평균적으로는 잘 작동하지만 특정 파라미터 값에서는 성능이 떨어지는 딥 러닝 기반 파라미터 추정기의 편향 문제를 해결하기 위해.
  • 딥 러닝을 사용하여 비선형 설정으로 고전적 선형 추정 이론(예: 가우스-마르코프)을 확장하기 위해.
  • 모든 미지 파라미터 값에 대해 점차적으로 편향이 없고 분산이 최소화되는 추정기를 보장하는 학습 프레임워크를 개발하기 위해.
  • 분산 센서 네트워크 및 테스트 시간 데이터 증강과 같은 앙상블 평균화 응용 분야에서 성능을 향상시키기 위해.

제안 방법

  • 모든 파라미터 값에서 추정기의 기대 편향을 페널티 처리하는 편향 제약 손실 함수를 도입하여 학습 중에 적용한다.
  • 50회의 반복 동안 완전히 연결된 신경망을 사용하여 내부 파rameter(예: 알파 및 v 벡터)를 반복적으로 개선하는 신경망 아키텍처를 사용한다.
  • 공분산 파라미터를 균일하게 샘플링하고, 평균이 0인 가우시안 분포에서 다수의 관측치를 생성하는 합성 데이터 생성 파이프라인을 활용한다.
  • 경고 레이블 교차 엔트로피와 편향 정규화(L_bias)를 조합한 수정된 손실을 적용하여 증강된 데이터 전반에 걸쳐 출력의 무편향성을 강제한다.
  • 교수 네트워크를 통해 온도 조정 소프트 레이블 생성 과정을 사용하여 디스틸레이션을 위한 고품질의 소프트 레이블을 생성한다.
  • 배치 단위로 편향을 계산하여 각 배치에서 평균 편향이 0이 되도록 보장하는 하드 레이블 교차 엔트로피와 편향 정규화의 조합을 사용해 학생 네트워크를 훈련시킨다.
Figure 1: Bias of SNR, MSE of SNR and MSE of inverse SNR.
Figure 1: Bias of SNR, MSE of SNR and MSE of inverse SNR.

실험 결과

연구 질문

  • RQ1모든 파라미터 값에서 점차적으로 편향이 없고 분산이 낮은 딥 러닝 기반 추정기를 설계할 수 있는가?
  • RQ2손실 함수에 편향 정규화를 통합하면 추정기가 점차적으로 크래머-라오 경계에 도달하는가?
  • RQ3BCE 프레임워크는 표준 MSE 최소화 네트워크와 비교해 신호 대 잡음비(SNR) 및 공분산 추정에서 성능을 어떻게 향상시키는가?
  • RQ4BCE는 데이터 증강 또는 분산 센서 융합과 같은 앙상블 평균화 시나리오에서 일관성을 확보할 수 있는가?

주요 결과

  • 제안된 편향 제약 추정기(BCE)는 훈련 시 사용된 사전 분포와는 무관하게 모든 파라미터 값에서 점차적으로 편향이 없고 분산이 최소화된 추정(MVUE)을 달성한다.
  • BCE는 점차적으로 크래머-라오 경계에 도달하여, 편향이 없는 추정기의 평균 제곱 오차에 대한 이론적 하한선을 충족함을 보여준다.
  • SNR 추정 및 공분산 추정 작업에서 BCE는 표준 MSE 최소화 딥 러닝 추정기보다 뚜렷이 뛰어나며, 다양한 파라미터 값에서 편향 감소 측면에서 두각을 나타낸다.
  • 테스트 시간 데이터 증강에서 BCE는 다수의 추정치를 평균화할 때 점차적으로 일관된 추정기를 도출하며, 표준 학습 기반 방법보다 뛰어난 성능을 발휘한다.
  • 온도 조정 소프트 레이블 디스틸레이션 방법을 사용한 BCE 프레임워크는 CIFAR-10 이미지 분류에서 더 높은 정확도와 낮은 분산을 달성하며, 다양한 데이터 증강에 대해 더 뛰어난 강건성을 보였다.
  • 실험 결과로 BCE에서 편향 손실에 λ=1000을 사용할 경우 안정적인 수렴이 이루어지고 성능 저하 없이 편향을 지속적으로 감소시킴을 확인했다.
Figure 2: Scatter plot of MSEs ordered by CRB values. In (a) the tested $\boldsymbol{y}$ ’s are generated from the training distribution. In (b) the test distribution is different. BCE is near-MVUE and close to the CRB for both distributions, whereas EMMSE is better in (a) and weaker in (b).
Figure 2: Scatter plot of MSEs ordered by CRB values. In (a) the tested $\boldsymbol{y}$ ’s are generated from the training distribution. In (b) the test distribution is different. BCE is near-MVUE and close to the CRB for both distributions, whereas EMMSE is better in (a) and weaker in (b).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.