Skip to main content
QUICK REVIEW

[논문 리뷰] Weighted scoring rules and hypothesis testing

Hajo Holzmann, Bernhard Klar|arXiv (Cornell University)|2016. 01. 01.
Advanced Statistical Methods and Models참고 문헌 11인용 수 3
한 줄 요약

이 논문은 조건부 밀도를 기반으로 엄격한 국소적 적합성 조건을 만족하는 가중치가 부여된 점수 규칙을 구성하기 위한 일반적 프레임워크를 제안한다. 이는 관심 영역에 집중된 예측 평가를 가능하게 한다. 연구는 Diks 등(2011)이 제안한 케논된 우도 규칙이 i.i.d. 설정에서 최적의 가설 검정을 제공함을 입증하며, 가중치가 부여된 점수 규칙이 특정 영역 내에서 성능이 뛰어난 예측을 신뢰성 있게 식별할 수 있음을 보여준다. 이는 해당 영역 외부에서의 성능이 열 劣한 경우에도 성립한다.

ABSTRACT

We discuss weighted scoring rules for forecast evaluation and their connection to hypothesis testing. First, a general construction principle for strictly locally proper weighted scoring rules based on conditional densities and scoring rules for probability forecasts is proposed. We show how likelihood-based weighted scoring rules from the literature fit into this framework, and also introduce a weighted version of the Hyvärinen score, which is a local scoring rule in the sense that it only depends on the forecast density and its derivatives at the observation, and does not require evaluation of integrals. Further, we discuss the relation to hypothesis testing. Using a weighted scoring rule introduces a censoring mechanism, in which the form of the density is irrelevant outside the region of interest. For the resulting testing problem with composite null - and alternative hypotheses, we construct optimal tests, and identify the associated weighted scoring rule. As a practical consequence, using a weighted scoring rule allows to decide in favor of a forecast which is superior to a competing forecast on a region of interest, even though it may be inferior outside this region. A simulation study and an application to financial time-series data illustrate these findings.

연구 동기 및 목표

  • 특정 관심 영역에서의 성능을 강조하는 엄격한 국소적 적합성 조건을 만족하는 가중치가 부여된 점수 규칙의 일반적 구성 원칙을 개발하는 것.
  • 관심 영역 내에서 질량이 높은 예측을 선호하는 부적합한 가중치가 부여된 점수 규칙 문제를 해결하기 위해 이론적 적합성을 보장하는 것.
  • 복합 귀무가설과 대립가설 하에서 가중치가 부여된 점수 규칙과 최적의 가설 검정 간의 연결 고리를 설정하는 것.
  • 가중치가 부여된 점수 규칙이 관심 영역 내에서 성능이 뛰어난 예측을 식별할 수 있음을 입증하는 것. 이는 해당 영역 외부에서의 성능이 열 劣한 경우에도 성립한다.
  • 시뮬레이션과 금융 시계열 데이터를 활용하여 가중치가 부여된 점수 규칙의 실용적 성능을 평가하는 것.

제안 방법

  • 조건부 밀도와 확률 예측을 위한 적합한 점수 규칙을 사용하여 가중치가 부여된 점수 규칙의 일반적 구성 방법을 제안한다.
  • 국소적 성격을 가지며 관측치에서의 밀도 도함수에 의존함으로써 적분 평가가 필요 없는 히바리넨 점수의 가중치 버전을 도입한다.
  • Diks 등(2011)과 Pelenis(2014)가 제안한 우도 기반 가중치가 부여된 점수 규칙이 제안된 프레임워크에 포함됨을 입증한다.
  • 관심 영역이 케논팅 메커니즘으로 작용하는 복합 귀무가설과 대립가설을 가진 가설 검정 문제로 예측 비교를 재구성한다.
  • 케논된 우도 규칙을 기반으로 최적의 한쪽 검정을 구성하며, 이는 i.i.d. 설정 하에서 최적의 검정과 일치함을 보여준다.
  • 가중치가 부여된 점수 규칙 하에서 예측 정확도를 비교하기 위해 스타일라이즈드 프레임워크에서 Diebold-Mariano 검정을 사용한다.

실험 결과

연구 질문

  • RQ1가중치가 부여된 점수 규칙는 어떻게 구성할 수 있을까? 이는 특정 관심 영역에 집중된 평가를 보장하면서도 적합성을 유지하는 데 초점을 맞춘다.
  • RQ2가중치가 부여된 점수 규칙과 예측 평가에서 최적의 가설 검정 간의 관계는 무엇인가?
  • RQ3가중치가 부여된 점수 규칙은 관심 영역 내에서 성능이 뛰어난 예측을 신뢰성 있게 식별할 수 있는가? 이는 해당 영역 외부에서의 성능이 열 劣한 경우에도 성립하는가?
  • RQ4다양한 가중치가 부여된 점수 규칙—예를 들어 케논된 우도 규칙과 페널티가 부과된 우도 점수—은 표준 점수 규칙과 비교해 실용적으로 어떻게 성능을 발휘하는가?
  • RQ5다른 영역에서의 성능가 중요하지 않은 설정에서 가중치가 부여된 점수 규칙을 사용하는 데 이론적 근거는 무엇인가?

주요 결과

  • Diks 등(2011)이 제안한 케논된 우도 규칙은 i.i.d. 설정에서 최적의 한쪽 검정을 이끌어내며, 이는 영역별 예측 평가에서의 이론적 최적성과 일치함을 입증한다.
  • Pelenis(2014)가 제안한 페널티가 부과된 우도 점수는 선호도 유지 성격과 적합성 조건을 만족하며, 시뮬레이션과 실제 데이터에서 뛰어난 성능을 보이며 실용적 유용성을 뒷받침한다.
  • Deutsche Bank 수익률 분석에서, 왜도가 있는 t-분포를 가진 GARCH 모형은 손실 예측에서 t-GARCH 모형보다 유의미하게 뛰어나며(p-value < 0.05), 반면 수익 예측에서는 t-GARCH 모형이 더 우수하다.
  • 시뮬레이션 연구는 가중치가 부여된 점수 규칙가 전반적인 성능가 유사하거나 외부 영역에서 열 劣한 경우에도 영역별 예측 성능 향상을 탐지할 수 있음을 확인한다.
  • 잔차의 시각적 점검 결과, 왜도가 있는 t-GARCH 모형은 t-GARCH 모형보다 왼쪽 꼬리 부분에 더 잘 맞는 것으로 나타났으며, 이는 검정 결과와 일치한다. 반면 t-GARCH 모형은 오른쪽 꼬리 부분에 더 잘 맞는다.
  • 적합한 가중치가 부여된 점수 규칙의 이론적 매력에도 불구하고, 시뮬레이션 결과는 잘못된 모형을 비교할 때 비가중치 규칙보다 체계적인 성능 향상이 없음을 보여주며, 이는 영역별 평가 프레임워크의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.