Skip to main content
QUICK REVIEW

[논문 리뷰] Measuring support for a hypothesis about a random parameter without estimating its unknown prior

David R. Bickel|arXiv (Cornell University)|2010. 12. 31.
Gene expression and cancer classification참고 문헌 43인용 수 8
한 줄 요약

이 논문은 알려지지 않은 사전 분포를 추정할 필요 없이 랜덤 매개변수에 대한 가설에 대한 통계적 지지를 측정하는 방법을 제안한다. 정보 이론에서 유도된 최소최대 최적 측정법—특히 정규화된 최대 우도 기반 접근법을 사용함으로써, 사후 및 사전 로그 오즈의 차이를 渐近적으로 편향 없이 추정할 수 있으며, 단일 단백질이 포함된 프로테오믹스와 같은 제한된 데이터에서도 뛰어난 성능을 보인다.

ABSTRACT

For frequentist settings in which parameter randomness represents variability rather than uncertainty, the ideal measure of the support for one hypothesis over another is the difference in the posterior and prior log odds. For situations in which the prior distribution cannot be accurately estimated, that ideal support may be replaced by another measure of support, which may be any predictor of the ideal support that, on a per-observation basis, is asymptotically unbiased. Two qualifying measures of support are defined. The first is minimax optimal with respect to the population and is equivalent to a particular Bayes factor. The second is worst-sample minimax optimal and is equivalent to the normalized maximum likelihood. It has been extended by likelihood weights for compatibility with more general models. One such model is that of two independent normal samples, the standard setting for gene expression microarray data analysis. Applying that model to proteomics data indicates that support computed from data for a single protein can closely approximate the estimated difference in posterior and prior odds that would be available with the data for 20 proteins. This suggests the applicability of random-parameter models to other situations in which the parameter distribution cannot be reliably estimated.

연구 동기 및 목표

  • 알려지지 않은 사전 분포를 추정할 필요 없이, 랜덤 매개변수에 대한 가설에 대한 통계적 지지도를 측정하는 방법을 개발하는 것.
  • 표본 수가 적거나 상관관계가 존재하는 고차원 생물학적 데이터(예: 유전자 발현 또는 프로테오믹스)에서 신뢰할 수 있는 사전 분포 추정의 과제를 해결하는 것.
  • 사후 및 사전 로그 오즈의 차이를 渐近적으로 모방하는 지지도를 제공함으로써, 베이지안 추론과의 해석 가능성과 호환성을 확보하는 것.
  • 주관적 또는 잘못 지정된 사전 분포에 의존하지 않으면서도 베이즈 요인의 해석 가능성 유지하는 객관적이고, 편의성에 가까운 증거 측정법을 제공하는 것.
  • 실제 프로테오믹스 데이터를 사용하여, 특히 단일 단백질의 데이터만 이용 가능한 경우, 제안된 지지도의 성능을 실베이즈 기준과 비교하는 것.

제안 방법

  • 지지도를 사후 및 사전 로그 오즈의 차이로 정의하며, 이는 표준 베이지안 측정법이지만 사전 분포 지식이 필요하지 않게 공식화한다.
  • 두 가지 최소최대 최적 지지도를 도입한다: 하나는 전체 모집단에 대해 최소최대 최적이고, 다른 하나는 최악의 표본에 대해 최소최대 최적이다.
  • 첫 번째 지지도는 특정 베이즈 요인과 동일하며, 두 번째 지지도는 일반 모델을 위해 우도 가중치를 통한 확장이 이루어진 정규화된 최대 우도(NML)와 동일하다.
  • 두 개의 독립된 정규분포 표본 모델에 NML 기반 지지도를 적용하며, 이는 마이크로어레이 및 프로테오믹스 데이터 분석에서 표준적인 설정이다.
  • 정보 이론 원칙(예: 최소 기술 길이)을 사용하여, 관측치별로 渐近적으로 편향 없는 지지도를 유도한다.
  • 과적합 방지를 위해 예측 밀도의 적분을 포함한 펜alties를 사용한다. 특히 고차원 설정에서 효과적이다.

실험 결과

연구 질문

  • RQ1랜덤 매개변수에 대한 알려지지 않은 사전 분포를 추정할 필요 없이 통계적 지지도를 정의할 수 있는가?
  • RQ2사전 분포 지식이 없이도, 사후 및 사전 로그 오즈의 차이를 渐近적으로 근사하는 방식으로 가설에 대한 지지를 어떻게 정량화할 수 있는가?
  • RQ3최소최대 기준 하에서 이러한 지지도의 최적성 성질은 무엇이며, 최대 우도 비율 또는 실베이즈와 같은 기존 방법과 비교해 볼 때 어떻게 다른가?
  • RQ4단일 단백질의 데이터로부터 계산된 지지도가 20개 단백질의 데이터로부터 구할 수 있는 사후-사전 로그 오즈 차이를 어느 정도 근사할 수 있는가?
  • RQ5고차원 또는 소표본 설정에서 제안된 최소최대 지지도가 상한선(최대 우도 비율)에 비해 어떻게 성능을 발휘하는가?

주요 결과

  • 정규화된 최대 우도(NML) 기반 지지도는 최악의 표본 기준으로 최소최대 최적이며, 사전 분포가 알려지지 않은 경우에도 강인하게 작동한다.
  • 단일 단백질의 경우, 제안된 지지도는 20개 단백질의 데이터를 사용해 추정한 사후-사전 로그 오즈 차이를 매우 잘 근사한다.
  • 최대 우도 비율보다 과적합을 더 잘 방지하며, 이는 상한선으로서의 역할을 하며 증거를 과대평가하는 경향이 있다.
  • 최소최대 지지도에서는 진정한 사후 및 사전 로그 오즈 차이를 초과하지 않으며, 특히 고차원 설정에서 상한선과 달리 보수적인 성향을 유지한다.
  • 표본 수가 적거나 상관관계가 있는 특징이 존재하는 프로테오믹스와 같이 실베이즈 사전 분포를 신뢰성 있게 추정할 수 없는 모델에도 적용 가능하다.
  • 지지도는 校정 없이도 다양한 표본 크기에서 해석 가능하며, 사전에서 사후로의 오즈 변화를 직접 측정하므로 베이지안 해석과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.