Skip to main content
QUICK REVIEW

[논문 리뷰] Tree-Values: selective inference for regression trees

Anna Neufeld, Lucy L. Gao|PubMed|2021. 06. 15.
Statistical Methods and Inference참고 문헌 17인용 수 10
한 줄 요약

이 논문은 데이터로부터 선택된 특정 트리 구조에 조건을 두어 유의수준 오류를 통제하고 명목상 커버리지를 달성하는 선택적 추론 프레임워크를 도입한다. 종단 노드 간 평균 반응을 비교하기 위한 선택적 Z-검정과 단일 노드의 평균에 대한 신뢰구간을 제안하며, 특화된 조건부 집합을 통해 효율적인 계산을 구현한다. 시뮬레이션과 영양 연구에서의 실데이터를 통한 검증을 통해 검증되었다.

ABSTRACT

We consider conducting inference on the output of the Classification and Regression Tree (CART) (Breiman et al., 1984) algorithm. A naive approach to inference that does not account for the fact that the tree was estimated from the data will not achieve standard guarantees, such as Type 1 error rate control and nominal coverage. Thus, we propose a selective inference framework for conducting inference on a fitted CART tree. In a nutshell, we condition on the fact that the tree was estimated from the data. We propose a test for the difference in the mean response between a pair of terminal nodes that controls the selective Type 1 error rate, and a confidence interval for the mean response within a single terminal node that attains the nominal selective coverage. Efficient algorithms for computing the necessary conditioning sets are provided. We apply these methods in simulation and to a dataset involving the association between portion control interventions and caloric intake.

연구 동기 및 목표

  • 데이터 기반 트리 구축으로 인한 선택 편향으로 인해 회귀 트리에 대한 타당한 통계적 추론이 부족한 문제를 해결하기 위해.
  • CART 트리에서 평균 반응 비교 및 추정에 대해 선택적 유의수준 오류와 선택적 커버리지를 통제하는 유한표본 프레임워크를 개발하기 위해.
  • 통계적 타당성을 유지하면서도 성능이나 정밀도를 희생시키지 않는 조건부 집합을 위한 계산 효율적인 방법을 제공하기 위해.
  • 시뮬레이션과 실세계 적용(칼로리 섭취 연구)을 통해 프레임워크의 강건성과 실용성을 입증하기 위해.

제안 방법

  • 데이터로부터 특정 CART 트리 구조가 선택된 사건에 조건을 두어 선택 편향을 보정하는 선택적 추론을 사용한다.
  • 두 종단 노드 간 평균 반응의 차이를 검정하기 위한 선택적 Z-검정을 제안하며, p-값은 조건부 사건 하에서 계산된다.
  • 동일한 조건부 프레임워크를 사용하여 단일 종단 노드 내 평균 반응에 대한 신뢰구간을 구성하여 명목상 선택적 커버리지를 확보한다.
  • 필요한 조건부 집합을 계산하기 위한 효율적인 알고리즘을 개발하며, 항등치환을 사용한 계산 효율적인 근사법을 포함한다.
  • 이론적 타당성을 위해 전체 조건부 집합을 사용하고, 계산 효율성을 위해 항등치환을 사용하며, 성능 손실가능성이 최소임을 실증적으로 검증한다.
  • 잔차 분산을 평균 제곱오차(SSE) 또는 보수적 추정량(cons)을 사용하여 추정하여 비정규성 하에서도 강건성을 유지한다.

실험 결과

연구 질문

  • RQ1선택적 추론이 회귀 트리에 적용되어 종단 노드 평균 간 차이를 검정할 때 선택적 유의수준 오류율을 통제할 수 있는가?
  • RQ2제안된 방법이 개별 종단 노드 내 평균 반응에 대한 명목상 선택적 커버리지를 달성하는가?
  • RQ3항등치환을 사용한 계산 효율적 근사법과 전체 조건부 집합 간의 성능(유의력과 구간 너비 측면) 비교에서 어떤 차이가 있는가?
  • RQ4응답 변수의 정규성 위반에 대해 선택적 추론 프레임워크가 강건한가?
  • RQ5표본 분할과 CTree와 비교할 때, 제안된 방법이 유한표본에서 통계적 유의력과 커버리지 측면에서 어떻게 성능을 내는가?

주요 결과

  • 전체 조건부 집합 기반 선택적 Z-검정은 정규성 가정이 위반된 경우에도 근본적인 가설 하에서 선택적 유의수준 오류율을 통제한다. 다만 베르누이(0.1)와 같은 극단적인 경우를 제외하고는 그렇다.
  • 전체 조건부 집합 대비 항등치환을 사용할 경우의 유의력 손실은 미미하며, 유의력 곡선을 세밀히 분석해도 미미한 차이만 확인된다.
  • 항등치환 기반 신뢰구간은 전체 조건부 집합 기반 구간보다 略히 넓지만, 표본 크기가 작을 때에만 이 차이가 두드러지게 나타난다.
  • 포isson(10), 베르누이(0.5), 감마(1,10) 분포 하에서 전반적인 귀무가설 하에서 균일한 p-값을 얻었으며, 이는 비정규성에 대한 강건성을 시사한다.
  • 박스 런치 연구 응용에서 선택적 추론 프레임워크는 다양한 분산 추정량(보수적 추정량 포함) 간 일관된 p-값과 신뢰구간을 생성하였다.
  • 특히 프리닝이 포함된 경우, 표본 분할과 CTree보다 선택적 추론 프레임워크가 더 높은 유의력과 정밀도를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.