Skip to main content
QUICK REVIEW

[논문 리뷰] Optimizing Prediction Intervals by Tuning Random Forest via Meta-Validation

Sean Bayley, Davide Falessi|arXiv (Cornell University)|2018. 01. 22.
Software Engineering Research참고 문헌 47인용 수 11
한 줄 요약

이 논문은 소프트웨어 결함 및 노력 추정에서 신뢰할 수 있고 좁은 예측 구간을 구축하기 위해 랜덤 포레스트의 초모수를 튜닝하기 위한 메타검증 접근법을 제안한다. 여덟 가지 검증 기법을 평가하고 세 가지 메타검증 전략을 도입함으로써, 연구는 75/25 할당이 다른 기법들보다 항상 우수하며, 기본 설정 대비 신뢰성 향상과 함께 커버리지 및 구간 너비 개선을 이룬다는 것을 발견한다.

ABSTRACT

Recent studies have shown that tuning prediction models increases prediction accuracy and that Random Forest can be used to construct prediction intervals. However, to our best knowledge, no study has investigated the need to, and the manner in which one can, tune Random Forest for optimizing prediction intervals { this paper aims to fill this gap. We explore a tuning approach that combines an effectively exhaustive search with a validation technique on a single Random Forest parameter. This paper investigates which, out of eight validation techniques, are beneficial for tuning, i.e., which automatically choose a Random Forest configuration constructing prediction intervals that are reliable and with a smaller width than the default configuration. Additionally, we present and validate three meta-validation techniques to determine which are beneficial, i.e., those which automatically chose a beneficial validation technique. This study uses data from our industrial partner (Keymind Inc.) and the Tukutuku Research Project, related to post-release defect prediction and Web application effort estimation, respectively. Results from our study indicate that: i) the default configuration is frequently unreliable, ii) most of the validation techniques, including previously successfully adopted ones such as 50/50 holdout and bootstrap, are counterproductive in most of the cases, and iii) the 75/25 holdout meta-validation technique is always beneficial; i.e., it avoids the likely counterproductive effects of validation techniques.

연구 동기 및 목표

  • 랜덤 포레스트 초모수 튜닝이 예측 구간의 신뢰성과 너비를 향상시키는지 조사하기.
  • 예측 구간 구성의 맥락에서 랜덤 포레스트 튜닝을 위한 여덟 가지 검증 기법을 평가하기.
  • 최적의 튜닝 전략을 자동으로 선택하는 메타검증 기법을 개발하고 검증하기.
  • 데이터셋 순서와 시간 민감성의 영향을 검증 기법 성능에 미치는 영향 평가하기.
  • 산업 소프트웨어 분석에서 예측 구간을 위한 최적의 랜덤 포레스트 구성 선택을 위한 실용적이고 데이터 기반의 방법 제공하기.

제안 방법

  • 연구는 키마인 인크.에서 제공한 후기 결함 예측용 실세계 데이터셋과 투쿠투쿠 프로젝트에서 제공한 웹 노력 추정용 실세계 데이터셋을 사용한다.
  • 다양한 검증 기법을 사용하여 여러 구성에서 단일 초모수(최대 기능 수, max_features)를 완전 탐색을 통해 튜닝한다.
  • 여덟 가지 검증 기법을 평가한다: 50/50 할당, 75/25 할당, 66/33 할당, 시계열 교차검증, 시계열 HV 교차검증, 부트스트랩, 비반복 할당의 두 변형.
  • 각 데이터셋에 대해 가장 우수한 성능을 보이는 검증 방법을 자동으로 선택하기 위해 세 가지 메타검증 기법을 제안한다.
  • 성능는 커버리지(실제 신뢰도), 명시된 신뢰도(명시된 신뢰도), 및 구간 너비로 측정되며, 신뢰성은 커버리지 ≥ 명시된 신뢰도로 정의된다.
  • 75/25 할당 메타검증 기법을 사용하여 최적의 검증 방법을 선택함으로써 데이터셋 간 일관된 향상이 보장된다.

실험 결과

연구 질문

  • RQ1랜덤 포레스트 튜닝에 사용될 경우, 어떤 검증 기법이 예측 구간을 동시에 신뢰성 있고 좁게 만드는가?
  • RQ2메타검증 기법은 예측 구간 튜닝에 가장 효과적인 검증 방법을 자동으로 선택할 수 있는가?
  • RQ3데이터셋 순서와 시간 민감성이 다양한 검증 기법의 성능에 영향을 미치는가?
  • RQ4기본 설정 대비 랜덤 포레스트 초모수 튜닝이 예측 구간의 신뢰성과 너비를 향상시키는가?
  • RQ575/25 할당 검증 기법은 다양한 소프트웨어 분석 데이터셋에서 일관되게 우수한가?

주요 결과

  • 기본 랜덤 포레스트 설정은 자주 신뢰할 수 없는 예측 구간을 생성하며, 커버리지가 명시된 신뢰도 수준에 미치지 못한다.
  • 50/50 할당 및 부트스트랩을 포함한 대부분의 표준 검증 기법은 오히려 역효과를 나타내며, 일반적으로 더 넓거나 더 신뢰할 수 없는 구간을 초래한다.
  • 75/25 할당 검증 기법은 일관되게 유익하며, 다른 방법의 단점을 피함으로써 신뢰성 있고 좁은 예측 구간을 보장한다.
  • 제안된 메타검증 접근법은 최적의 튜닝 전략을 성공적으로 식별하였으며, 두 데이터셋 모두에서 75/25 할당이 최적의 선택으로 나타났다.
  • 메타검증을 통한 랜덤 포레스트 튜닝은 기본 설정 대비 예측 구간이 훨씬 더 신뢰성 있고 좁아진다.
  • 연구는 산업 데이터셋의 시간 민감성이 검증 성능에 영향을 미치며, 특히 순서를 유지하지 않는 기법인 부트스트랩의 경우 뚜렷하게 영향을 받는다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.