[논문 리뷰] Data analysis recipes: Choosing the binning for a histogram
이 논문은 향후 데이터의 예측 능력을 최대화하기 위해 예측 가능성의 균형을 맞추기 위해 교차검증 가능도를 사용하여 히스토GRAM의 bin 너비와 위치를 비의도적인 방법으로 선택하는 방법을 제안한다. 이 방법은 임의의 차원으로 일반화 가능하며, 굵은 bin(과소적합)과 미세한 bin(과적합) 사이의 균형을 맞추어, 가능도 점수에 대한 격자 탐색을 통해 최적의 결과를 도출한다.
Data points are placed in bins when a histogram is created, but there is always a decision to be made about the number or width of the bins. This decision is often made arbitrarily or subjectively, but it need not be. A jackknife or leave-one-out cross-validation likelihood is defined and employed as a scalar objective function for optimization of the locations and widths of the bins. The objective is justified as being related to the histogram's usefulness for predicting future data. The method works for data or histograms of any dimensionality.
연구 동기 및 목표
- 데이터 분석에서 오랫동안 지속된 히스토GRAM의 임의적 또는 주관적인 binning 문제를 해결하기 위해.
- 미래의 데이터에 대한 히스토GRAM의 예측 능력을 최대화하는 원칙적이고 객관적인 방법으로 bin 너비와 위치를 선택하기 위해.
- 이를 다차원 데이터와 비균일 가중치를 가진 측정치로 일반화하기 위해.
- 기존의 binning 방법(예: 슈르지스의 법칙 또는 프리드먼-다이아코니스)에 비해 계산적으로 실현 가능하고 강건한 대안을 제공하기 위해.
- 히스토GRAM의 binning이 히ュ리스틱이나 데이터 분포 형태에 대한 가정 없이 최적화될 수 있음을 보여주기 위해.
제안 방법
- 각 bin의 확률이 그 가중치를 가진 카운트에 비례하고 스무딩 매개변수 α를 더한 모델 확률 밀도 함수를 정의한다.
- 목적 함수로 이탈한 하나의 관측치를 제외한 교차검증(잔디커스) 가능도를 사용한다: L = Σ w_j * ln( (W_i + α - w_j) / (Δ_i * (Σ(W_k + α) - w_j)) ) 각 데이터 포인트 j에 대해.
- 가능도 점수에 대한 격자 탐색을 통해 binning 파라미터(bin의 수, bin 경계, 단계, 스무딩 α)를 최적화한다.
- 히스토그램을 진짜 PDF의 조각별 일정한 근사로 간주하여 비모수 밀도 추정 문제로 간주한다.
- 비균일 가중치를 허용하고, 동일한 너비 또는 겹치는 bin을 사용하여 다차원 데이터로 방법을 확장한다.
- 과적합을 방지하기 위해 잔디커스 가능도를 사용한다: 너무 미세한 bin은 빈 또는 거의 빈 bin으로 인해 가능도가 낮아진다.
실험 결과
연구 질문
- RQ1미래 데이터의 예측 정확도를 최대화하는 데 최적의 bin 수와 너비는 무엇인가?
- RQ2왜곡 없이 주관적이거나 히ュ리스틱적으로 binning을 선택할 수 있는가?
- RQ3교차검증 접근법을 사용하여 다차원 데이터의 binning을 최적화할 수 있는가?
- RQ4스무딩 매개변수 α의 선택이 binning 최적화의 안정성과 성능에 미치는 영향은 무엇인가?
- RQ5Binning이 새로운 데이터 포인트의 가능도에 미치는 영향은 무엇이며, 이를 목적 함수로 어떻게 수식화할 수 있는가?
주요 결과
- 잔디커스 가능도 방법은 모델 복잡성과 예측 능력 사이의 균형을 맞추는 binning 설정을 성공적으로 식별하며, 과적합과 과소적합을 모두 피한다.
- 표본 크기가 증가할수록, 또는 기저 확률 밀도 함수의 특징이 좁아질수록 최적의 bin 너비는 감소한다.
- 이 방법은 스무딩 매개변수 α의 선택에 대해 강건하지만, 많은 bin이 비어 있거나 거의 비어 있을 경우 민감도가 증가한다.
- 가능도 함수는 bin 경계를 넘는 순간에 불연속적이므로, 도함수 기반 최적화 기법 대신 격자 탐색과 같은 도함수 기반 최적화 기법이 필요하다.
- 이 방법은 다차원 데이터로 자연스럽게 일반화되며, 차원 수가 증가할수록 차원의 저주로 인해 더 굵은 binning이 필요하다.
- 이 방법은 임의의 binning 규칙보다 우수하며, 특히 저차원에서 중간 차원 설정에서 커널 밀도 추정에 비해 원칙적인 대안을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.