Skip to main content
QUICK REVIEW

[论文解读] Data analysis recipes: Choosing the binning for a histogram

David W. Hogg|ArXiv.org|Jul 30, 2008
Advanced Clustering Algorithms Research被引用 6
一句话总结

本文提出了一种非任意的直方图分箱方法,通过自助交叉验证似然函数优化箱宽和位置,以最大化对未来数据的预测能力。该方法可推广至任意维度,并通过在似然得分上进行网格搜索找到最优结果,有效平衡了欠拟合(粗箱)与过拟合(细箱)问题,优于任意分箱方法。

ABSTRACT

Data points are placed in bins when a histogram is created, but there is always a decision to be made about the number or width of the bins. This decision is often made arbitrarily or subjectively, but it need not be. A jackknife or leave-one-out cross-validation likelihood is defined and employed as a scalar objective function for optimization of the locations and widths of the bins. The objective is justified as being related to the histogram's usefulness for predicting future data. The method works for data or histograms of any dimensionality.

研究动机与目标

  • 解决数据可视化与分析中长期存在的直方图分箱主观或任意的问题。
  • 开发一种系统化、客观的分箱方法,以选择最优的箱宽和位置,从而最大化直方图对未来未见数据的预测能力。
  • 将该方法推广至多维数据及非均匀加权测量场景。
  • 提供一种计算上可行且鲁棒的替代方案,以取代现有的分箱方法(如Sturges法则或Freedman-Diaconis法则)。
  • 证明分箱可被优化,而无需依赖启发式方法或对数据分布形状的假设。

提出的方法

  • 定义一个模型概率密度函数,其中每个箱的概率与其加权计数加上平滑参数 α 成正比。
  • 使用留一法交叉验证(自助法)似然作为目标函数:L = Σ w_j * ln( (W_i + α - w_j) / (Δ_i * (Σ(W_k + α) - w_j)) ),对每个数据点 j 成立。
  • 通过网格搜索优化分箱参数(箱数、箱边界、相位及平滑参数 α),以最大化自助法似然。
  • 将分箱视为非参数密度估计问题,其中直方图是真实概率密度函数的分段常数近似。
  • 允许非均匀权重,并通过等宽或重叠箱将方法扩展至多维数据。
  • 使用自助法似然以避免过拟合:过细的箱会导致空箱或近空箱,从而降低似然值。

实验结果

研究问题

  • RQ1如何确定直方图的最优箱数与箱宽,以最大化对未来数据的预测准确性?
  • RQ2如何实现客观的分箱选择,而非主观或启发式方法?
  • RQ3是否可采用交叉验证方法优化多维数据的分箱?
  • RQ4平滑参数 α 的选择如何影响分箱优化的稳定性和性能?
  • RQ5分箱对新数据点似然的影响是什么?如何将其形式化为客观函数?

主要发现

  • 自助法似然方法成功识别出在模型复杂度与预测能力之间取得平衡的分箱配置,避免了过拟合与欠拟合。
  • 最优箱宽随样本量增加而减小,且在底层概率密度函数特征更窄时亦减小。
  • 该方法对平滑参数 α 的选择具有鲁棒性,但当大量箱为空或近乎为空时,敏感性增加。
  • 由于箱边界的穿越,似然函数具有不连续性,因此需要使用无需导数的优化技术(如网格搜索)。
  • 该方法可自然推广至多维数据,由于维度灾难的影响,高维下需要更粗的分箱。
  • 该方法优于任意分箱规则,并为核密度估计提供了一种系统化的替代方案,尤其在低至中等维度场景下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。