Skip to main content
QUICK REVIEW

[论文解读] Regression analysis with compositional data containing zero values

Michail Tsagris|arXiv (Cornell University)|Aug 8, 2015
Geochemistry and Geologic Mapping参考文献 13被引用 17
一句话总结

本文提出了一种针对含有零值的组成数据回归的 $α$-变换,避免了零值插补的需要。通过优化 $α$ 参数以最小化 Kullback-Leibler 散度,该方法在 $α$ 接近 1 时显著提升了预测精度,相较于标准的对数比变换,尤其在响应变量和预测变量中均能自然处理零值。

ABSTRACT

Regression analysis with compositional data containing zero values

研究动机与目标

  • 解决含有零值的组成数据回归分析的挑战,因为这些零值会使标准对数比变换失效。
  • 克服传统组成数据分析方法(如对数比和狄利克雷模型)中要求零值插补的局限性。
  • 通过使用数据驱动的幂变换而非固定对数比变换,提升回归中的预测精度。
  • 将 $α$-变换的应用扩展至组成数据作为预测变量的情形,而不仅限于响应变量。
  • 证明与等距对数比或加法对数比相比,其他变换可获得更好的预测性能,尤其当 $α$ 不为零时。

提出的方法

  • 应用基于数据的幂变换 $α$-变换,定义为 $\mathbf{u} = \left(\frac{x_1^\alpha}{\sum x_j^\alpha}, \ldots, \frac{x_D^\alpha}{\sum x_j^\alpha}\right)$,将组成数据映射到变换后的单纯形空间。
  • 使用线性变换 $\mathbf{z} = \frac{1}{\alpha} \mathbf{H}(D\mathbf{u} - \mathbf{j}_D)$,其中 $\mathbf{H}$ 为 Helmert 子矩阵,将变换后数据映射到 $\mathbb{R}^d$ 以进行回归分析。
  • 通过最小化观测值与拟合值之间的 Kullback-Leibler 散度来优化自由参数 $\alpha$,以提升预测精度。
  • 对于组成预测变量,对 $\alpha$-变换后的数据应用主成分回归(PCR),以处理多重共线性并提升预测性能。
  • 使用多元 logit 链接函数,确保回归建模过程中拟合值保持在单纯形空间内。
  • 通过调整决定系数(adjusted $R^2$)和均方预测误差(MSPE)等指标,将 $\alpha$-变换方法与标准等距对数比(ILR)和加法对数比(ALR)变换进行比较。

实验结果

研究问题

  • RQ1与标准对数比方法相比,基于数据的幂变换($\alpha$-变换)是否能提升含有零值的组成数据回归中的预测精度?
  • RQ2当组成数据中存在零值时,$\alpha$ 的选择如何影响预测性能?
  • RQ3$\alpha$-变换是否能自然地处理零值而无需插补,与传统对数比方法形成对比?
  • RQ4在 $\alpha$-变换后的组成预测变量上应用主成分回归,是否在预测精度上优于标准回归或基于 ILR 的 PCR?
  • RQ5在存在零值的情况下,$\alpha = 0$(即 ILR)与 $\alpha \approx 1$(即对数变换)之间是否存在显著的预测性能差异?

主要发现

  • 当 $\alpha = 1$ 时,调整决定系数(adjusted $R^2$)从 0.772 提升至 0.89,且均方预测误差(MSPE)相比 $\alpha = 0$ 减少了超过一半。
  • $\alpha$-变换在 $\alpha = 1$ 时的预测精度优于等距对数比变换($\alpha = 0$),即使在应用了零值插补的情况下也是如此。
  • 表现最佳的模型采用 $\alpha = 1$,并从 $\alpha$-变换后的数据中提取了 7 个主成分,同时引入了玻璃类别信息,实现了最低的 MSPE。
  • 稳健的插补方法并未提升性能,且使用 $\alpha = 0$ 时 MSPE 显著更高。
  • 残差空间中检测到异常值,但在主成分空间中未检测到,表明 $\alpha$-变换对异常值检测的影响与传统方法不同。
  • 残差的正态性假设被拒绝(p 值 < 0.001),但独立性假设在视觉上可接受,支持了模型预测有效性的合理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。