[论文解读] A novel, divergence based, regression for compositional data
本文提出了一种基于分歧的回归方法,用于组成数据,使用Jensen-Shannon分歧的一个特例,该方法天然地处理零值而无需插补。该方法称为ES-OV回归,在零值较多的数据集中优于Aitchison的对数比回归,推荐在零值普遍存在时用于预测。
In compositional data, an observation is a vector with non-negative components which sum to a constant, typically 1. Data of this type arise in many areas, such as geology, archaeology, biology, economics and political science amongst others. The goal of this paper is to propose a new, divergence based, regression modelling technique for compositional data. To do so, a recently proved metric which is a special case of the Jensen-Shannon divergence is employed. A strong advantage of this new regression technique is that zeros are naturally handled. An example with real data and simulation studies are presented and are both compared with the log-ratio based regression suggested by Aitchison in 1986.
研究动机与目标
- 开发一种新的组成数据回归模型,天然处理零值,避免对零值进行插补。
- 解决传统基于对数比的回归方法(如Aitchison回归)在处理含大量零分量的组成数据时的局限性。
- 提出一种基于近期建立的Jensen-Shannon分歧导出的度量方法,适用于概率分布和组成数据。
- 通过真实数据和模拟研究,评估新方法相对于现有方法的性能。
- 为含高频率零分量的组成数据提供一种实用的、面向预测的回归工具。
提出的方法
- 该方法采用基于Jensen-Shannon分歧的分歧损失函数,具体使用Endres & Schindelin(2003)和Österreicher & Vajda(2003)提出的度量。
- 回归通过最小化观测值与拟合值组成之间的Kullback-Leibler分歧之和来实现,以中点分布作为参考。
- 模型使用对数线性链接函数,将线性预测器映射到单纯形,确保拟合值保持在概率单纯形上。
- 通过在对数比变换数据上使用普通最小二乘法获得优化的初始值,随后使用R中的nlm函数进行迭代最小化。
- 该方法在R中实现,包含一个自定义函数'esov.compreg',返回估计系数、偏差和拟合值。
- 该方法避免使用对数比,因此消除了数据中零分量带来的问题。
实验结果
研究问题
- RQ1能否开发一种基于分歧的回归模型,天然处理组成数据中的零值,而无需插补?
- RQ2在存在大量零分量的情况下,所提出的ES-OV回归与Aitchison对数比回归相比表现如何?
- RQ3当组成数据中零值比例较高时,新方法是否比现有方法提供更准确的预测?
- RQ4在回归中使用基于Jensen-Shannon度量的分歧损失函数,对组成数据有何实际影响?
- RQ5即使缺乏完整的渐近理论,该方法是否仍适用于预测?
主要发现
- ES-OV回归方法天然处理零值,避免了对数比方法所需的零值插补技术。
- 在含大量零分量的数据集中,ES-OV回归优于Aitchison回归,尤其在零值插补的EM算法失效时表现更优。
- 在涉及北极湖泊沉积物组成的实际数据示例中,ES-OV方法的拟合效果优于Aitchison回归。
- 模拟研究证实,当零分量频繁出现时,ES-OV方法提供的估计更稳健。
- 尽管缺乏完整的渐近理论,该方法仍推荐用于预测,尤其在数据中零值比例较高时。
- 在零值对传统对数比回归造成问题的情境下,该方法与现有方法相比具有竞争力或更优表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。