[论文解读] Correlated Random Measures
本文提出相关随机测度(correlated random measures),这是一种新颖的构造方法,通过引入由高斯过程诱导的原子权重之间的依赖关系,将完全随机测度(completely random measures)进行扩展,从而在贝叶斯非参数模型中灵活建模潜在分量之间的相关性。该方法通过捕捉诸如医疗状况共现等有意义的依赖关系,超越了传统模型的独立性假设,在文档、网页点击和电子健康记录数据上实现了更优的预测性能。
We develop correlated random measures, random measures where the atom weights can exhibit a flexible pattern of dependence, and use them to develop powerful hierarchical Bayesian nonparametric models. Hierarchical Bayesian nonparametric models are usually built from completely random measures, a Poisson-process-based construction in which the atom weights are independent. Completely random measures imply strong independence assumptions in the corresponding hierarchical model, and these assumptions are often misplaced in real-world settings. Correlated random measures address this limitation. They model correlation within the measure by using a Gaussian process in concert with the Poisson process. With correlated random measures, for example, we can develop a latent feature model for which we can infer both the properties of the latent features and their dependency pattern. We develop several other examples as well. We study a correlated random measure model of pairwise count data. We derive an efficient variational inference algorithm and show improved predictive performance on large datasets of documents, web clicks, and electronic health records. Supplementary materials for this article are available online.
研究动机与目标
- 为解决层次化贝叶斯非参数模型中假设分量权重独立所带来的局限性,此类假设常无法准确反映现实世界数据中的依赖关系。
- 开发一种通用框架,用于构建具有灵活、结构化相关性的分量权重的随机测度。
- 在文档、网页点击和电子健康记录等复杂高维数据的建模中,实现更优的预测性能和更丰富的可解释性。
- 通过引入高斯过程,将潜在相关性融入现有非参数模型(如泊松因子分解和β-Bernoulli过程)中。
- 提供一种高效的变分推断算法,以实现在大规模数据场景下的可扩展后验近似。
提出的方法
- 通过将泊松过程与映射潜在位置至原子权重的高斯过程相结合,构建相关随机测度,从而在不同分量之间引入依赖关系。
- 使用潜在核函数定义分量权重之间的协方差结构,实现对正相关、负相关或复杂相关关系的灵活建模。
- 将随机测度定义为位于潜在空间中的位置所索引的原子的叠加,其中权重从高斯过程抽取,并通过链接函数(如软阈值函数,softplus)变换以确保非负性。
- 为相关非参数泊松因子分解(CNPF)推导变分推断算法,采用均值场近似和随机优化以实现可扩展性。
- 通过调整似然函数和先验结构,将该框架适配至多种模型,包括相关β过程和相关二值潜在特征模型。
- 将DILN模型作为相关随机测度的归一化变体,将层次狄利克雷过程扩展为允许分量权重依赖的模型。
实验结果
研究问题
- RQ1我们能否在贝叶斯非参数模型中建模潜在分量之间的有意义相关性,例如共现的医疗诊断或频繁共同点击的研究论文?
- RQ2如何构建一种随机测度,使其在保持适当随机测度理论性质的同时,允许原子权重之间存在依赖关系?
- RQ3在真实世界数据(如文本、网页点击和电子健康记录)上,引入分量权重之间的相关性是否能提升预测性能?
- RQ4我们能否开发一种可扩展至大规模数据集的相关随机测度的高效推断算法?
- RQ5相关随机测度在捕捉可解释的、具有医学意义的模式方面,相较于标准完全随机测度表现如何?
主要发现
- 在ArXiv数据集上,相关非参数泊松因子分解(CNPF)模型在预测未见点击行为方面优于标准无相关模型,对保留数据的预测准确率更高。
- 在梅约诊所提供的电子健康记录数据上,该模型发现了具有医学意义的分量相关性,例如2型糖尿病与充血性心力衰竭之间、以及肥胖与2型糖尿病之间的相关性。
- 标准CNPF模型(采用软阈值函数链接)在所有数据集上均优于软阈值变体,表明其拟合效果更优且泛化能力更强。
- 该模型成功识别出具有高后验置信度的可解释潜在分量,如与抑郁、心力衰竭和癌症相关的诊断聚类。
- 相关随机测度框架通过变分方法实现可扩展推断,使其适用于包含数千名用户和项目的大型数据集。
- 该框架可推广至多种模型,包括相关β过程和二值潜在特征模型,展现出超越泊松因子分解的广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。