Skip to main content
QUICK REVIEW

[论文解读] Scale Reliant Inference

Michelle Pistner Nixon, McGovern, Kyle C.|arXiv (Cornell University)|Jan 10, 2022
Statistical Methods and Bayesian Inference被引用 11
一句话总结

本文提出了尺度依赖推断(SRI),一种针对缺乏尺度信息的多变量数据的正式统计框架——这类数据在基因组学、生态学和社会科学中普遍存在。研究证明,在SRI框架下,标准推断准则(如一致性与无偏性)在根本上不可实现,且常见归一化方法会引入未被察觉的偏差,且随着数据量增加而加剧。作者提出尺度模拟随机变量(SSRVs)作为严格且计算高效的手段,用于量化尺度不确定性并实现有效的推断。

ABSTRACT

Many scientific fields, including human gut microbiome science, collect multivariate count data where the sum of the counts is unrelated to the scale of the underlying system being measured (e.g., total microbial load in a subject's colon). This disconnect complicates downstream analyses such as differential analysis in case-control studies. This article is motivated by a novel study of in vitro human gut microbiome models. Popular tools for analyzing these data led to dramatically elevated rates of both false positives and false negatives. To understand those failures, we provide a formal problem statement that frames these challenges of scale in terms of the classical theory of identifiability. We call this the problem of Scale Reliant Inference (SRI). We use this formulation to prove fundamental limits on SRI in terms of criteria such as consistency and type-I error control. We show that the failures of existing methods stem from a fundamental failure to properly quantify uncertainty in the system scale. We demonstrate that a particular type of Bayesian model called a Bayesian Partially Identified Model (PIMs) can correctly quantify uncertainty in SRI. We introduce Scale Simulation Random Variables (SSRVs) as a flexible and efficient approach to specifying and inferring Bayesian PIMs. In the context of both real and simulated data, we find SSRVs drastically decrease type-I and type-II error rates.

研究动机与目标

  • 为缺乏尺度信息的多变量数据推断建立统一的统计问题陈述,适用于基因组学、生态学和社会科学。
  • 识别在SRI下统计推断的根本限制,表明一致性、无偏性和校准等标准准则不可实现。
  • 揭示微生物组和测序数据中常见数据归一化实践的危险性,这些方法隐含假设对系统尺度拥有无限知识,从而引入未被察觉的偏差。
  • 开发一类新模型——尺度模拟随机变量(SSRVs),以严格处理尺度不确定性并实现有效的统计推断。
  • 提供实用工具与敏感性分析,评估结论如何依赖于对系统尺度的假设,特别是在具有部分尺度信息的真实组成性调查中。

提出的方法

  • 将SRI形式化为可识别性问题,即由于观测数据中缺少尺度信息,导致估计量无法唯一确定。
  • 将SRI重新表述为概率可识别性问题,从而能够对尺度不确定性下的推断根本限制进行理论分析。
  • 引入尺度模拟随机变量(SSRVs),这是一类灵活的模型,通过模拟合理的尺度值来量化无尺度数据中的不确定性。
  • 在SSRV框架内采用贝叶斯分层建模,将尺度不确定性传播至下游推断,确保有效的不确定性量化。
  • 采用敏感性分析评估在不同尺度假设下结论的变化情况,从而在实践中实现稳健性检验。
  • 将SSRV框架应用于微生物组和生态学研究中的真实与模拟数据,证明其在误差控制方面优于标准归一化方法。

实验结果

研究问题

  • RQ1当多变量数据中缺失尺度信息时,统计推断的根本限制是什么?
  • RQ2为何在微生物组和测序数据分析中常见的数据归一化方法会导致未被察觉的偏差?这种偏差为何随样本量增加而加剧?
  • RQ3在何种条件下,标准统计方法(如DESeq2或ALDEx2)可在存在尺度不确定性的情况下实现有效推断?
  • RQ4如何严格量化并传播系统尺度的不确定性,以确保有效推断?
  • RQ5在现实世界组成性调查中,部分尺度测量在多大程度上影响SRI结论的有效性?这又该如何评估?

主要发现

  • 由于缺乏尺度信息导致估计量不可识别,标准推断准则(如一致性、无偏性和校准)在SRI中根本上不可实现。
  • 在16S rRNA测序数据分析中,常见归一化方法会引入未被察觉的偏差,因为其隐含假设了对系统尺度的完美知识,从而导致第一类和第二类错误率被夸大。
  • 未被察觉的偏差问题随着数据量增加而加剧,这与“更多数据总是改善推断”的传统观念相悖。
  • 所提出的SSRV框架通过显式建模和传播尺度不确定性,实现了有效的统计推断,从而获得更可靠的错误率和置信区间覆盖概率。
  • 基于SSRV的敏感性分析可量化结论对尺度假设的依赖程度,为真实数据应用中的稳健性评估提供了实用工具。
  • 即使在部分组成性调查中(即仅存在极少尺度信息),关于尺度依赖性的结论也极为依赖于所存在尺度信息的精确性质,而不仅仅是所提出的问题本身。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。