[论文解读] Inferring genotyping error rates from genotyped trios
本文提出一种基于似然的方法,利用孟德尔遗传规律和等位基因频率数据,从三联体基因分型数据中推断基因分型错误率,实现精确的最大似然估计。将该方法应用于23andMe的三联体数据,估计出的错误率为8.5 × 10⁻⁵(95% 置信区间:6.8–10.2 × 10⁻⁵),表明在个人基因组数据中基因分型具有很高的准确性。
Genotyping errors are known to influence the power of both family-based and case-control studies in the genetics of complex disease. Estimating genotyping error rate in a given dataset can be complex, but when family information is available error rates can be inferred from the patterns of Mendelian inheritance between parents and offspring. I introduce a novel likelihood-based method for calculating error rates from family data, given known allele frequencies. I apply this to an example dataset, demonstrating a low genotyping error rate in genotyping data from a personal genomics company.
研究动机与目标
- 开发一种稳健的统计方法,用于从家系三联体数据中估计基因分型错误率,解决现有孟德尔错误率度量方法的局限性。
- 将孟德尔不一致的基因分型与哈代-温伯格平衡下的基因型频率完整分布相结合,以改进错误率估计。
- 提供一种基于似然的框架,同时考虑易错基因分型和无错误位点的情况,以提高估计的准确性。
- 将该方法应用于某家个人基因组公司的真实世界数据,评估高通量基因分型平台中的基因分型质量。
提出的方法
- 该方法对三联体中N个位点的观测基因型与真实基因型的联合似然进行建模,整合孟德尔遗传规则与哈代-温伯格平衡下的基因型频率。
- 采用简化的错误模型,假设仅发生单个错误(忽略ε²及更高阶项),其中无错误的概率为(1−ε)⁶,发生一个错误的概率为ε(1−ε)⁵。
- 将似然函数划分为观测基因型与真实基因型匹配的项,以及存在一个基因型错误的项,通过预先计算基因型频率实现高效计算。
- 通过在错误率ε上优化似然函数,执行最大似然估计,利用预先计算的基因型频率项。
- 该方法利用外部来源(如HapMap 3 CEU数据)的等位基因频率,以提供哈代-温伯格平衡下基因型概率的先验信息。
- 通过标准似然轮廓法推导错误率的置信区间。
实验结果
研究问题
- RQ1与仅使用孟德尔错误率度量相比,基于似然的方法是否能改善基因分型错误率的估计?
- RQ2同时结合孟德尔不一致的基因分型与完整的基因型频率谱,如何提升错误率推断的准确性?
- RQ3在23andMe等个人基因组公司提供的高通量基因分型数据中,真实的基因分型错误率是多少?
- RQ4基因分型中的罕见错误在多大程度上影响遗传关联研究的统计功效与可靠性?
主要发现
- 该方法成功估计出23andMe三联体数据的基因分型错误率为8.5 × 10⁻⁵,基于715,566个变异位点及HapMap 3 CEU等位基因频率数据。
- 错误率的95%置信区间为6.8 × 10⁻⁵至10.2 × 10⁻⁵,表明估计具有高度精确性。
- 较低的错误率表明23andMe的基因分型平台保持了高准确性,这对可靠地开展病例对照关联研究至关重要。
- 该方法通过整合易错位点与无错误位点的信息,优于传统孟德尔错误率度量,显著提升了估计的稳健性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。