[论文解读] Training population selection for (breeding value) prediction
本文提出了一种计算高效的基于遗传算法的方法,通过在训练选择过程中整合测试集基因型信息,以选择基因组选择中的最优训练群体。通过使用Henderson的PEV的快速近似方法最小化预测误差方差,该方法在小样本训练集和结构化群体中,相较于随机抽样显著提升了预测准确性。
Training population selection for genomic selection has captured a great deal of interest in animal and plant breeding. In this article, we derive a computationally efficient statistic to measure the reliability of estimates of genetic breeding values for a fixed set of genotypes based on a given training set of genotypes and phenotypes. We adopt a genetic algorithm scheme to find a training set of certain size from a larger set of candidate genotypes that optimizes this reliability measure. Our results show that, compared to a random sample of the same size, phenotyping individuals selected by our method results in models with better accuracies. We implement the proposed training selection methodology on four data sets, namely, the arabidopsis, wheat, rice and the maize data sets. Our results indicate that dynamic model building process which uses genotypes of the individuals in the test sample into account while selecting the training individuals improves the performance of GS models.
研究动机与目标
- 通过优化训练群体选择,提升基因组估测育种值(GEBVs)的准确性。
- 解决当训练群体与测试群体在遗传上存在分歧或结构化时预测准确性低下的挑战。
- 开发一种计算高效的替代方法,以替代基于矩阵求逆的可靠性度量方法(如PEV和CD)。
- 在训练集选择过程中整合测试集基因型信息,以提升模型的泛化能力。
- 实现动态模型构建,即针对每个测试集优化训练集,从而在不同遗传背景中提升性能。
提出的方法
- 该方法使用遗传算法从候选集中选择训练个体,以最小化测试集的平均预测误差方差(PEV)。
- 推导出一种计算高效的Henderson PEV近似方法,避免昂贵的矩阵求逆运算。
- 该PEV近似基于基因组亲缘关系矩阵,并通过收缩参数δ考虑遗传力。
- 训练集的选择使得所构建的模型能最小化测试集中个体的PEV,而不仅限于候选集内部。
- 该方法将测试集基因型的领域知识整合到训练选择过程中,提升了模型的鲁棒性。
- 该方法在四个数据集(拟南芥、小麦、水稻、玉米)上进行了应用,涵盖不同的群体结构和性状遗传力。
实验结果
研究问题
- RQ1在训练群体选择过程中整合测试集基因型信息,是否能提升基因组选择中的预测准确性?
- RQ2所提出的PEV近似方法在计算效率和准确性方面,与传统的基于矩阵求逆的可靠性度量方法相比如何?
- RQ3使用遗传算法优化训练集选择,是否能比随机抽样带来更高的GEBV预测准确性,尤其是在小样本训练集下?
- RQ4在训练集与测试集在遗传上存在分歧的结构化群体中,该方法的有效性如何?
- RQ5一种动态模型构建方法——即针对每个测试集优化训练集——是否能提升在多样化遗传群体中的预测性能?
主要发现
- 所提出的方法在所有四个数据集(拟南芥、小麦、水稻、玉米)中均持续优于随机抽样,预测准确性更高。
- 在玉米数据集中,由于存在强烈的群体结构,使用该方法选择的训练集在跨群体预测时的准确性显著高于随机样本。
- 在小样本训练集规模下(例如,n_Train = 25),准确性提升最为显著,表明该方法在表型资源有限时具有重要价值。
- 使用遗传算法实现了对训练集选择空间的高效探索,无需穷举搜索即可获得高质量解。
- 该方法对收缩参数λ的变化具有鲁棒性,表明其在不同遗传力假设下均表现稳定。
- 结果支持动态模型构建的可行性,即针对每个测试集优化训练集,尤其在结构化或遗传差异较大的群体中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。