[论文解读] AIRIVA: A Deep Generative Model of Adaptive Immune Repertoires
AIRIVA 是一种深度生成模型,可学习 T 细胞受体(TCR) repertoire 的解耦、可解释的潜在表征,以分离系统性偏差(如疾病状态、HLA 类型和测序深度)。该模型可实现稳健的疾病关联预测,通过潜在变量干预生成计算反事实 repertoire,并识别出经外部数据验证的疾病特异性 TCR,其在 COVID-19 和 HSV-1/2 repertoire 上表现出更优性能。
Recent advances in immunomics have shown that T-cell receptor (TCR) signatures can accurately predict active or recent infection by leveraging the high specificity of TCR binding to disease antigens. However, the extreme diversity of the adaptive immune repertoire presents challenges in reliably identifying disease-specific TCRs. Population genetics and sequencing depth can also have strong systematic effects on repertoires, which requires careful consideration when developing diagnostic models. We present an Adaptive Immune Repertoire-Invariant Variational Autoencoder (AIRIVA), a generative model that learns a low-dimensional, interpretable, and compositional representation of TCR repertoires to disentangle such systematic effects in repertoires. We apply AIRIVA to two infectious disease case-studies: COVID-19 (natural infection and vaccination) and the Herpes Simplex Virus (HSV-1 and HSV-2), and empirically show that we can disentangle the individual disease signals. We further demonstrate AIRIVA's capability to: learn from unlabelled samples; generate in-silico TCR repertoires by intervening on the latent factors; and identify disease-associated TCRs validated using TCR annotations from external assay data.
研究动机与目标
- 为解决在高度多样化、稀疏且系统性偏差严重的适应性免疫 repertoire 中识别疾病特异性 TCR 的挑战。
- 开发一种半监督生成模型,学习与生物变量(如疾病标签、HLA 类型和测序深度)相关的解耦、可解释的潜在因子。
- 通过在潜在空间中干预潜在因子,实现计算反事实 TCR repertoire 的生成,以支持模型验证和 TCR-疾病关联发现。
- 通过利用未标注的 repertoire,特别是免疫组学中常见的样本量小、异质性高的队列,提升模型的鲁棒性和泛化能力。
- 使用外部 TCR 注释数据验证模型识别生物上有意义的 TCR-疾病关联的能力。
提出的方法
- AIRIVA 是一种具有因子化条件先验的变分自编码器,通过强制对齐潜在因子与生物变量(如疾病状态和 HLA 类型)实现解耦。
- 采用分类器引导的损失函数,通过将潜在因子与预测标签对齐来促进解耦,同时保持生成能力。
- 模型在带有部分标签的 TCR 计数数据上进行训练,支持从未标注 repertoire 中进行半监督学习,以提升泛化性能。
- 通过在潜在空间中干预特定潜在因子(如切换疾病状态)并解码生成合成 TCR repertoire,实现反事实 repertoire 的生成。
- 使用潜在空间投影和反事实一致性度量来验证解耦效果,并指导模型选择。
- 该框架支持条件生成和 CATE(条件平均处理效应)估计,用于识别与特定疾病状态相关的 TCR。
实验结果
研究问题
- RQ1深度生成模型能否学习 TCR repertoire 的解耦、可解释表征,以将疾病状态等生物因素与测序深度等技术混杂因素分离?
- RQ2在低数据场景下,AIRIVA 能在多大程度上通过利用未标注 TCR repertoire 提升疾病预测性能?
- RQ3AIRIVA 能否通过操纵潜在因子生成生物上合理的计算反事实 repertoire,且其结果是否与已知的 TCR-疾病关联一致?
- RQ4AIRIVA 识别疾病特异性 TCR 的能力如何,其预测结果能否通过外部 TCR 注释数据验证?
- RQ5AIRIVA 中的解耦表征学习是否能提升模型在多样化亚组中的鲁棒性,例如在 COVID-19 中区分自然感染与疫苗接种?
主要发现
- AIRIVA 有效解耦了 TCR repertoire 中的疾病信号,在区分 SARS-CoV-2 自然感染与疫苗接种状态方面表现出更强的鲁棒性。
- 通过利用未标注 repertoire,模型显著提升了标签预测性能,凸显其在样本量小、异质性高的免疫组学队列中的实用性。
- 生成的反事实 repertoire 在不同干预下保持一致,验证了模型通过潜在空间操作模拟真实生物学情景的能力。
- AIRIVA 成功识别出与 SARS-CoV-2 刺突蛋白和非刺突蛋白抗原相关的 TCR,其预测结果经外部 TCR 注释数据验证。
- 解耦的潜在因子支持可解释的诊断、纵向监测,并有助于识别用于细胞治疗开发的 TCR。
- AIRIVA 展现出在多标签场景下的可扩展潜力,包括感染性疾病谱系、HLA 分型和批次效应检测,其基础建立在强健的解耦与反事实生成能力之上。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。