[论文解读] Locating the Source of Large-scale Diffusion of Foodborne Contamination
本文提出了一种基于概率的源定位方法,用于大规模食源性疾病暴发,通过将污染传播建模为加权有向食品供应网络上的吸收性随机游走。最大似然估计器考虑了所有可能的扩散路径,在真实2011年EHEC暴发案例中,其在第二周即识别出污染源区域,显著早于现有最先进方法和传统手段,展现出更高的准确性和及时性。
We study the problem of identifying the source of emerging large-scale outbreaks of foodborne disease. To solve the source identification problem we formulate a probabilistic model of the contamination diffusion process as a random walk on a network and derive the maximum likelihood estimator for the source location. By modeling the transmission process as a random walk, we are able to develop a novel, computationally tractable solution that accounts for all possible paths of travel through the network. This is in contrast to existing approaches to network source identification, which assume that the contamination travels along either the shortest or highest probability paths. We demonstrate the benefits of the multiple-paths approach through application to different network topologies, including stylized models of food supply network structure and real data from the 2011 EHEC outbreak in Germany. We show significant improvements in accuracy and reliability compared with the relevant state-of-the-art approach to source identification. Beyond foodborne disease, these methods should find application in identifying the source of spread in network-based diffusion processes more generally, including in networks not well approximated by tree-like structure.
研究动机与目标
- 解决在复杂全球化供应链中识别大规模食源性疾病暴发源头的关键挑战。
- 克服现有源定位方法的局限性,这些方法假设污染仅沿最短路径或最高概率路径传播。
- 在一般网络拓扑结构上开发一种计算上可行、概率上精确的估计器,不局限于树状结构。
- 通过实现更早且更可靠的源头识别,提升公共卫生响应效率。
- 利用模拟食品供应网络模型和2011年德国EHEC暴发的真实数据,验证该方法的有效性。
提出的方法
- 将污染扩散过程建模为加权有向网络上的吸收性随机游走,其中节点代表供应链参与者,边代表贸易流动。
- 通过计算在每个潜在源节点条件下观察到感染病例集合的概率,推导出源位置的最大似然估计器。
- 考虑网络中污染传播的所有可能路径,避免仅假设最短路径或最高概率路径的简化假设。
- 利用网络结构和病例数据,计算每个节点作为源的可能性,选择似然度最高的节点作为估计的源。
- 在合成网络拓扑结构和2011年EHEC暴发的真实食品供应网络数据上对方法进行验证。
- 采用概率框架,自然地处理不确定性以及复杂网络结构,包括环路和多重重叠路径。
实验结果
研究问题
- RQ1一种考虑所有可能污染路径的概率模型,是否能提升食源性疾病暴发中源定位的准确性?
- RQ2所提出的基于随机游走的估计器性能与假设仅沿最短或最高概率路径传播的现有最先进方法相比如何?
- RQ3该方法是否能在暴发时间线中更早识别出源头,特别是在流行病高峰之前?
- RQ4该方法在不同网络拓扑结构中是否保持可靠性,特别是具有非树状结构的网络?
- RQ5该方法在多大程度上可减少错误线索,提升暴发调查的效率?
主要发现
- 所提出的方法在第二周即识别出2011年EHEC暴发的污染源区域,显著早于标准调查流程(该流程直到第六周才确定源头)。
- 该方法在整个暴发期间持续准确估计出正确的源区域,而有效距离方法则表现不一致,尤其在第3至第4周之间。
- 该方法在模拟网络模型和真实食品供应网络数据上均表现出更优的准确性和鲁棒性,尤其在缺乏唯一主导路径的网络中。
- 通过考虑所有可能的扩散路径,该方法避免了先前方法中仅限制于最短或最高概率路径的不切实际假设。
- 结果表明,该方法可帮助调查人员更快缩小潜在源头的范围,减少对耗时的三角测量的依赖,并降低错误线索的数量。
- 该方法的性能通过一次重大暴发的真实数据得到验证,表明其在公共卫生调查中更接近实际应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。