[论文解读] Hierarchical Dirichlet process for tracking complex topical structure evolution and its application to autism research literature
本文提出了一种基于层次狄利克雷过程(HDP)的框架,用于在纵向医学文献中发现并追踪随时间演化的主题,通过时间离散化的时间段和时间相似性图来建模主题的出现、演化、分裂、合并与消失。该方法应用于18,000余篇自闭症谱系障碍(ASD)相关文章(1970–2012年),揭示了研究重点的动态变化,例如遗传学和疫苗相关主题的兴起,并通过两个免费在线工具实现了语义导航。
In this paper we describe a novel framework for the discovery of the topical content of a data corpus, and the tracking of its complex structural changes across the temporal dimension. In contrast to previous work our model does not impose a prior on the rate at which documents are added to the corpus nor does it adopt the Markovian assumption which overly restricts the type of changes that the model can capture. Our key technical contribution is a framework based on (i) discretization of time into epochs, (ii) epoch-wise topic discovery using a hierarchical Dirichlet process-based model, and (iii) a temporal similarity graph which allows for the modelling of complex topic changes: emergence and disappearance, evolution, and splitting and merging. The power of the proposed framework is demonstrated on the medical literature corpus concerned with the autism spectrum disorder (ASD) - an increasingly important research subject of significant social and healthcare importance. In addition to the collected ASD literature corpus which we will make freely available, our contributions also include two free online tools we built as aids to ASD researchers. These can be used for semantically meaningful navigation and searching, as well as knowledge discovery from this large and rapidly growing corpus of literature.
研究动机与目标
- 解决分析快速增长、随时间演化的生物医学文献的挑战,特别是在自闭症研究中,手动导航已不可行。
- 克服静态主题模型的局限性,实现对主题出现、分裂、合并与消失等复杂时间动态的检测。
- 开发一种可扩展的非参数框架,无需假设固定的主题数量或马尔可夫时间依赖关系,即可推断主题结构及其演化。
- 为研究人员提供一个包含18,000余篇ASD相关文章的免费可访问语料库,以及两个用于语义导航和主题探索的交互式在线工具。
提出的方法
- 将语料库的时间维度离散化为重叠的时间段,以实现在时间区间内的局部主题建模。
- 在每个时间段内应用层次狄利克雷过程(HDP),自动发现数据驱动的主题数量,无需预先指定主题数量。
- 使用基于余弦相似度的度量方法,在连续时间段的主题分布之间构建主题间相似性图,以建模时间关系。
- 利用相似性图推断时间动态:主题出现(首次出现)、演化(渐进变化)、分裂(一个主题分化为多个)、合并(多个主题汇聚)和消失。
- 利用HDP的非参数特性,使主题复杂度可根据数据增长或减少,避免过拟合及对主题演化速率的先验假设。
- 将该框架集成到两个公共网络工具中:一个用于主题浏览与语义搜索,另一个用于可视化主题演化及其相互关系。
实验结果
研究问题
- RQ1如何在不假设固定主题数量或马尔可夫时间依赖关系的前提下,自动发现并追踪纵向生物医学文献语料库中主题的演化?
- RQ2在长达42年的跨度中,自闭症文献中的研究主题经历了哪些关键时间动态——如出现、分裂、合并与消失?
- RQ3所提出的框架能否以语义和时间上的准确性,检测并建模高影响力研究主题(如遗传学和与疫苗相关的自闭症研究)的演化?
- RQ4该框架在多大程度上能够支持对大规模、快速增长的科学文献中复杂主题结构进行有意义且交互式的探索?
主要发现
- 该框架成功识别出1996–2001年为“疫苗与自闭症”研究主题的出现时期,与Wakefield等人具有争议性的研究发表时间一致。
- 模型捕捉到在争议加剧期间,初始的“疫苗”主题分裂为多个子主题,反映出多样的研究方向。
- 该框架揭示了“遗传学”主题从早期的“婴儿期ASD”等概念演化而来,体现了研究主题的历史延续性。
- 与“16p11.2缺失”相关的主题被检测到在2000年代初出现,与已知的ASD遗传发现一致。
- 尽管缺乏科学证据,模型仍捕捉到“汞”和“疫苗”等先前独立的主题因公众对硫柳汞的担忧而合并为一个持续演化的主题。
- 该框架即使在最初主张被撤回后,仍能识别出持久且持续演化的主题,例如“疫苗”主题以修改形式持续存在。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。