[论文解读] Neural Topic Modeling with Bidirectional Adversarial Training
本文提出双向对抗主题模型(Bidirectional Adversarial Topic, BAT)及其扩展模型高斯-BAT(Gaussian-BAT),这是首个采用双向对抗训练的神经主题模型,用于学习文档-主题分布与文档-词分布之间的双向映射。通过引入狄利克雷先验和词嵌入,BAT与Gaussian-BAT在主题一致性方面达到当前最优水平,并在文本聚类任务中相比基线模型实现6%的准确率提升。
Recent years have witnessed a surge of interests of using neural topic models for automatic topic extraction from text, since they avoid the complicated mathematical derivations for model inference as in traditional topic models such as Latent Dirichlet Allocation (LDA). However, these models either typically assume improper prior (e.g. Gaussian or Logistic Normal) over latent topic space or could not infer topic distribution for a given document. To address these limitations, we propose a neural topic modeling approach, called Bidirectional Adversarial Topic (BAT) model, which represents the first attempt of applying bidirectional adversarial training for neural topic modeling. The proposed BAT builds a two-way projection between the document-topic distribution and the document-word distribution. It uses a generator to capture the semantic patterns from texts and an encoder for topic inference. Furthermore, to incorporate word relatedness information, the Bidirectional Adversarial Topic model with Gaussian (Gaussian-BAT) is extended from BAT. To verify the effectiveness of BAT and Gaussian-BAT, three benchmark corpora are used in our experiments. The experimental results show that BAT and Gaussian-BAT obtain more coherent topics, outperforming several competitive baselines. Moreover, when performing text clustering based on the extracted topics, our models outperform all the baselines, with more significant improvements achieved by Gaussian-BAT where an increase of near 6\% is observed in accuracy.
研究动机与目标
- 解决现有神经主题模型依赖不恰当先验(如高斯分布或逻辑斯蒂正态分布)的问题,这些先验无法捕捉多模态主题分布。
- 克服ATM等模型无法推断文档-主题分布的缺陷,从而限制其在文本聚类等下游任务中的应用。
- 利用预训练词嵌入中的词相关性信息,以提升主题语义质量。
- 构建一种双向对抗训练框架,联合优化文档-主题与文档-词分布映射。
- 在基准数据集上,实现优于当前最优神经主题模型的主题一致性与聚类性能。
提出的方法
- 提出一种双向对抗训练框架,其中生成器将文档-主题分布映射为文档-词分布,编码器则执行反向映射。
- 使用判别器区分真实与生成(虚假)的文档-主题与文档-词分布对,为生成器和编码器提供对抗性信号,以提升两者性能。
- 采用狄利克雷先验对主题建模,相比逻辑斯蒂正态先验,能更有效地捕捉多模态主题结构。
- 通过在生成器中将每个主题表示为多元高斯分布,将BAT扩展为Gaussian-BAT,从而利用词嵌入信息以增强语义建模能力。
- 采用对抗损失端到端训练模型,生成器与编码器通过反向传播联合优化。
- 将预训练词嵌入融入生成器,以建模词相关性,提升主题一致性。
实验结果
研究问题
- RQ1与单向或自编码方法相比,双向对抗训练是否能提升神经主题模型的主题建模质量?
- RQ2在神经框架中采用狄利克雷先验对主题建模,是否能产生比逻辑斯蒂正态或高斯先验更一致且可解释性更强的主题?
- RQ3在多大程度上,整合词嵌入信息能提升主题一致性与下游聚类性能?
- RQ4所提出的模型能否为新文档推断文档-主题分布,从而支持聚类与分类等实际应用?
- RQ5BAT与Gaussian-BAT在多个基准数据集上的性能与当前最优神经主题模型相比如何?
主要发现
- Gaussian-BAT在所有数据集与指标上均达到最高主题一致性,全面超越所有基线模型,包括LDA与ProdLDA。
- 在20Newsgroups数据集上,Gaussian-BAT相比第二好的模型(BAT)将文本聚类准确率提升近6%,达到41.25%。
- BAT在所有数据集与主题数设置下,主题一致性始终位列前两名,仅在20Newsgroups数据集上略逊于ProdLDA与LDA。
- 当主题数设为100时,Gaussian-BAT性能相比LDA略有下降,可能由于模型复杂度增加所致。
- Gaussian-BAT中使用词嵌入显著提升了主题语义质量,聚类性能的显著提升可证明这一点。
- 双向对抗训练框架实现了主题分布与词分布之间的有效双向映射,提升了模型的鲁棒性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。