[论文解读] Bayesian Paragraph Vectors
本文提出贝叶斯段落向量(BPV),一种概率生成模型,通过引入贝叶斯推断来量化段落嵌入中的不确定性。通过将段落向量建模为具有后验分布的随机变量,该方法表明熵随文档长度减小,且使用变分推断捕捉不确定性可提升情感分析与释义检测任务的性能,优于传统的MAP估计。
Word2vec (Mikolov et al., 2013) has proven to be successful in natural language processing by capturing the semantic relationships between different words. Built on top of single-word embeddings, paragraph vectors (Le and Mikolov, 2014) find fixed-length representations for pieces of text with arbitrary lengths, such as documents, paragraphs, and sentences. In this work, we propose a novel interpretation for neural-network-based paragraph vectors by developing an unsupervised generative model whose maximum likelihood solution corresponds to traditional paragraph vectors. This probabilistic formulation allows us to go beyond point estimates of parameters and to perform Bayesian posterior inference. We find that the entropy of paragraph vectors decreases with the length of documents, and that information about posterior uncertainty improves performance in supervised learning tasks such as sentiment analysis and paraphrase detection.
研究动机与目标
- 开发段落向量的贝叶斯解释,以实现文本嵌入中不确定性的合理量化。
- 解决段落向量中点估计的局限性,尤其针对不确定性较高的短文档。
- 通过将后验不确定性融入特征表示,提升下游监督学习的性能。
- 验证段落向量中的不确定性随文档长度增加而降低。
- 在段落向量嵌入的背景下,比较变分推断与MAP估计的性能。
提出的方法
- 将贝叶斯跳跃语法模型(Barkan, 2017)扩展,引入具有高斯先验的文档特定段落向量作为潜在变量。
- 将文档中词对的似然建模为词嵌入与上下文向量(通过段落向量增强)点积的sigmoid函数。
- 使用变分推断(VI)近似段落向量的后验分布,以捕捉均值与方差。
- 采用带递减学习率的随机优化与负采样,以实现大规模语料的可扩展性。
- 从上下文窗口内局部词共现构建正样本对,负样本对则基于基于词频的噪声分布生成。
- 将段落向量的变分均值与标准差的拼接作为下游分类的输入特征。
实验结果
研究问题
- RQ1将段落向量建模为具有后验分布的随机变量,是否能产生比点估计更鲁棒的表示?
- RQ2段落向量的不确定性(熵)如何随文档长度变化?
- RQ3将后验不确定性纳入模型是否能提升情感分析与释义检测等监督NLP任务的性能?
- RQ4在下游任务准确率方面,不同推断方法(MAP、VI、HMC)的表现如何比较?
- RQ5段落向量的生成概率公式是否与短文本中不确定性经验直觉一致?
主要发现
- 段落向量的熵随文档长度增加而减小,证实较长文本产生更自信的嵌入。
- 变分推断(VI)在情感分析与释义检测任务中均优于最大后验(MAP)估计。
- 在IMDB数据集上,VI在情感分析中达到87.0%的测试准确率,高于MAP的86.9%。
- 在MSR释义语料库上,VI在释义检测中达到71.0%的准确率,高于MAP的70.0%。
- 段落向量的后验方差在短文档中更高,验证了模型捕捉不确定性的能力。
- 哈密顿蒙特卡洛(HMC)推断性能劣于VI,可能因采样过程中负样本固定导致过拟合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。