[论文解读] Inducing Distant Supervision in Suggestion Mining through Part-of-Speech Embeddings
本文提出两种基于大规模银标准数据集(源自wikiHow和Wikipedia)的远监督建议挖掘方法。引入了部分词性(POS)嵌入,其性能优于词嵌入,即使词汇量极小,仍取得了最高的F1分数,证明句法特征在建议分类中比词汇特征更具预测力。
Mining suggestion expressing sentences from a given text is a less investigated sentence classification task, and therefore lacks hand labeled benchmark datasets. In this work, we propose and evaluate two approaches for distant supervision in suggestion mining. The distant supervision is obtained through a large silver standard dataset, constructed using the text from wikiHow and Wikipedia. Both the approaches use a LSTM based neural network architecture to learn a classification model for suggestion mining, but vary in their method to use the silver standard dataset. The first approach directly trains the classifier using this dataset, while the second approach only learns word embeddings from this dataset. In the second approach, we also learn POS embeddings, which interestingly gives the best classification accuracy.
研究动机与目标
- 为解决建议挖掘缺乏大规模人工标注数据集的问题,这是训练鲁棒分类器的关键瓶颈。
- 探索利用从wikiHow(正样本)和Wikipedia(负样本)句子中自动构建的大规模银标准数据集进行远监督。
- 评估从银标准数据集中学习的POS嵌入是否能提升分类性能,优于传统词嵌入。
- 研究仅使用已学习的POS标签嵌入作为输入特征(不依赖词级表示)的有效性。
- 评估所提方法在旅游、软件和酒店评论等多样化领域的泛化能力。
提出的方法
- 通过从wikiHow(标记为建议)和Wikipedia(标记为非建议)中提取句子,构建大规模银标准数据集,形成Wiki建议数据集。
- 使用两种不同方法训练基于双向LSTM的分类器:(1)直接在银标准数据集上使用词嵌入进行训练;(2)先从银标准数据集中学习词嵌入和POS嵌入,再将其作为输入特征使用。
- 从银标准数据集中学习50维的POS嵌入(WiSE_p),将每个POS标签视为一个词元,并将其用作神经网络的输入特征。
- 在多个测试数据集上比较使用预训练GloVe词嵌入、自学习词嵌入(WiSE_w)和POS嵌入(WiSE_p)的模型性能。
- 应用t-SNE降维技术,可视化LSTM最后一层的句子表示,对比GloVe与WiSE_p嵌入的聚类模式。
- 在跨领域测试集(酒店、旅游、软件)上评估模型,以检验所学表示的泛化能力和鲁棒性。
实验结果
研究问题
- RQ1源自wikiHow和Wikipedia的大规模自动构建的银标准数据集能否有效作为建议挖掘的远监督来源?
- RQ2从银标准数据集中学习POS嵌入是否能带来优于学习词嵌入的分类性能?
- RQ3仅基于POS标记句子(使用POS嵌入)训练的分类器性能,与基于完整词语训练的分类器相比如何?
- RQ4POS嵌入在具有不同语言风格和建议表达模式的领域之间,其泛化能力如何?
- RQ5为何尽管词汇量显著更小,POS嵌入仍能优于词嵌入?
主要发现
- 基于POS嵌入的方法(WiSE_p)在所有测试数据集上均取得了最高的F1分数,优于两种词嵌入基线模型及直接训练方法。
- 在酒店评论数据集上,WiSE_p模型取得了0.53的F1分数,优于基于GloVe的模型,表现出对领域迁移的鲁棒性。
- 使用POS嵌入使t-SNE可视化中的句子表示更加紧凑和连贯,正样本仅形成两个主要聚类,表明句法泛化能力更强。
- 在使用WiSE_p嵌入时,仅在完整wiki数据集上训练并未显著提升性能,表明即使使用wiki数据集的小型、领域特定子集,也能获得有效的POS表示。
- WiSE_w(词嵌入)模型表现欠佳,原因在于训练集与测试集之间词汇重叠度低,凸显了在低资源环境下词级嵌入的局限性。
- 结果表明,通过POS嵌入编码的句法结构,是识别建议句比词汇内容更可靠的信号。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。