[论文解读] Mining Discourse Markers for Unsupervised Sentence Representation Learning
本文提出一种无监督方法,可从大规模网络规模文本中自动发现话语标记,构建了一个包含174个话语标记的大规模数据集,每个标记至少有10,000个样本。该方法使用基于模式的启发式规则与分布聚类技术,提取包含显式话语标记的句子对,进而用于训练句子嵌入模型,在迁移任务上达到最先进性能,但模型似乎更多依赖词汇线索而非句子间的语义关系。
Current state of the art systems in NLP heavily rely on manually annotated datasets, which are expensive to construct. Very little work adequately exploits unannotated data -- such as discourse markers between sentences -- mainly because of data sparseness and ineffective extraction methods. In the present work, we propose a method to automatically discover sentence pairs with relevant discourse markers, and apply it to massive amounts of data. Our resulting dataset contains 174 discourse markers with at least 10k examples each, even for rare markers such as coincidentally or amazingly We use the resulting data as supervision for learning transferable sentence embeddings. In addition, we show that even though sentence representation learning through prediction of discourse markers yields state of the art results across different transfer tasks, it is not clear that our models made use of the semantic relation between sentences, thus leaving room for further improvements. Our datasets are publicly available (https://github.com/synapse-developpement/Discovery)
研究动机与目标
- 通过利用未标注的话语标记作为监督信号,解决人工标注NLP数据集中稀缺性和偏差问题。
- 从大规模文本中自动发现广泛且多样的话语标记,克服以往研究依赖小规模预定义标记列表的局限性。
- 评估话语标记预测是否真正捕捉了句子间的语义关系,而非仅依赖表面的词汇线索。
- 构建一个公开可用的大规模话语标记标注句子对数据集,用于训练和评估句子表征。
- 探究基于话语标记训练的模型是否真正利用了潜在的语义关系,还是仅利用了词汇模式。
提出的方法
- 该方法结合句法与分布模式,识别包含话语标记的句子对,利用依存句法分析与共现统计。
- 采用基于聚类的方法对语义相似的话语标记进行分组,实现对罕见及多词标记的发现。
- 通过模式匹配管道,基于句法模板与话语标记周围的词汇线索提取候选句子对。
- 所得数据集包含174个话语标记,每个标记至少有10,000个样本,即使对于罕见标记如'coincidentally'或'amazingly'也是如此。
- 使用对比学习目标训练句子嵌入,模型需从候选集中预测每对句子的正确话语标记。
- 该方法引入了顺序打乱扰动技术,以探测模型是否依赖句子间关系,还是仅依赖词汇特征。
实验结果
研究问题
- RQ1能否从未标注文本中大规模自动发现话语标记,包括罕见或复合形式的标记?
- RQ2通过话语标记预测训练句子表征是否能带来优于现有无监督方法的迁移性能?
- RQ3基于话语标记训练的模型在多大程度上依赖句子间的语义关系,而非仅利用简单的词汇模式?
- RQ4话语标记预测带来的性能提升是源于高层次推理,还是表面线索?
- RQ5包含'简单'样本(如具有明显词汇线索的样本)如何影响句子表征的泛化能力?
主要发现
- 该方法成功发现了174个话语标记,每个标记至少有10,000个样本,包括'coincidentally'和'amazingly'等罕见标记,显著扩展了先前数据集的规模。
- 所训练的句子嵌入在SentEval基准的14项迁移学习任务中,有12项达到最先进性能,优于InferSent和QuickThought等模型。
- 在粗粒度PDTB隐式话语关系任务上,模型达到52.5%的准确率,超过先前方法。
- 训练过程中打乱句子顺序对性能影响极小,表明模型更依赖词汇特征而非句子间的语义关系。
- 移除'简单'样本(如具有明显词汇线索的样本)会显著降低迁移性能,表明此类样本对泛化至关重要。
- 尽管取得了最先进结果,分析表明模型并未实质性地利用句子间的语义关系,表明在关系感知表征学习方面仍有改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。