[论文解读] Improved Sentence Modeling using Suffix Bidirectional LSTM
本文提出了一种新型RNN架构——后缀双向LSTM(SuBiLSTM),通过在正向和反向方向上联合编码每个标记的前缀和后缀,增强了长距离依赖建模能力。通过最大池化合并这些表示,SuBiLSTM在细粒度情感分类和问题分类等句子建模任务上实现了最先进性能,且无需修改下游模型架构即可超越标准BiLSTM。
Recurrent neural networks have become ubiquitous in computing representations of sequential data, especially textual data in natural language processing. In particular, Bidirectional LSTMs are at the heart of several neural models achieving state-of-the-art performance in a wide variety of tasks in NLP. However, BiLSTMs are known to suffer from sequential bias - the contextual representation of a token is heavily influenced by tokens close to it in a sentence. We propose a general and effective improvement to the BiLSTM model which encodes each suffix and prefix of a sequence of tokens in both forward and reverse directions. We call our model Suffix Bidirectional LSTM or SuBiLSTM. This introduces an alternate bias that favors long range dependencies. We apply SuBiLSTMs to several tasks that require sentence modeling. We demonstrate that using SuBiLSTM instead of a BiLSTM in existing models leads to improvements in performance in learning general sentence representations, text classification, textual entailment and paraphrase detection. Using SuBiLSTM we achieve new state-of-the-art results for fine-grained sentiment classification and question classification.
研究动机与目标
- 解决BiLSTM中的序列偏差问题,即上下文表示过度受附近标记的影响。
- 改进序列数据中长距离依赖关系的建模,特别是在自然语言处理任务中。
- 开发一种通用的、可即插即用的BiLSTM替代方案,提升句子级表示能力,而无需修改现有模型架构。
- 在多种自然语言处理任务中(包括文本分类和文本蕴含)证明SuBiLSTM的有效性。
提出的方法
- 对于序列中的每个标记,SuBiLSTM使用独立的LSTM计算四种上下文表示:正向前缀、正向后缀、反向前缀和反向后缀。
- 正向后缀编码(从标记i到序列末尾)引入了对长距离依赖关系的偏向,因为它处理的是距离当前位置更远的标记。
- 反向前缀编码(从标记i开始以相反顺序到序列开头)同样强调了远处的左侧上下文。
- 每个标记的最终上下文表示通过对其前缀和后缀在正向与反向方向上的表示进行最大池化得到。
- 提出了两种变体:非绑定(前缀和后缀分别使用独立LSTM)和绑定(每个方向共享前缀和后缀的LSTM),从而减少参数量并提升泛化能力。
- 该模型可作为现有基于BiLSTM架构的即插即用替代品,无需修改模型其余部分。
实验结果
研究问题
- RQ1在RNN中显式编码前后缀的双向信息是否能改善长距离依赖关系建模?
- RQ2所提出的SuBiLSTM架构是否在捕捉句子级任务的上下文信息方面优于标准BiLSTM?
- RQ3在性能和参数效率方面,SuBiLSTM的绑定变体与非绑定变体相比如何?
- RQ4SuBiLSTM是否能在文本分类和释义检测等句子建模任务中实现最先进性能?
主要发现
- 在QUORA释义检测数据集上,SuBiLSTM实现了88.2%的新最先进准确率,与更复杂的注意力机制模型(BiMPM)持平。
- 在TREC问题分类数据集上,SuBiLSTM达到95.8%的准确率,超越了之前的最先进结果。
- 在SST-2数据集的细粒度情感分类任务中,SuBiLSTM达到92.1%的准确率,创下新最先进水平。
- 在较小数据集(SST和TREC)上,SuBiLSTM的绑定版本表现更优,可能得益于共享参数带来的正则化效果。
- 在较大数据集(SNLI和QUORA)上,非绑定版本略胜于绑定版本,得益于其更高的模型容量。
- 性能提升在多个任务中保持一致,包括通用句子表示、文本分类、文本蕴含和释义检测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。