[论文解读] On the Role of Text Preprocessing in Neural Network Architectures: An Evaluation Study on Text Categorization and Sentiment Analysis
本研究评估了常见文本预处理技术——分词、小写转换、词形还原和多词组合作——对使用卷积神经网络(CNN)进行文本分类和情感分析的神经网络模型的影响。结果表明,简单分词通常优于更复杂的预处理方法,而多词感知的词嵌入即使在原始分词输入上也能显著提升性能,凸显了预处理一致性的重要性以及预训练嵌入中多词训练被忽视的作用。
Text preprocessing is often the first step in the pipeline of a Natural Language Processing (NLP) system, with potential impact in its final performance. Despite its importance, text preprocessing has not received much attention in the deep learning literature. In this paper we investigate the impact of simple text preprocessing decisions (particularly tokenizing, lemmatizing, lowercasing and multiword grouping) on the performance of a standard neural text classifier. We perform an extensive evaluation on standard benchmarks from text categorization and sentiment analysis. While our experiments show that a simple tokenization of input text is generally adequate, they also highlight significant degrees of variability across preprocessing techniques. This reveals the importance of paying attention to this usually-overlooked step in the pipeline, particularly when comparing different models. Finally, our evaluation provides insights into the best preprocessing practices for training word embeddings.
研究动机与目标
- 调查基本文本预处理决策如何影响标准神经文本分类器的性能。
- 评估输入文本准备过程中的预处理选择是否影响模型的泛化能力和性能。
- 评估预处理对词嵌入及其在神经网络中下游性能的影响。
- 为文本分类任务提供最优预处理实践的实证指导。
- 强调在比较不同自然语言处理模型时,预处理一致性常被忽视的影响。
提出的方法
- 本研究评估了四种预处理技术:分词(原始)、小写转换、词形还原和多词分组,在标准文本分类基准数据集上的表现。
- 使用标准卷积神经网络(CNN)架构作为基线分类器,在多个用于文本分类和情感分析的数据集上进行实验。
- 实验在两种设置下进行:同预处理(输入与嵌入使用相同预处理)和跨预处理(输入与嵌入使用不同预处理)。
- 词嵌入使用不同预处理变体初始化:原始、小写转换、词形还原和多词分组语料。
- 通过在九个多样化数据集上的准确率来衡量性能,并应用显著性检验以识别有意义的差异。
- 分析包括消融研究,比较不同预处理变体及其与预训练嵌入的交互作用。
实验结果
研究问题
- RQ1不同文本预处理技术(如小写转换、词形还原、多词分组)如何影响基于标准CNN的文本分类器性能?
- RQ2为词嵌入训练语料库进行的预处理是否会影响神经文本分类器的最终性能?
- RQ3在神经文本分类中,复杂预处理技术是否始终优于简单分词?
- RQ4在跨预处理设置下,嵌入的预处理选择如何与输入预处理相互作用?
- RQ5在神经文本分类背景下,训练词嵌入的最有效预处理实践是什么?
主要发现
- 在大多数数据集中,简单分词(原始)的性能始终与或优于更复杂的预处理技术(如词形还原和小写转换)。
- 对词嵌入训练语料库进行多词分组预处理可显著提升性能,尤其在原始分词输入上表现最佳,在九个数据集中的七个中取得最优结果,使用单一CNN模型。
- 在跨预处理设置中,词形还原和小写转换因嵌入中对大写和词形变化形式的覆盖有限,导致性能下降。
- 在原始输入上使用多词感知嵌入,其性能优于在同一嵌入用于多词分组输入的情况,表明在训练期间隔离多词表达可提升泛化能力。
- 不同预处理选择导致的性能差异平均可达±2.4%,表明预处理具有显著影响,尤其在训练数据有限时。
- 研究结果表明,预训练Word2Vec嵌入的成功部分归因于其在多词表达上进行训练,这一因素在模型评估中常被忽视。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。