Skip to main content
QUICK REVIEW

[论文解读] Automated labeling of bugs and tickets using attention-based mechanisms in recurrent neural networks

Volodymyr Lyubinets, Taras Boiko|arXiv (Cornell University)|Jul 8, 2018
Topic Modeling参考文献 7被引用 4
一句话总结

本文提出了一种新颖的基于层次注意力机制的循环神经网络(RNN),采用门控循环单元(GRUs)和浅层辅助网络,用于软件错误和客服工单的自动化多类别标注。该方法在Chromium错误追踪数据集上取得了88.2%的准确率和0.879的F1分数,优于先前方法,并为未来在软件工程自然语言处理研究中提供了两个公开数据集。

ABSTRACT

We explore solutions for automated labeling of content in bug trackers and customer support systems. In order to do that, we classify content in terms of several criteria, such as priority or product area. In the first part of the paper, we provide an overview of existing methods used for text classification. These methods fall into two categories - the ones that rely on neural networks and the ones that don't. We evaluate results of several solutions of both kinds. In the second part of the paper we present our own recurrent neural network solution based on hierarchical attention paradigm. It consists of several Hierarchical Attention network blocks with varying Gated Recurrent Unit cell sizes and a complementary shallow network that goes alongside. Lastly, we evaluate above-mentioned methods when predicting fields from two datasets - Arch Linux bug tracker and Chromium bug tracker. Our contributions include a comprehensive benchmark between a variety of methods on relevant datasets; a novel solution that outperforms previous generation methods; and two new datasets that are made public for further research.

研究动机与目标

  • 为解决在优先级和产品区域等多个标准下,手动、耗时的软件错误和客户支持工单标注挑战。
  • 对经典方法(如TF-IDF结合SVM、朴素贝叶斯)与现代深度学习方法在真实软件与支持系统中的多类别文本分类任务进行基准测试。
  • 开发并评估一种新颖的基于层次注意力机制的RNN模型,采用GRU单元并结合互补的浅层网络,以提升分类性能。
  • 从Arch Linux和Chromium错误追踪器中发布两个全新的公开数据集,以支持未来在自动化软件问题分类方面的研究。

提出的方法

  • 采用分层注意力机制,结合多层堆叠的门控循环单元(GRUs),在词和句子两个层次上建模文本。
  • 使用Word2Vec训练的词嵌入表示输入文本,以有效学习语义表征。
  • 引入一个浅层前馈网络作为主RNN的互补分支,以增强特征表示并改善泛化能力。
  • 在RNN与全连接层之间应用dropout正则化以减少过拟合,dropout率为0.5。
  • 使用RMSprop算法进行模型优化,并通过网格搜索调整初始学习率。
  • 在两个真实世界数据集(Arch Linux和Chromium错误追踪器)上端到端训练模型,其中15%的数据保留用于测试。

实验结果

研究问题

  • RQ1经典文本分类方法(如朴素贝叶斯和TF-IDF结合SVM)与现代深度学习方法在分类软件问题标签方面的表现如何比较?
  • RQ2基于GRU单元的层次注意力RNN模型结合浅层辅助网络,是否能在多类别错误与工单标注任务中超越现有最先进模型?
  • RQ3注意力机制和残差连接等架构组件对错误追踪器中低资源、结构化文本的分类性能有何影响?
  • RQ4不同超参数(如dropout率和学习率)如何影响模型在真实世界软件问题数据集上的泛化能力和鲁棒性?
  • RQ5所提出的模型在不同领域(如Linux内核问题和Chromium功能请求)之间的泛化能力如何?

主要发现

  • 所提出的基于GRU的层次注意力RNN结合浅层网络,在Arch Linux错误追踪器数据集上的优先级分类任务(9个类别)中取得了69.1%的准确率和0.579的F1分数,优于所有基线方法。
  • 在Chromium错误追踪器数据集上的类型分类任务(3个类别)中,模型达到了88.2%的准确率和0.879的F1分数,显著优于次佳方法(DeepTriage)6.6个百分点的准确率。
  • 经典方法如TF-IDF结合SVM在Arch Linux优先级分类任务中取得了较强结果(准确率为65.0%),表明其在低资源场景下仍具相关性。
  • 朴素贝叶斯在多类别任务中表现较差,在Arch Linux优先级分类中仅取得51.6%的准确率,证实其在复杂分类场景中的局限性。
  • 该模型在Chromium数据集上表现优异,但在Arch Linux的产物区域分类(16个类别)中表现欠佳,表明细粒度分类存在领域特定挑战。
  • 本研究发布了来自Arch Linux和Chromium错误追踪器的两个全新公开数据集,为未来在软件工程中自然语言处理的基准测试与可复现性研究提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。