[論文レビュー] Automated labeling of bugs and tickets using attention-based mechanisms in recurrent neural networks
本稿では、ゲート付き再帰型ニューラルネットワーク(GRUs)と浅い補助ネットワークを備えた、階層的アテンションに基づく新しい再帰型ニューラルネットワーク(RNN)を提案する。このモデルは、ソフトウェアバグおよびサポートチケットの自動多クラスラベル付けを実現し、Chromiumバグトラッカー・データセットで88.2%の精度と0.879のF1スコアを達成し、既存手法を上回る性能を示した。また、ソフトウェア工学における自然言語処理の今後の研究を支援するため、2つの公開可能なデータセットを提供した。
We explore solutions for automated labeling of content in bug trackers and customer support systems. In order to do that, we classify content in terms of several criteria, such as priority or product area. In the first part of the paper, we provide an overview of existing methods used for text classification. These methods fall into two categories - the ones that rely on neural networks and the ones that don't. We evaluate results of several solutions of both kinds. In the second part of the paper we present our own recurrent neural network solution based on hierarchical attention paradigm. It consists of several Hierarchical Attention network blocks with varying Gated Recurrent Unit cell sizes and a complementary shallow network that goes alongside. Lastly, we evaluate above-mentioned methods when predicting fields from two datasets - Arch Linux bug tracker and Chromium bug tracker. Our contributions include a comprehensive benchmark between a variety of methods on relevant datasets; a novel solution that outperforms previous generation methods; and two new datasets that are made public for further research.
研究の動機と目的
- 優先度や製品分野など、複数の基準にわたるソフトウェアバグおよびカスタマーサポートチケットの手作業によるラベル付けの課題に対処すること。
- 実世界のソフトウェアおよびサポートシステムにおける多クラステキスト分類のための古典的手法(例:TF-IDFとSVM、ナイーブベイズ)と最新のディープラーニング手法をベンチマークすること。
- GRUセルと補助的な浅いネットワークを備えた、新しい階層的アテンションベースのRNNモデルを開発・評価し、分類性能の向上を図ること。
- 今後の研究を支援するため、Arch LinuxおよびChromiumバグトラッカーの2つの新しい公開データセットをリリースすること。
提案手法
- 単語レベルと文レベルの両方でテキストをモデル化するため、ゲート付き再帰ユニット(GRUs)を複数段重ねたブロックを用いた階層的アテンション機構を採用する。
- 入力テキストを表現するために、Word2Vecで学習された単語埋め込みを用い、意味的表現の効果的学習を可能にする。
- 主なRNNとは別に、特徴表現の強化と一般化性能の向上を目的とした、浅い順方向ネットワークを導入する。
- 過学習を軽減するために、RNNと全結合層の間にドロップアウト正則化を適用し、ドロップアウト率は0.5とした。
- グリッドサーチによる学習率の最適化を実施し、RMSpropアルゴリズムを用いてモデルを最適化する。
- 15%のデータをテスト用に予約し、実世界のデータセット(Arch LinuxおよびChromiumバグトラッカー)上で、モデルをエンドツーエンドで学習する。
実験結果
リサーチクエスチョン
- RQ1TF-IDFとSVM、ナイーブベイズなどの古典的手法は、ソフトウェア問題ラベルの分類において、最新のディープラーニング手法と比べてどのように性能を発揮するか?
- RQ2GRUセルと浅い補助ネットワークを備えた階層的アテンションベースのRNNは、既存の最先端モデルを上回る性能を示すことができるか?
- RQ3アテンション機構やリサイカル接続といったアーキテクチャ的要素が、バグトラッカーからの低リソースで構造化されたテキストにおける分類性能に与える影響は何か?
- RQ4ドロップアウト率や学習率といった異なるハイパーパrameterが、実世界のソフトウェア問題データセットにおけるモデルの一般化性能と耐性に与える影響は何か?
- RQ5提案されたモデルは、Linuxカーネルの問題やChromiumの機能要請といった、異なるドメイン間でどの程度一般化可能か?
主な発見
- 提案された階層的アテンションRNN(GRUsと浅いネットワークを併用)は、Arch Linuxバグトラッカー・データセット(優先度分類、9クラス)で69.1%の精度と0.579のF1スコアを達成し、すべてのベースラインを上回った。
- Chromiumバグトラッカー・データセット(タイプ分類、3クラス)では、88.2%の精度と0.879のF1スコアを達成し、次に良い手法(DeepTriage)と比べて6.6ポイントの精度向上を達成した。
- 古典的手法(TF-IDFとSVM)は、低リソース環境でも強力な結果(Arch Linux優先度分類で65.0%の精度)を示し、依然としてその有用性を保っていることがわかった。
- ナイーブベイズは多クラスタスクにおいては性能が低く、Arch Linux優先度分類で51.6%の精度にとどまり、複雑な分類状況における限界を確認した。
- モデルはChromiumデータセットでは優れた性能を示したが、Arch Linuxの製品分野分類(16クラス)では性能が低く、細分化された分類におけるドメイン固有の課題が浮き彫りになった。
- 本研究では、Arch LinuxおよびChromiumバグトラッカーから得た2つの新しい公開データセットをリリースし、今後のNLPを用いたソフトウェア問題分類のベンチマークと再現可能性を支援した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。