Skip to main content
QUICK REVIEW

[論文レビュー] A Bug or a Suggestion? An Automatic Way to Label Issues

Yuxiang Zhu, Minxue Pan|arXiv (Cornell University)|Sep 3, 2019
Natural Language Processing Techniques参考文献 29被引用数 8
ひとこと要約

本稿では、多様なイssueトラッキングシステム(ITS)において、バグまたは非バグとしてのイssueを自動的に分類するため、注意機構を備えた双方向LSTM(ABLSTM)モデルとk-NNに基づく誤分類補正を組み合わせた手法を提案する。JiraおよびGitHubの120万件を超えるラベル付きイssueで訓練された本手法は、85.6%のF-measureを達成し、異種のITSプラットフォームにおけるバグ識別精度において、最先端の手法を著しく上回った。

ABSTRACT

More and more users and developers are using Issue Tracking Systems (ITSs) to report issues, including bugs, feature requests, enhancement suggestions, etc. Different information, however, is gathered from users when issues are reported on different ITSs, which presents considerable challenges for issue classification tools to work effectively across the ITSs. Besides, bugs often take higher priority when it comes to classifying the issues, while existing approaches to issue classification seldom focus on distinguishing bugs and the other non-bug issues, leading to suboptimal accuracy in bug identification. In this paper, we propose a deep learning-based approach to automatically identify bug-reporting issues across various ITSs. The approach implements the k-NN algorithm to detect and correct misclassifications in data extracted from the ITSs, and trains an attention-based bi-directional long short-term memory (ABLSTM) network using a dataset of over 1.2 million labelled issues to identify bug reports. Experimental evaluation shows that our approach achieved an F-measure of 85.6\% in distinguishing bugs and other issues, significantly outperforming the other benchmark and state-of-the-art approaches examined in the experiment.

研究の動機と目的

  • 異なるイssueトラッキングシステム(ITS)における一貫性のない、ノイズの多いイssueラベル、特に誤分類されたバグの課題に対処すること。
  • 既存のアプローチでしばしば無視される、イssue分類におけるバグ識別精度の向上を図ること。
  • 構造的メタデータを必要とせず、イssueタイトルのみを入力として用いることで、幅広い適用性を持つクロスプラットフォームでスケーラブルなソリューションを開発すること。
  • k-NNを用いて大規模なイssueデータセットにおける誤分類を補正し、モデルのロバスト性と識別力の向上を図ること。

提案手法

  • Jira(Apache、JBoss、Spring)および23の高品質なGitHubプロジェクト(17万件以上)から、120万件を超えるラベル付きイssueの大型スケールデータセットを収集した。
  • k-NNアルゴリズムを用いてデータセット内の誤分類されたイssueを検出し、補正することでノイズを低減し、トレーニングデータの品質を向上させた。
  • クリーニングされたデータセット上で、注意機構を備えた双方向LSTM(ABLSTM)ネットワークをトレーニングし、イssueを「バグ」または「非バグ」と分類した。
  • 構造的メタデータを必要とせず、イssueタイトルのみを入力特徴量として用いることで、異なるITSプラットフォームへの一般化を可能にした。
  • 2段階のパイプラインを採用した:(1) k-NNによるデータクリーニング、(2) ABLSTMを用いたエンドツーエンドのディープラーニング分類。
  • JiraおよびGitHubの統合データセットを用いて、ベンチマークおよび最先端の手法と比較して本手法の性能を検証した。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、異種のイssueトラッキングシステム間で、バグレポートと非バグイssueを効果的に区別できるか?
  • RQ2k-NNに基づく誤分類補正は、イssue分類のトレーニングデータ品質の向上にどの程度効果的か?
  • RQ3ABLSTMモデルは、既存の最先端手法および従来の機械学習手法よりも、バグ識別におけるF-measureで優れているか?
  • RQ4イssueタイトルのみでトレーニングされたモデルが、多様なITSプラットフォームでどの程度高い性能を達成できるか?

主な発見

  • 提案されたABLSTMモデルは、バグと非バグイssueを区別する際、85.6%のF-measureを達成し、ベンチマークおよび最先端の手法を著しく上回った。
  • k-NNに基づく誤分類補正ステップは、トレーニングデータのノイズ低減に効果的であり、モデルの識別力と一般化性能の向上に寄与した。
  • モデルは強力なクロスプラットフォーム一般化性能を示し、構造的メタデータを必要とせず、イssueタイトルのみを入力として用いることで、JiraおよびGitHubのITSで良好な性能を発揮した。
  • 本手法は、複雑な特徴工学やレポーターの背景、イssueの深刻度などの追加メタデータを用いた先行研究と比較しても優れた性能を達成した。
  • 実証的評価により、モデルの性能が異なるプロジェクトタイプやイssueラベル品質の違いに対しても、ロバストで一貫性があることが確認された。
  • 本研究は、イssue分類におけるデータ品質の重要性を浮き彫りにした。誤ってラベル付けされたイssueを是正することで、F-measureに明確な向上が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。