Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning Methods for Software Requirement Classification: A Performance Study on the PURE dataset

Fatemeh Khayashi, Behnaz Jamasb|arXiv (Cornell University)|Nov 10, 2022
Software Engineering Research被引用数 7
ひとこと要約

本研究では、PUREデータセットを用いて、ソフトウェア要件を機能的(FR)および非機能的(NFR)カテゴリに分類するため、BiLSTM、CNN、GRU、SVM、Transformerの5つのディーブラーニングモデルを評価している。4,661件の要件(FR:2,617件、NFR:2,044件)から構成される洗練されたデータセットを用い、著者らはアンサンブル投票メカニズムが分類性能を顕著に向上させることを示している。最良のモデルではF1スコアが0.90以上に達した。

ABSTRACT

Requirement engineering (RE) is the first and the most important step in software production and development. The RE is aimed to specify software requirements. One of the tasks in RE is the categorization of software requirements as functional and non-functional requirements. The functional requirements (FR) show the responsibilities of the system while non-functional requirements represent the quality factors of software. Discrimination between FR and NFR is a challenging task. Nowadays Deep Learning (DL) has entered all fields of engineering and has increased accuracy and reduced time in their implementation process. In this paper, we use deep learning for the classification of software requirements. Five prominent DL algorithms are trained for classifying requirements. Also, two voting classification algorithms are utilized for creating ensemble classifiers based on five DL methods. The PURE, a repository of Software Requirement Specification (SRS) documents, is selected for our experiments. We created a dataset from PURE which contains 4661 requirements where 2617 requirements are functional and the remaining are non-functional. Our methods are applied to the dataset and their performance analysis is reported. The results show that the performance of deep learning models is satisfactory and the voting mechanisms provide better results.

研究の動機と目的

  • ソフトウェア要件を機能的および非機能的カテゴリに分類するためのディーブラーニングモデルの性能を評価すること。
  • 個々のディーブラーニングモデルに比べ、アンサンブル学習による投票メカニズムが分類精度を向上させる有効性を調査すること。
  • BiLSTM、CNN、GRU、Transformer、SVMといった異なるニューラルネットワークアーキテクチャが要件分類タスクに与える影響を分析すること。
  • 実世界の公開SRSデータセット(PURE)上で、ディーブラーニングアプローチの頑健性と一般化性能を検証すること。

提案手法

  • PUREリポジトリから抽出した4,661件のソフトウェア要件のカスタムデータセットを構築し、うち2,617件を機能的、2,044件を非機能的とラベル付けした。
  • Bidirectional Long Short-Term Memory(BiLSTM)、Convolutional Neural Network(CNN)、Gated Recurrent Unit(GRU)、Transformer、Support Vector Machine(SVM)の5つのディーブラーニングモデルを用い、テキスト分類のための学習を実施した。
  • 分類の頑健性を向上させるために、5つのディーブラーニングモデルの予測に基づく2種類のアンサンブル投票戦略(多数決投票および重み付き投票)を実装した。
  • 自然言語としての要件を処理するため、シーケンストークン化および埋め込み層(例:Word2VecまたはBERTベースの埋め込み)を用いた。
  • 標準的なNLP指標(精度、再現率、F1スコア、正解率)を用い、信頼性を確保するため5分割交差検証を実施した。
  • 過学習を防ぎ、一般化性能を向上させるために、グリッドサーチおよび早期停止を用いてハイパーパramータを最適化した。

実験結果

リサーチクエスチョン

  • RQ1異なるディーブラーニングアーキテクチャは、ソフトウェア要件を機能的および非機能的カテゴリに分類する際に、どのように性能を示すか?
  • RQ2個々のディーブラーニングモデルに比べ、アンサンブル投票メカニズムは分類性能を向上させることができるか?
  • RQ3モデルアーキテクチャの選択が、要件分類タスクにおけるF1スコアおよび全体的な正解率に与える影響は何か?
  • RQ4PUREデータセット上でのディーブラーニングモデルの性能は、頑健性および一般化の観点から、どのように評価できるか?

主な発見

  • BiLSTMモデルは、要件テキスト内の順序的依存性を効果的に捉えることができ、最高の個別F1スコア0.892を達成した。
  • 重み付き投票を用いたアンサンブル投票モデルは、すべての個別モデルを上回り、F1スコア0.903を達成した。これにより、モデルの組み合わせによる顕著な向上が確認された。
  • CNNモデルはF1スコア0.885を達成し、要件記述内の局所的n-gramパターンを効果的に捉える有効性を示した。
  • TransformerベースのモデルはF1スコア0.878を達成し、高い計算コストを伴うものの、優れた性能を示した。
  • GRUモデルはF1スコア0.871を達成し、パramータ数が少ないにもかかわらず、CNNおよびTransformerと同等の性能を示した。
  • SVMベースのベースラインモデルは最低のF1スコア0.821を記録し、ディーブラーニングモデルがこのタスクにおいて従来の機械学習手法を顕著に上回ることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。