Skip to main content
QUICK REVIEW

[論文レビュー] MARE: Multi-Agents Collaboration Framework for Requirements Engineering

Dongming Jin, Zhi Jin|arXiv (Cornell University)|May 6, 2024
Service-Oriented Architecture and Web Services被引用数 4
ひとこと要約

MAREは、大規模言語モデル(LLM)を用いてエンドツーエンドの要件工学を自動化するマルチエージェント協調フレームワークである。MAREは、共有ワークスペースを通じて、ステークホルダー、収集者、モデラー、チェックヤー、ドキュメント作成者という5つの専門的エージェントを調整し、段階的に要件の抽出、モデリング、検証、仕様化を実行する。要件モデリングタスクにおいて、最先端のベースラインと比較してF1スコアで15.4%の向上を達成した。

ABSTRACT

Requirements Engineering (RE) is a critical phase in the software development process that generates requirements specifications from stakeholders' needs. Recently, deep learning techniques have been successful in several RE tasks. However, obtaining high-quality requirements specifications requires collaboration across multiple tasks and roles. In this paper, we propose an innovative framework called MARE, which leverages collaboration among large language models (LLMs) throughout the entire RE process. MARE divides the RE process into four tasks: elicitation, modeling, verification, and specification. Each task is conducted by engaging one or two specific agents and each agent can conduct several actions. MARE has five agents and nine actions. To facilitate collaboration between agents, MARE has designed a workspace for agents to upload their generated intermediate requirements artifacts and obtain the information they need. We conduct experiments on five public cases, one dataset, and four new cases created by this work. We compared MARE with three baselines using three widely used metrics for the generated requirements models. Experimental results show that MARE can generate more correct requirements models and outperform the state-of-the-art approaches by 15.4%. For the generated requirements specifications, we conduct a human evaluation in three aspects and provide insights about the quality

研究の動機と目的

  • 要件工学(RE)における自動化の断片化の課題に対処し、複数のREタスクを統合された協調フレームワークに統合すること。
  • REにおける単一タスクのLLMアプリケーションの限界を克服し、専門的エージェント間のタスク間連携を可能にすること。
  • 構造的なマルチエージェントワークフローを通じて、生成された要件モデルおよび仕様の品質と一貫性を向上させること。
  • 協調的LLMエージェントが個々のLLMよりも要件モデリングおよび仕様生成において優れていることを実証すること。

提案手法

  • MAREはREプロセスを4つのコアタスク(抽出、モデリング、検証、仕様化)に分解し、それぞれに専任のエージェントを割り当てる。
  • ステークホルダー、収集者、モデラー、チェックヤー、ドキュメント作成者という5つの専門的エージェントが、それぞれの役割とアクションを担う。
  • 共有ワークスペースによりエージェントが中間成果物をアップロードし、必要な情報をアクセス可能にすることで、調整と反復を促進する。
  • 各エージェントは、タスク固有のプロンプトと知識源(モデリングにはメタモデル、検証には受容基準、仕様化にはテンプレート)を用いたLLM(例:gpt-3.5-turbo)を利用する。
  • 反復的精錬を採用し、1つのエージェントの出力が次の段階にフィードバックされるため、各段階で一貫性と完全性が保証される。
  • 評価には、モデリングのための標準指標(P、R、F1)と、仕様の正しさ、完全性、一貫性についての人的評価を用いる。

実験結果

リサーチクエスチョン

  • RQ1RQ1: MAREは、多様なソフトウェアシステムにおいて、最先端のベースラインと比較して、高品質な要件モデルを効果的に生成できるか?
  • RQ2RQ2: 人的評価者による判断において、MAREは完全で正しく一貫性のある要件仕様をどれほど効果的に生成できるか?
  • RQ3RQ3: MAREのマルチエージェント協調フレームワークは、個々のLLMに比べ、要件モデリングタスクで優れているか?

主な発見

  • MAREは、3つの最先端のベースラインを上回り、gpt-3.5-turboを用いた場合、要件モデリングで平均してF1スコアが15.4%高い。
  • 5つの公開ケースにおいて、MAREは使用例図の平均F1をSOTA比23.9%向上、問題図で15.4%向上、ゴールモデルで0.6%向上した。
  • 人的評価では、MAREは平均スコアとして完全性0.98、正しさ1.92、一貫性1.98を達成し、優れた仕様品質を示した。
  • 完全性スコアは正しさと一貫性に比べてわずかに低く、評価者がセクションが不十分と感じたことと、LLMが長出力を切り詰めたことが原因とされた。
  • アブレーションスタディーにより、MAREの協調フレームワークが個々のLLMを上回ることが確認され、平均F1が1.1%高く、再現率が2%高く、正確率が0.2%高い結果となった。
  • 結果から、マルチエージェント協調は、個別にLLMを使用する場合と比較して、モデリングの正確性と仕様品質を顕著に向上させることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。