Skip to main content
QUICK REVIEW

[論文レビュー] Machine Learning Model Development from a Software Engineering Perspective: A Systematic Literature Review

Giuliano Lorenzoni, Paulo S. C. Alencar|arXiv (Cornell University)|Feb 15, 2021
Scientific Computing and Data Management参考文献 29被引用数 11
ひとこと要約

本系統的文献レビューでは、ソフトウェア工学(SE)の実践が、機械学習(ML)モデル開発を、確立されたSEライフサイクル段階と整合させることでどのように改善できるかを調査している。データ処理と特徴量工学が最も困難な段階であることが特定され、MLにおける構造的なSEプロセスの必要性が強調され、SE手法の採用が、特に大規模なAIシステムにおいて、モデルの品質、再利用可能性、スケーラビリティを向上させると提案している。

ABSTRACT

Data scientists often develop machine learning models to solve a variety of problems in the industry and academy but not without facing several challenges in terms of Model Development. The problems regarding Machine Learning Development involves the fact that such professionals do not realize that they usually perform ad-hoc practices that could be improved by the adoption of activities presented in the Software Engineering Development Lifecycle. Of course, since machine learning systems are different from traditional Software systems, some differences in their respective development processes are to be expected. In this context, this paper is an effort to investigate the challenges and practices that emerge during the development of ML models from the software engineering perspective by focusing on understanding how software developers could benefit from applying or adapting the traditional software engineering process to the Machine Learning workflow.

研究の動機と目的

  • 伝統的なソフトウェア工学(SE)ライフサイクル実践が、機械学習(ML)モデル開発をどのように改善できるかを調査すること。
  • 特にデータ集約的で反復的なワークフローにおいて、SEの視点からMLモデル開発における主な課題を特定すること。
  • 要件工学、バージョン管理、テスト、モジュラー化などのSE実践がMLシステムにどの程度適用可能かを分析すること。
  • SE原則に基づいて、既存のMLワークフローの成熟度と適用可能性を評価し、現在の研究と実務におけるギャップを同定すること。
  • 研究者および実務家がML開発におけるSE手法を統合することで、信頼性、保守可能性、スケーラビリティを向上させるための実行可能なイン사이트を提供すること。

提案手法

  • PRISMAガイドラインに従って、ML開発におけるSE実践に関する関連研究を同定・分析するための系統的文献レビュー(SLR)を実施した。
  • 学術データベースを対象に、ソフトウェア工学、機械学習、開発ライフサイクル段階に関連するキーワードを用いて包括的な検索戦略を定義した。
  • MLモデル開発に特化し、明示的にSEプロセスの統合または分析がなされた研究に限定するため、含める・除外する基準を適用した。
  • 標準的なSEライフサイクル段階(例:要件、設計、実装、テスト、展開)に研究をマッピングすることで、整合性とギャップを評価した。
  • テーマ分析を通じて、課題、採用された実践、MLワークフローの成熟度を統合的に分析した。
  • 先行研究(例:Amershi et al., Correia et al.)との照合による結果の妥当性を検証し、サンプリングバイアスや定量的検証の限界といった妥当性の脅かし要因を評価した。

実験結果

リサーチクエスチョン

  • RQ1伝統的なソフトウェア工学ライフサイクル段階は、機械学習モデル開発ワークフローにおいてどの程度適用または適応されているか?
  • RQ2特にデータ処理と特徴量工学において、ソフトウェア工学の視点からMLモデル開発における最も深刻な課題は何か?
  • RQ3構造、成熟度、モularity、再利用、品質保証の支援という観点から、既存のMLワークフローは、確立されたSEプロセスと比べてどの程度の差があるか?
  • RQ4SE実践がML開発に統合される段階での主なギャップは何か。それらはどのようにしてモデルの信頼性とスケーラビリティを向上させるために解決できるか?
  • RQ5SE原則に整合した統一的またはアルゴリズム/データ固有のMLワークフローの必要性があるのか、それとも一般的なSEベースのフレームワークで十分なのか?

主な発見

  • データ処理と特徴量工学は、モデル学習や評価を上回る難易度を持つため、MLモデル開発における最も困難な段階として一貫して特定されている。
  • 関心が高まっているにもかかわらず、完全なSEライフサイクル段階をMLワークフローに明示的に適用または適応している研究はわずかにとどまり、研究と実務における顕著なギャップが示されている。
  • MLライフサイクル全体を通じてデータに強く依存するため、ソフトウェア構成管理に類似した、専用のデータ管理およびバージョン管理プロセスの導入が不可欠である。
  • MLシステムにおけるモularityと再利用性は、データ駆動型の依存関係とモデル間の依存性のため、従来のソフトウェアとははるかに複雑である。
  • バージョン管理、テスト、要件工学などのSE実践の導入により、特に大規模なAIシステムにおいて、モデルの再現性、保守性、品質が向上する。
  • 本レビューにおいては、SE実践がMLワークフローに与える影響を検証するための堅実な定量的測定を実施した研究が唯一1件にとどまり、実証的検証における大きなギャップが浮き彫りになっている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。