Skip to main content
QUICK REVIEW

[論文レビュー] A Systematic Mapping Study on Testing of Machine Learning Programs

Salman Sherin, Muhammad Uzair Khan|arXiv (Cornell University)|Jul 11, 2019
Software Testing and Debugging Techniques参考文献 47被引用数 8
ひとこと要約

本系統的マッピング研究では、1,654件の抽出元から37件の関連論文を分析し、機械学習プログラムのテスト状況をマッピングした。主な傾向を特定し、MLタイプとアプローチ別にテスト技術を分類し、実証的証拠、ツールの可用性、非機能的テストの分野におけるギャップを浮き彫りにした。特に強化学習システムにおいて顕著である。

ABSTRACT

We aim to conduct a systematic mapping in the area of testing ML programs. We identify, analyze and classify the existing literature to provide an overview of the area. We followed well-established guidelines of systematic mapping to develop a systematic protocol to identify and review the existing literature. We formulate three sets of research questions, define inclusion and exclusion criteria and systematically identify themes for the classification of existing techniques. We also report the quality of the published works using established assessment criteria. we finally selected 37 papers out of 1654 based on our selection criteria up to January 2019. We analyze trends such as contribution facet, research facet, test approach, type of ML and the kind of testing with several other attributes. We also discuss the empirical evidence and reporting quality of selected papers. The data from the study is made publicly available for other researchers and practitioners. We present an overview of the area by answering several research questions. The area is growing rapidly, however, there is lack of enough empirical evidence to compare and assess the effectiveness of the techniques. More publicly available tools are required for use of practitioners and researchers. Further attention is needed on non-functional testing and testing of ML programs using reinforcement learning. We believe that this study can help researchers and practitioners to obtain an overview of the area and identify several sub-areas where more research is required

研究の動機と目的

  • 機械学習プログラムのテストに関する現在の研究状況を包括的に概説すること。
  • MLタイプ、テストアプローチ、研究の焦点に基づいて、既存のテスト技術を特定・分類すること。
  • 実証的証拠および報告基準の観点から、出版済み研究の質を評価すること。
  • 非機能的テストや強化学習に基づくMLシステムなど、研究が不足している分野を浮き彫りにすること。
  • 研究者および実務家を支援するため、データを公開し、今後の研究方向性を特定すること。

提案手法

  • ソフトウェア工学における文献レビューのための確立されたガイドラインに従い、系統的マッピング研究を実施した。
  • 1,654件の初期論文を37件の関連研究に絞り込むために、含む・含まないの基準を定義した(2019年1月まで)。
  • 選定された文献の分類と分析を支援するため、3セットの研究質問を策定した。
  • 貢献の側面、研究の側面、テストアプローチ、MLタイプ、テストタイプなどの属性に基づき、論文を分類した。
  • 実証的報告および再現可能性のための確立された基準を用いて、選定された論文の質を評価した。
  • 今後のMLテスト研究およびツール開発を支援するため、収集したデータを公開した。

実験結果

リサーチクエスチョン

  • RQ1機械学習プログラムのテストに関する支配的な研究テーマと傾向は何か?
  • RQ2機械学習タイプとテストアプローチ別に、テスト技術はどのように分類されるか?
  • RQ3出版済みのMLテスト研究における実証的証拠および報告の質はどの程度か?
  • RQ4非機能的テストや強化学習に基づくMLシステムなど、研究が不足している分野は何か?
  • RQ5MLテスト研究および実務におけるツールの可用性と再現性に関する主なギャップは何か?

主な発見

  • MLプログラムのテスト分野は急速に成長しているが、異なるテスト技術の有効性を比較・評価するのに十分な実証的証拠が不足している。
  • 当初の1,654件の論文のうち、37件しか含む基準を満たさなかったため、文献に著しいノイズと不適切な関連性が存在することが示された。
  • MLシステムのテストを支援する公開可能なツールが著しく不足している。
  • 非機能的テストや強化学習に基づくMLプログラムのテストは、依然として研究が不足しており、顕著な研究ギャップである。
  • 選定された論文の報告品質は一貫性がなく、標準化された評価指標や再現可能な実験設定の使用が限定的である。
  • 本研究のデータセットは、今後のMLテスト研究、ツール開発、ベンチマーク作成を支援するため、公開されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。