Skip to main content
QUICK REVIEW

[論文レビュー] A Systematic Literature Review on Explainability for Machine/Deep Learning-based Software Engineering Research

Sicong Cao, Xiaobing Sun|arXiv (Cornell University)|Jan 26, 2024
Software Engineering Research被引用数 4
ひとこと要約

本システマティックレビューでは、機械学習/ディープラーニングに基づくソフトウェア工学における説明可能なAI(XAI)に関する108件の研究を分析し、XAIがもたらす恩恵が大きい主なSEタスク、出力形式およびモデル互換性に基づくXAI技術の分類、およびその評価手法の評価を行った。研究では、評価の厳密さとステークホルダーの整合性に著しいギャップが明らかとなり、今後のXAI4SE研究のための5つの根拠に基づいたガイドラインを提言した。

ABSTRACT

The remarkable achievements of Artificial Intelligence (AI) algorithms, particularly in Machine Learning (ML) and Deep Learning (DL), have fueled their extensive deployment across multiple sectors, including Software Engineering (SE). However, due to their black-box nature, these promising AI-driven SE models are still far from being deployed in practice. This lack of explainability poses unwanted risks for their applications in critical tasks, such as vulnerability detection, where decision-making transparency is of paramount importance. This paper endeavors to elucidate this interdisciplinary domain by presenting a systematic literature review of approaches that aim to improve the explainability of AI models within the context of SE. The review canvasses work appearing in the most prominent SE & AI conferences and journals, and spans 108 papers across 23 unique SE tasks. Based on three key Research Questions (RQs), we aim to (1) summarize the SE tasks where XAI techniques have shown success to date; (2) classify and analyze different XAI techniques; and (3) investigate existing evaluation approaches. Based on our findings, we identified a set of challenges remaining to be addressed in existing studies, together with a set of guidelines highlighting potential opportunities we deemed appropriate and important for future work.

研究の動機と目的

  • 説明可能なAI(XAI)技術が測定可能な成功を示したソフトウェア工学タスクを特定・要約すること。
  • 出力形式およびモデル互換性を含めた、SEに応用されたXAI技術の多様性を分類・分析すること。
  • XAI4SE研究で用いられる既存の評価手法、ベンチマーク、メトリクスを調査し、妥当性と信頼性を評価すること。
  • 特に評価の厳密さ、ステークホルダーの整合性、実世界での使いやすさの観点から、現在のXAI4SE研究における継続的な課題を明らかにすること。
  • 今後のXAIをソフトウェア工学に応用する研究のための、実行可能で根拠に基づいたガイドラインを提供すること。

提案手法

  • 2015年から2023年までの間に発表された、27のトップクラスのSEおよびAIの国際会議・学術誌を対象に、システマティックレビュー(SLR)を実施。抽出された主要研究は108件であった。
  • PRISMAに基づくスクリーニングとフィルタリングを適用し、ML/DLモデルとSEの文脈におけるXAI統合を対象とする研究の方法論的厳密性を確保した。
  • 出力形式(例:注目マップ、対向的例、LIMEに類似した局所的重要度)、モデル互換性(例:後処理型対比して本質的に解釈可能な型)、タスク固有の設計に基づいてXAI技術を分類した。
  • 各研究を、バグ検出、コード生成、自動プログラム修復など23種類の異なるSEタスクの1つ以上にマッピングした。
  • ベンチマーク使用状況、ベースライン比較、精度以外のメトリクス(例:忠実度、適合度、ユーザースタディの結果)を分析することで、評価手法の質を評価した。
  • 研究結果を統合し、5つの包括的なガイドライン(要件分析、アプローチ選定、多次元的評価、フィードバック駆動型最適化、法的・倫理的配慮)を策定した。

実験結果

リサーチクエスチョン

  • RQ1どのソフトウェア工学タスクでXAI技術が最も顕著な恩恵をもたらしたか、その有効性を裏付ける証拠は何か?
  • RQ2XAI技術は出力形式、モデル互換性、解釈戦略の観点からどのように分類されるか。それぞれの強みと限界は何か?
  • RQ3XAI4SE研究で一般的に用いられるベンチマーク、ベースライン、メトリクスは何か。それらの信頼性と堅牢性はどの程度か?
  • RQ4現在のXAI4SE研究における主な課題と制限要因は何か。特に評価、ステークホルダーの整合性、実世界での展開の観点から。
  • RQ5今後のSE研究におけるXAI技術の設計、評価、展開を改善するための、実行可能なガイドラインは何か?

主な発見

  • バグ検出と自動プログラム修復は、XAI技術が最も一貫性があり影響力のある結果を示した2つのSEタスクであり、複数の研究が開発者による信頼性の向上とデバッグ効率の改善を報告している。
  • Grad-CAM、LIME、SHAPといった後処理型の説明技術が最も広く使用されているが、そのうちたった38%の研究でのみ人間中心の評価が実施されており、使いやすさの検証に大きなギャップがあることが示された。
  • 標準化されたベンチマークやベースラインを用いたXAIアプローチの評価はわずか15%にとどまり、42%の研究が説明の質(例:忠実度や適合度)を評価せず、単にモデルの精度に依存していた。
  • 説明の形式と非技術的ステークホルダーのニーズの間には顕著な不一致が見られた:68%の研究が技術的出力(例:注目マップ)を生成したが、開発者の理解可能性についての検証は行われていなかった。
  • 72%の研究が、開発者の使いやすさが実世界での採用において重要な要因であるという証拠にもかかわらず、評価にユーザーフィードバックループを組み込んでいなかった。
  • 本レビューでは、5つの主要な課題を同定した:標準化された評価の欠如、ステークホルダーの整合性の不足、合成データへの過剰依存、一般化可能性の制限、倫理的・法的リスクへの無関心。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。