Skip to main content
QUICK REVIEW

[논문 리뷰] A Systematic Literature Review on Explainability for Machine/Deep Learning-based Software Engineering Research

Sicong Cao, Xiaobing Sun|arXiv (Cornell University)|2024. 01. 26.
Software Engineering Research인용 수 4
한 줄 요약

이 체계적 문헌 리뷰는 기계/딥러닝 기반 소프트웨어 공학에서 설명 가능한 AI(XAI)에 관한 108篇의 연구를 분석하여, XAI가 유의미한 성과를 거둔 주요 소프트웨어 공학(SW) 과제를 특정하고, 출력 형식과 모델 호환성에 따라 XAI 기법을 분류하며, 평가 방법을 평가한다. 본 연구는 평가의 철저함과 이해관계자 간의 일치성 측면에서 심각한 격차를 드러내며, 향후 XAI4SE 연구를 위한 다섯 가지 근거 기반 지침을 제안한다.

ABSTRACT

The remarkable achievements of Artificial Intelligence (AI) algorithms, particularly in Machine Learning (ML) and Deep Learning (DL), have fueled their extensive deployment across multiple sectors, including Software Engineering (SE). However, due to their black-box nature, these promising AI-driven SE models are still far from being deployed in practice. This lack of explainability poses unwanted risks for their applications in critical tasks, such as vulnerability detection, where decision-making transparency is of paramount importance. This paper endeavors to elucidate this interdisciplinary domain by presenting a systematic literature review of approaches that aim to improve the explainability of AI models within the context of SE. The review canvasses work appearing in the most prominent SE & AI conferences and journals, and spans 108 papers across 23 unique SE tasks. Based on three key Research Questions (RQs), we aim to (1) summarize the SE tasks where XAI techniques have shown success to date; (2) classify and analyze different XAI techniques; and (3) investigate existing evaluation approaches. Based on our findings, we identified a set of challenges remaining to be addressed in existing studies, together with a set of guidelines highlighting potential opportunities we deemed appropriate and important for future work.

연구 동기 및 목표

  • 설명 가능한 AI(XAI) 기법이 측정 가능한 성공을 보인 소프트웨어 공학 과제를 특정하고 요약하기.
  • 출력 형식과 모델 호환성에 따라 적용된 XAI 기법의 다양성을 분류하고 분석하기.
  • XAI4SE 연구에서 사용되는 평가 관행, 벤치마크, 메트릭스를 조사하여 타당성과 신뢰성 평가하기.
  • 현재 XAI4SE 연구에서 지속적으로 발생하는 과제, 특히 평가의 철저함, 이해관계자 간 일치성, 실생활 적용 가능성 측면에서의 도전 과제 밝혀내기.
  • 향후 소프트웨어 공학을 위한 XAI 연구를 개선하기 위한 실천 가능하고 근거 기반의 지침 제공하기.

제안 방법

  • 2015년에서 2023년 사이에 발표된 108편의 주요 연구를 선별하기 위해, 상위 수준의 SE 및 AI 컫페러스 및 저널 27개에서 체계적 문헌 리뷰(SLR)를 수행하였다.
  • 메소드올로지적 엄격함을 확보하기 위해 PRISMA 기반 걸러내기 및 필터링을 적용하였으며, 주로 ML/DL 모델과 SE 환경에서 XAI를 통합한 연구에 집중하였다.
  • 출력 형식(예: 주의 맵, 반사적 사례, LIME 유사 샐리언시), 모델 호환성(예: 후행적 vs. 내재적으로 해석 가능한), 과제 특화 설계 기준에 따라 XAI 기법을 분류하였다.
  • 각 연구를 약 23개의 서로 다른 소프트웨어 공학 과제 중 하나 이상에 매핑하였으며, 취약성 탐지, 코드 생성, 자동 프로그램 복구 등이 포함되었다.
  • 벤치마크 사용, 기준 모델 비교, 정확도 외 메트릭스(예: 충실도, 신뢰도, 사용자 연구 결과) 분석을 통해 평가 관행의 품질을 평가하였다.
  • 발견된 결과를 종합하여 다섯 가지 종합적 지침을 도출: 요구사항 분석, 접근 방식 선택, 다차원 평가, 피드백 기반 최적화, 법적/윤리적 고려사항.

실험 결과

연구 질문

  • RQ1어떤 소프트웨어 공학 과제에서 XAI 기법이 가장 뚜렷한 효과를 보였으며, 그 효과를 뒷받침하는 증거는 무엇인가?
  • RQ2XAI 기법은 출력 형식, 모델 호환성, 해석 가능성 전략 측면에서 어떻게 분류되며, 각각의 강점과 한계는 무엇인가?
  • RQ3XAI4SE 연구에서 일반적으로 사용되는 평가 벤치마크, 기준 모델, 메트릭스는 무엇이며, 그들의 탄탄함과 신뢰성은 어느 정도인가?
  • RQ4현재 XAI4SE 연구에서 평가, 이해관계자 간 일치성, 실생활 배포 측면에서 가장 중요한 과제와 제약은 무엇인가?
  • RQ5향후 소프트웨어 공학 분야에서 XAI 기법의 설계, 평가, 배포를 향상시키기 위해 실천 가능한 지침은 무엇인가?

주요 결과

  • 취약성 탐지와 자동 프로그램 복구는 XAI 기법이 가장 일관되고 영향력 있게 작용한 두 가지 소프트웨어 공학 과제이며, 여러 연구에서 개발자 신뢰도 향상과 디버깅 효율성 향상을 보고하였다.
  • Grad-CAM, LIME, SHAP 등 후행적 설명 기법이 가장 널리 사용되었지만, 단지 38%의 연구에서 인간 중심 평가를 실시하여 사용성 검증 측면에서 심각한 격차가 존재함을 시사한다.
  • 표준화된 벤치마크나 기준 모델을 사용한 평가를 한 연구는 15%에 불과했으며, 42%의 연구는 설명 품질(예: 충실도 또는 신뢰도)을 평가하지 않고 모델 정확도에만 의존하였다.
  • 설명의 형식과 비기술적 이해관계자의 요구 사이에 뚜렷한 괴리가 존재한다: 68%의 연구에서 기술적 출력(예: 주의 맵)을 생성하였지만, 개발자 이해 가능성에 대한 검증은 이루어지지 않았다.
  • 다수의 연구(72%)는 개발자 사용성은 실생활 도입에 핵심적 요소임이 입증됨에도 불구하고, 평가 과정에 사용자 피드백 루프를 포함하지 않았다.
  • 본 리뷰는 다섯 가지 핵심 과제를 특정하였다: 표준화된 평가 부족, 이해관계자 간 일치성 부족, 합성 데이터에 대한 과도한 의존, 일반화 가능성 제한, 윤리적·법적 리스크에 대한 충분한 고려 부족.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.