Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Explainable Artificial Intelligence: A Comprehensive Review of Methodological Advances and Future Research Directions

Nikolaos Rodis, Christos Sardianos|arXiv (Cornell University)|2023. 06. 09.
Explainable Artificial Intelligence (XAI)인용 수 7
한 줄 요약

이 논문은 다중모态 해석 가능한 인공지능(MXAI)에 대한 종합적인 리뷰를 제시하며, 다중모달 예측 작업 전반에 걸쳐 방법, 데이터셋, 평가 지표, 과제를 체계적으로 분석한다. 논문은 모ality 수, 설명 생성 시점, 수학적 형식화 기반으로 MXAI 접근법의 체계적 분류 체계를 제안하며, 평가의 격차, 애너테이션의 편향, 사용자 맞춤형 설명의 필요성 등의 핵심적 격차를 강조한다.

ABSTRACT

Despite the fact that Artificial Intelligence (AI) has boosted the achievement of remarkable results across numerous data analysis tasks, however, this is typically accompanied by a significant shortcoming in the exhibited transparency and trustworthiness of the developed systems. In order to address the latter challenge, the so-called eXplainable AI (XAI) research field has emerged, which aims, among others, at estimating meaningful explanations regarding the employed model reasoning process. The current study focuses on systematically analyzing the recent advances in the area of Multimodal XAI (MXAI), which comprises methods that involve multiple modalities in the primary prediction and explanation tasks. In particular, the relevant AI-boosted prediction tasks and publicly available datasets used for learning/evaluating explanations in multimodal scenarios are initially described. Subsequently, a systematic and comprehensive analysis of the MXAI methods of the literature is provided, taking into account the following key criteria: a) The number of the involved modalities (in the employed AI module), b) The processing stage at which explanations are generated, and c) The type of the adopted methodology (i.e. the actual mechanism and mathematical formalization) for producing explanations. Then, a thorough analysis of the metrics used for MXAI methods evaluation is performed. Finally, an extensive discussion regarding the current challenges and future research directions is provided.

연구 동기 및 목표

  • 다중모달 해석 가능한 인공지능(MXAI)의 최근 발전을 예측 과제, 데이터셋, 방법론적 프레임워크 전반에 걸쳐 체계적으로 분석하기.
  • 모달리티 수, 설명 생성 단계, 기반 수학적 형식화를 기반으로 MXAI 방법을 식별하고 분류하기.
  • 기존 평가 지표와 프로토콜을 평가하여 표준화된 벤치마크와 객관적인 평가 기준의 부족을 강조하기.
  • 편향된 텍스트 애너테이션, 실제 시각적 설명의 부재, 다중모달 평가 프로토콜의 부족과 같은 핵심 과제 해결하기.
  • 최종 사용자의 다양한 전문 수준과 인지 능력을 고려한 사용자 중심의 설명 설계를 촉진하기.

제안 방법

  • 논문은 입력 및 설명에서의 모달리티 수, 설명 생성 단계(학습 vs. 추론), 적용된 수학적 형식화를 기준으로 MXAI 방법을 분류하기 위해 체계적 문헌 리뷰 방법론을 활용한다.
  • MXAI 기법을 단모달 및 다중모달 설명 생성으로 분류하며, 입력과 동일한 모달리티를 사용하는 설명과 시각적 입력에 대해 텍스트 설명을 생성하는 등 교차 모달 출력을 생성하는 경우를 구분한다.
  • 기존 설명 품질 평가 지표를 평가하며, 상호모달 상관관계와 인간의 주관성을 고려한 표준화된 다중모달 평가 프로토콜의 부재를 강조한다.
  • 모달리티별 중요도, 융합 메커니즘의 해석 가능성, 다양한 모달리티 간의 인과적 특징 식별을 분석하여 MXAI 시스템 평가 프레임워크를 제안한다.
  • 공개된 MXAI 연구에서 사용된 데이터셋에 대한 비판적 리뷰를 포함하며, 데이터 가용성 및 애너테이션 품질의 격차를 규명한다.
  • 사람이 애너테이션한 텍스트 설명의 편향과 지도 학습을 위한 실제 시각적 설명 데이터의 부재와 같은 과제에 대한 체계적 분석을 도입한다.
(a)
(a)

실험 결과

연구 질문

  • RQ1입력 및 설명에서 사용된 모달리티 수에 따라 MXAI 방법은 어떻게 분류되며, 이는 해석 가능성에 어떤 영향을 미치는가?
  • RQ2주요 예측 모델의 라이프사이클에서 설명은 일반적으로 어느 단계에서 생성되는가? 이는 신뢰성과 유용성에 어떤 영향을 미치는가?
  • RQ3MXAI에서 가장 흔히 사용되는 수학적 형식화는 무엇이며, 이는 설명의 품질과 이해 가능성에 어떤 영향을 미치는가?
  • RQ4현재 MXAI 평가 관행의 주요 한계는 무엇이며, 이는 방법 간 객관적 비교를 방해하는가?
  • RQ5비전문가와 전문가를 포함한 다양한 사용자 프로파일에 맞춰 설명을 어떻게 맞춤화할 수 있으며, 이는 신뢰도와 사용성 향상에 어떻게 기여하는가?

주요 결과

  • 실제 시각적 설명 데이터의 부재로 인해, 시각적 설명을 위한 지도 학습 기반 MXAI 모델 개발에 심각한 격차가 존재한다.
  • 사람이 애너테이션한 텍스트 설명은 개인의 배경과 성격에 따라 편향과 모순을 포함할 수 있어, 설명 모듈의 훈련 데이터로서의 신뢰성이 저하된다.
  • 현재 MXAI 평가 관행은 주로 각 모달리티를 별개로 평가하여 상호모달 상관관계를 간과하고 있어, 설명 품질에 대한 오해의 소지가 있는 결론을 이끌 수 있다.
  • 현재까지는 작업 및 모델에 특화된 평가 지표가 제한적으로 제안되었을 뿐이며, 다중모달 해석 가능성 평가를 위한 표준화된 벤치마크는 존재하지 않는다.
  • 모달리티별 기여도와 그들의 공동 영향을 모두 고려한 다중모달 해석 가능성 지표의 필요성이 뚜렷하다.
  • 특히 비전문가를 고려한 사용자 전문 수준에 맞춘 설명은 이해도, 신뢰도, 인간-AI 협업 향상에 크게 기여할 수 있다.
(b)
(b)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.