Skip to main content
QUICK REVIEW

[논문 리뷰] On the Semantic Interpretability of Artificial Intelligence Models

Vivian Dos Santos Silva, André Freitas|arXiv (Cornell University)|2019. 07. 09.
Explainable Artificial Intelligence (XAI)참고 문헌 41인용 수 11
한 줄 요약

이 논문은 기계 학습을 넘어서 분포어법, 흐린 논리학 등 다양한 AI 분야를 포함한 의미적 해석 가능성에 대한 교차학문적 프레임워크를 제안한다. 모델을 투명성(내재적 해석 가능성)과 사후 해석 가능성(예측 후 설명 추가)으로 분류하며, 성능을 유지하면서도 다양한 사용자에게 설명 가능하고 실천 가능한 통찰을 제공하는 사용자 중심의 해석 가능성 계층을 주장한다.

ABSTRACT

Artificial Intelligence models are becoming increasingly more powerful and accurate, supporting or even replacing humans' decision making. But with increased power and accuracy also comes higher complexity, making it hard for users to understand how the model works and what the reasons behind its predictions are. Humans must explain and justify their decisions, and so do the AI models supporting them in this process, making semantic interpretability an emerging field of study. In this work, we look at interpretability from a broader point of view, going beyond the machine learning scope and covering different AI fields such as distributional semantics and fuzzy logic, among others. We examine and classify the models according to their nature and also based on how they introduce interpretability features, analyzing how each approach affects the final users and pointing to gaps that still need to be addressed to provide more human-centered interpretability solutions.

연구 동기 및 목표

  • 의료, 금융, 형사 사법과 같은 고위험 의사결정 환경에서의 설명 가능한 AI에 대한 증가하는 수요를 해결하기 위해.
  • 기계 학습 외에도 분포어법, 흐린 논리학 등 더 넓은 AI 영역에서의 해석 가능성에 대해 고려하기 위해.
  • 해석 가능성의 통합 방식에 따라 AI 모델을 분류하기 위해 — 즉, 내재적으로(투명성) 또는 사후적으로(사후 해석) 통합되었는지에 따라 — 그리고 이로 인한 최종 사용자에 대한 영향을 평가하기 위해.
  • 현재 해석 가능성 접근 방식의 격차, 특히 사용성, 공정성, 실제 워크플로우에의 통합 측면에서의 격차를 식별하기 위해.
  • 정확도 중심의 모델 개발에서 인간 중심 설계로의 전환을 주장하기 위해 — 이는 정당화, 편향 탐지, 사용자 신뢰 지원을 가능하게 한다.

제안 방법

  • 신경망, 흐린 논리학, 규칙 기반 시스템, 분포어법 등을 포함한 다양한 AI 분야에서의 해석 가능성에 대한 교차 분야 분석을 수행한다.
  • 해석 가능성 통합 방식에 따라 모델을 투명성(내재적으로 해석 가능한)과 사후 해석 가능성(예측 후 설명 추가)으로 분류한다.
  • 사용자 중심의 관점에서 해석 가능성의 영향을 평가하여, 설명이 사용자 작업 부담, 의사결정 과정, 신뢰도에 어떤 영향을 미치는지 분석한다.
  • 기존 모델의 예측 방식을 변경하지 않고도 적용 가능한 저위험, 점진적인 업그레이드로서의 해석 가능성 계층을 제안한다.
  • 텍스트 설명, 시각적 강조, 다이어그램 등 다양한 해석 방법이 의사, 신용 분석가와 같은 다양한 사용자 역할에 어떻게 기여하는지 분석한다.
  • 모델 정확도와 해석 가능성 사이의 상충 관계를 분석하며, 성능을 유지하면서도 투명성을 높이는 방법을 주장한다.

실험 결과

연구 질문

  • RQ1기계 학습 외에도 분포어법, 흐린 논리학 등 다양한 AI 분야에서 의미적 해석 가능성은 어떻게 의미 있게 정의하고 구현할 수 있는가?
  • RQ2투명성 모델과 사후 해석 방법 간의 사용자 영향에 어떤 차이가 있으며, 비개발자 사용자에게 더 적합한 것은 무엇인가?
  • RQ3해석 가능성 계층은 기존 예측이나 성능을 변경하지 않으면서도, 배포된 AI 시스템에 안전하고 점진적인 업그레이드를 가능하게 하는 방식은 무엇인가?
  • RQ4해석 가능한 모델은 훈련 데이터에 내재된 사회적 편향을 어떻게 탐지하고 완화할 수 있는가, 특히 고위험 응용 분야에서?
  • RQ5결정 지원을 위해 인지 부담을 증가시키지 않는 사용자 우수한, 실천 가능한 설명을 설계할 때의 주요 과제는 무엇인가?

주요 결과

  • 텍스트적 정당화나 시각적 주목 맵과 같은 사후 해석 설명은 의사, 신용 분석가와 같은 비개발자 사용자에게 저수준 모델 내부 분석보다 더 적합하다.
  • 구글 포토스 사례에서 검은 사람들을 고릴라로 잘못 레이블링한 일은 해석 가능성 부족이 모델 실패를 조기에 탐지하고 수정하는 것을 막을 수 있음을 보여준다.
  • 매우 정확한 모델도 사회적 편향을 악화시킬 수 있다 — 예를 들어, 성별 편향 데이터로 훈련된 모델은 활동 예측에서 성별 격차를 33%에서 68%로 증가시켰다.
  • 해석 가능성 계층은 기존 모델을 재학습하거나 교체하지 않아도 투명성을 향상시킬 수 있는 실현 가능한 길을 제공하며, 중요한 시스템에 저위험 배포를 가능하게 한다.
  • 투명성 모델(예: 결정 목록, 흐린 논리학)은 내재적으로 더 해석 가능하지만, 최종 사용자가 복잡한 논리 형식어를 이해하기 어려운 점을 고려해 설명 계층이 여전히 유용하다.
  • 사용자 중심의 해석 가능성 솔루션에 여전히 큰 격차가 존재하며, 특히 인지 부담을 증가시키지 않고도 사용자 워크플로우에 원활하게 통합하는 데 어려움이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.