Skip to main content
QUICK REVIEW

[논문 리뷰] LLMs for XAI: Future Directions for Explaining Explanations

Alexandra Zytek, Sara Pidò|arXiv (Cornell University)|2024. 05. 09.
Scientific Computing and Data Management인용 수 10
한 줄 요약

이 논문은 SHAP 기반 ML 설명을 자연스러운 서사 설명으로 변환하기 위해 LLM을 사용하는 것을 제안하고, 평가 지표와 프롬프트 설계를 개요하며, 초기 GPT-3.5 및 GPT-4 결과와 파일럿 사용자 연구를 제시합니다.

ABSTRACT

In response to the demand for Explainable Artificial Intelligence (XAI), we investigate the use of Large Language Models (LLMs) to transform ML explanations into natural, human-readable narratives. Rather than directly explaining ML models using LLMs, we focus on refining explanations computed using existing XAI algorithms. We outline several research directions, including defining evaluation metrics, prompt design, comparing LLM models, exploring further training methods, and integrating external data. Initial experiments and user study suggest that LLMs offer a promising way to enhance the interpretability and usability of XAI.

연구 동기 및 목표

  • ML 배경이 없는 도메인 전문가를 위해 더 자연하고 인간이 읽기 쉬운 ML 설명의 필요성을 고취합니다.
  • LLM 보조 XAI를 향상시키기 위한 평가 지표, 프롬프트 설계, 모델 비교, 학습 방법, 데이터 통합 등을 포함한 연구 방향을 제안합니다.
  • SHAP 설명을 서사로 변환하기 위한 제로샷 LLM 능력을 조사하고 초기 성능을 평가합니다.
  • 향후 연구를 안내하기 위한 초기 경험적 및 사용자 연구 통찰을 제공합니다.

제안 방법

  • 서사 설명을 평가하기 위한 지표를 검토하고 정의합니다( soundness, fluency, completeness, context-awareness, length ).
  • SHAP 설명을 입력으로 사용하여 두 데이터 집합(학생 성적 및 Ames 주택)에서 다섯 개 프롬프트를 실험합니다.
  • 제로샷 프롬프트 기반 서사 생성을 통해 GPT-3.5와 GPT-4를 비교합니다.
  • 가용성 및 정보성 측면에서 서사 기반 설명과 플롯 기반 설명을 비교하기 위한 파일럿 사용자 연구를 수행합니다.
  • 프롬프트 실험의 평균 지표 점수와 정성적 사용자 피드백을 초기 진행으로 보고합니다.

실험 결과

연구 질문

  • RQ1LLM이 추가 학습 없이 SHAP 설명을 유창하고 맥락 인식적인 서사 설명으로 변환할 수 있습니까?
  • RQ2프롬프트 설계와 서로 다른 LLM이 서사 설명의 품질에 어떤 영향을 미칩니까?
  • RQ3서사 설명의 품질을 포착하는 지표는 무엇이며 LLM은 이들에서 어떻게 수행합니까?
  • RQ4전통적 설명과 비교하여 서사 설명이 사용자 이해도와 신뢰도를 향상시키나요?
  • RQ5LLM 기반 XAI 서사를 개선하기 위한 실행 가능한 방향(학습, 데이터 통합, 모델 비교)은 무엇입니까?

주요 결과

  • GPT-4 설명은 GPT-3.5보다 더 타당하고, 완전하며, 맥락 인식적이지만, GPT-3.5는 더 짧고 더 유창한 경향이 있습니다.
  • GPT-4는 실험에서 오류가 거의 발생하지 않아 신중한 평가가 필요한 고위험 맥락에서의 가능성을 시사합니다.
  • 파일럿 사용자 연구에서 참가자들은 가독성 및 정보성 지표에서 플롯 기반 설명보다 서사 기반 설명을 선호했습니다.
  • 서사 설명이 ML 설명의 해석 가능성과 활용성을 향상시킬 수 있다는 유망한 근거입니다.
  • 본 연구는 XAI에서 LLM의 추가 탐구를 위한 기초로 지표와 프롬프트를 확립하며, 향후 미세 조정 및 데이터 통합을 포함합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.