[논문 리뷰] In-Context Explainers: Harnessing LLMs for Explaining Black Box Models
이 논문은 사전 훈련된 대규모 언어 모델(Large Language Models, LLMs)을 사후 해석기로 사용하기 위한 최초의 프레임워크를 제안한다. 이는 문맥 내 학습(in-context learning, ICL)을 통해 작동하며, 네 가지 프롬프팅 전략—편차 기반, 예측 기반, 지시 기반, 해석 기반 ICL—을 제안한다. 이로써 LLMs는 미세조정 없이 소수의 few-shot 예시만으로도 예측의 주요 원인 요소를 식별하는 데 평균 72.19%의 정확도를 달성하며, 최신 기술 수준의 해석기와 유사한 성능을 보인다.
Recent advancements in Large Language Models (LLMs) have demonstrated exceptional capabilities in complex tasks like machine translation, commonsense reasoning, and language understanding. One of the primary reasons for the adaptability of LLMs in such diverse tasks is their in-context learning (ICL) capability, which allows them to perform well on new tasks by simply using a few task samples in the prompt. Despite their effectiveness in enhancing the performance of LLMs on diverse language and tabular tasks, these methods have not been thoroughly explored for their potential to generate post hoc explanations. In this work, we carry out one of the first explorations to analyze the effectiveness of LLMs in explaining other complex predictive models using ICL. To this end, we propose a novel framework, In-Context Explainers, comprising of three novel approaches that exploit the ICL capabilities of LLMs to explain the predictions made by other predictive models. We conduct extensive analysis with these approaches on real-world tabular and text datasets and demonstrate that LLMs are capable of explaining other predictive models similar to state-of-the-art post hoc explainers, opening up promising avenues for future research into LLM-based post hoc explanations of complex predictive models.
연구 동기 및 목표
- 모델의 미세조정이나 화이트박스 접근 없이도 LLMs가 블랙박스 모델의 사후 해석기로 신뢰성 있게 기능할 수 있는지 조사하는 것.
- 문맥 내 학습(ICL)을 활용해 모델 예측에 대해 충실하고 인간이 이해할 수 있는 해석을 생성하는 새로운 프레임워크를 개발하고 평가하는 것.
- LIME 및 SHAP와 같은 최신 기술 수준의 사후 해석 방법과 비교하여 LLM이 생성한 해석의 충실도와 정확도를 평가하는 것.
- 프롬프팅 설계, ICL 샘플 수, LLM 아키텍처(예: GPT-3.5 대비 GPT-4)가 해석 품질에 미치는 영향을 분석하는 것.
- 설명 가능한 AI(XAI) 분야에서 LLM 기반 해석 프레임워크 평가를 위한 벤치마크를 수립하는 것.
제안 방법
- 편차 기반 ICL, 예측 기반 ICL, 지시 기반 ICL, 해석 기반 ICL의 네 가지 독립적인 문맥 내 학습(ICL) 프롬프팅 전략을 제안하며, 각 전략은 국소 이웃성 및 모델 행동에 대한 정보 유형에서 다름.
- 실제 응용 사례 데이터셋과 두 가지 블랙박스 모델(예: 로지스틱 회귀)을 사용하여 LLM이 생성한 해석을 평가한다.
- 충실도를 정량적으로 평가하기 위해 Faishthfulness(FA), Representation Accuracy(RA), Prediction Gradient Importance(PGI) 등의 메트릭을 활용한다.
- GPT-3.5와 GPT-4를 LLM의 핵심으로 사용하여, 다양한 프롬프팅 전략과 하이퍼파라미터 설정에서 성능을 비교한다.
- ICL 샘플 수, 편차 형식, 온도 하이퍼파라미터에 대한 분석을 통해 민감도와 최적 설정을 평가한다.
- LLM 기반 해석 추출 및 평가를 표준화하기 위해 유틸리티 함수와 파싱 도구를 도입한다.

실험 결과
연구 질문
- RQ1LLMs는 미세조정 없이 문맥 내 학습을 통해 블랙박스 모델의 사후 해석을 효과적으로 생성할 수 있는가?
- RQ2LLMs가 생성한 해석의 성능은 LIME 및 기울기 기반 방법과 같은 최신 기술 수준의 사후 해석 방법과 비교해 어떻게 되는가?
- RQ3문맥 내 예시 수를 변화시킬 경우 LLM이 생성한 해석의 충실도에 어떤 영향을 미치는가?
- RQ4다양한 프롬프팅 전략(예: 지시 기반 대비 편차 기반)이 해석의 충실도와 정확도에 어떤 영향을 미치는가?
- RQ5LLM 아키텍처 선택(예: GPT-3.5 대비 GPT-4)이 생성된 해석의 품질에 상당한 영향을 미치는가?
주요 결과
- LLMs는 네 가지 벤치마크 데이터셋과 두 가지 블랙박스 모델에서 평균 72.19%의 정확도로 가장 중요한 특성(상위 k=1)을 식별하며, 사후 해석기로서 뛰어난 성능을 보였다.
- 해석 기반 ICL은 입력-출력-해석 삼중조의 few-shot 예시를 제공함으로써, 단 4개의 문맥 내 예시만으로도 여섯 가지 최신 기술 수준의 해석기의 행동을 모방할 수 있었다.
- GPT-4는 모든 메트릭에서 GPT-3.5를 앞서며, Adult 데이터셋에서 Faithfulness(FA)는 4.53% 높고, Representation Accuracy(RA)는 48.01% 높았다. 이는 GPT-4의 뛰어난 추론 능력 덕분으로 보인다.
- 소수의 예시를 초과해 문맥 내 예시 수를 늘리면(예: 64로 증가) 해석의 충실도가 감소함을 확인하여, 긴 프롬프트가 LLM의 관련 정보 검색 능력을 떨어뜨리는 것으로 나타났다.
- LLM이 생성한 해석의 충실도는 프롬프팅 설계에 민감하게 반응한다: 원본 샘플과 편차를 가한 샘플 간의 차이를 입력으로 제공할 경우 성능 향상이 있었으며, 높은 온도 값은 출력 품질에 거의 영향을 주지 않았다.
- 지시 기반 ICL은 Representation Accuracy(RA) 측면에서 편차 기반 및 예측 기반 ICL을 모두 앞서며, 명확하고 체계적인 지시가 해석의 충실도를 향상시킨다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.