[논문 리뷰] Towards LLM-guided Causal Explainability for Black-box Text Classifiers
이 논문은 블랙박스 텍스트 분류기의 원인적 역인과 설명을 생성하기 위해 최신 기술의 대규모 언어 모델(Large Language Models, LLMs)을 활용하는 세 단계 파이프라인을 제안한다. 잠재된 관측되지 않은 특징을 식별하고, 이를 입력 단어와 연결하며, 최소한의 의미 유지 수정을 통해 고품질의 역인과 설명을 도출한다. 특히 GPT-4는 레이블 전환 설명을 생성하는 데 다른 LLMs보다 뛰어난 성능을 보였다.
With the advent of larger and more complex deep learning models, such as in Natural Language Processing (NLP), model qualities like explainability and interpretability, albeit highly desirable, are becoming harder challenges to tackle and solve. For example, state-of-the-art models in text classification are black-box by design. Although standard explanation methods provide some degree of explainability, these are mostly correlation-based methods and do not provide much insight into the model. The alternative of causal explainability is more desirable to achieve but extremely challenging in NLP due to a variety of reasons. Inspired by recent endeavors to utilize Large Language Models (LLMs) as experts, in this work, we aim to leverage the instruction-following and textual understanding capabilities of recent state-of-the-art LLMs to facilitate causal explainability via counterfactual explanation generation for black-box text classifiers. To do this, we propose a three-step pipeline via which, we use an off-the-shelf LLM to: (1) identify the latent or unobserved features in the input text, (2) identify the input features associated with the latent features, and finally (3) use the identified input features to generate a counterfactual explanation. We experiment with our pipeline on multiple NLP text classification datasets, with several recent LLMs, and present interesting and promising findings.
연구 동기 및 목표
- 블랙박스 텍스트 분류기에서 원인적 설명 가능성이 부족한 문제를 해결하기 위해, 일반적으로 투명하지 않고 상관관계 기반 설명에 의존하는 모델의 문제를 해결한다.
- 최근에 지시에 맞춰 트레이닝된 LLMs가 예측을 이끄는 관측되지 않은 잠재적 특징을 식별하는 해석자로 기능할 수 있는지 탐색한다.
- 핵심 입력 특징만 수정하여 고품질의 의미 유지 역인과 설명을 체계적으로 생성하는 파이프라인을 개발한다.
- LLMs가 원인적 특징을 식별하고 레이블 전환을 안정적으로 유도하는 역인과 설명을 생성하는 데 효과적인지 평가한다.
제안 방법
- 파이프라인은 사전에 준비된 LLM을 사용하여 입력 텍스트 내에서 모델 예측의 배경이 될 수 있는 잠재적이고 관측되지 않은 특징을 먼저 식별한다.
- 그 다음으로, 추출된 잠재적 특징과 관련된 특정 입력 특징(예: 단어나 어구)을 원본 텍스트에서 식별한다.
- LLM은 레이블 전환을 유도하기 위해 식별된 입력 특징만 최소한으로 수정하도록 프롬프트를 제공하여 역인과를 생성한다.
- 수정 과정에서 원본 입력의 전반적인 맥락과 구조를 유지함으로써 의미 유사성을 확보한다.
- GPT-4, text-davinci-003, GPT-3.5를 포함한 다양한 LLMs를 사용하여 여러 NLP 텍스트 분류 데이터셋에서 방법을 평가한다.
- 레이블 전환 점수(LFS)를 사용하여 레이블 전환을 유도하는 역인과 생성의 성공 여부를 측정한다.
실험 결과
연구 질문
- RQ1최신 기술의 LLMs가 블랙박스 텍스트 분류기의 원인적 역인과 설명을 효과적으로 생성하는 데 활용될 수 있는가?
- RQ2LLMs는 텍스트 분류에서 모델 예측에 원인적으로 영향을 주는 관측되지 않은 잠재적 특징을 정확히 식별할 수 있는가?
- RQ3다른 LLMs(예: GPT-4 대비 GPT-3.5)는 강한 의미 유지와 함께 고품질의 레이블 전환 역인과를 얼마나 효과적으로 생성하는가?
- RQ4잠재적 특징 추출 단계가 전체 역인과 설명 품질에 기여하는 정도는 어떠한가?
주요 결과
- GPT-4는 IMDB 데이터셋에서 97.2의 LFS 점수를 기록하여 다른 LLMs보다 뚜렷이 뛰어난 성능을 보였으며, 효과적인 역인과 생성 능력을 입증했다.
- 제거 실험 결과 잠재적 특징 추출 단계를 제거하면 LFS 점수가 95.78로 떨어져, 원인적 입력 특징 식별에 이 단계의 중요성을 확인했다.
- SNLI 데이터셋은 추론 작업을 포함하여 LLMs가 전반적으로 어려움을 겪었으며, 이는 추론 복잡성이 역인과 생성 품질에 영향을 준다는 것을 시사한다.
- AG News 데이터셋에서는 GPT-3.5와 text-davinci-003가 낮은 성능을 보였는데, 이는 다중 클래스 작업으로 인해 레이블 전환 프롬프트의 모호성이 증가했기 때문일 가능성이 있다.
- 정성적 분석을 통해 GPT-4는 '내용의 일관성'이나 '장소의 모순'와 같이 고품질의 의미적으로 유의미한 잠재적 특징을 추출했으며, 이는 모델 예측 오류와 일치함을 확인했다.
- 전체 파이프라인이 추출 단계를 생략한 변형보다 일관되게 뛰어난 성능을 보였으며, 잠재적 특징과 입력 특징 식별 단계가 고품질의 역인과 생성에 필수적임을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.