Skip to main content
QUICK REVIEW

[논문 리뷰] Explaining black box text modules in natural language with language models

Chandan Singh, Aliyah R. Hsu|arXiv (Cornell University)|2023. 05. 17.
Machine Learning in Materials Science인용 수 6
한 줄 요약

이 논문은 자연어 설명을 자동으로 생성하는 SASC를 제안한다. SASC는 텍스트를 스칼라 값으로 매핑하는 블랙박스 텍스트 모듈에 대해 두 단계 프로세스를 사용한다: (1) 사전 훈련된 언어 모델을 활용해 높은 활성도를 보이는 n그램을 요약하고, (2) 합성 텍스트를 생성하여 모듈의 반응을 테스트함으로써 설명의 신뢰도를 평가한다. SASC는 합성 환경에서 참값 설명을 성공적으로 복원하였으며, BERT 뉴런에 대해 의미 있는 설명을 제공하고, fMRI 볼륨에 대해 의미론적으로 기반을 둔 설명을 생성하여 뇌 영역 내에서 구분되는 선택성 패턴을 드러냈다.

ABSTRACT

Large language models (LLMs) have demonstrated remarkable prediction performance for a growing array of tasks. However, their rapid proliferation and increasing opaqueness have created a growing need for interpretability. Here, we ask whether we can automatically obtain natural language explanations for black box text modules. A "text module" is any function that maps text to a scalar continuous value, such as a submodule within an LLM or a fitted model of a brain region. "Black box" indicates that we only have access to the module's inputs/outputs. We introduce Summarize and Score (SASC), a method that takes in a text module and returns a natural language explanation of the module's selectivity along with a score for how reliable the explanation is. We study SASC in 3 contexts. First, we evaluate SASC on synthetic modules and find that it often recovers ground truth explanations. Second, we use SASC to explain modules found within a pre-trained BERT model, enabling inspection of the model's internals. Finally, we show that SASC can generate explanations for the response of individual fMRI voxels to language stimuli, with potential applications to fine-grained brain mapping. All code for using SASC and reproducing results is made available on Github.

연구 동기 및 목표

  • 대규모 언어 모델(LLM) 및 기타 블랙박스 텍스트 모듈에서 내부 메커니즘이 투명하지 않다는 해석의 위기를 해결하기 위해.
  • 모델 내부 정보나 인간의 주석 없이도 인간이 읽을 수 있는 자연어 설명을 자동으로 생성하는 블랙박스 방법을 개발하기 위해.
  • 다양한 도메인에서 방법을 평가하기 위해: 합성 모듈, BERT 모델 내부, fMRI 기반 뇌 인코딩 모델.
  • 설명이 의미론적으로 유의미하고 실제 모듈 동작에 기반한 것이며, 특히 신경과학 적용에서 그러한 특성을 갖는지 입증하기 위해.
  • 의료 및 인지 과학과 같은 고위험 도메인에서 해석 가능성에 활용 가능한 확장 가능한 오픈소스 도구를 제공하기 위해.

제안 방법

  • SASC는 두 단계 파이프라인을 사용한다: 첫째, 코퍼스에서 상위 활성도를 보이는 n그램을 식별하고, 사전 훈련된 언어 모델을 활용해 후보 설명으로 요약한다.
  • 둘째, 각 후보 설명에 대해 설명 기반으로 합성 텍스트를 생성하고, 그에 대한 대상 모듈의 반응을 측정함으로써 신뢰도 점수를 할당한다.
  • 설명 생성과 평가를 분리함으로써 환각 현상을 줄이기 위해 도우미 LLM을 사용하며, 이는 요약 및 텍스트 생성에 활용된다.
  • BERT에서 해석 가능한 구성 요소를 추출하기 위해 사전 학습된 딕셔너리 학습을 적용한 후, SASC를 사용해 개별 뉴런 또는 서브모듈을 설명한다.
  • fMRI의 경우, 각 볼륨의 반응을 텍스트 모듈로 간주하고, 서사적 텍스트나 WikiText를 n그램 코퍼스로 사용하여 개별 볼륨 반응을 설명한다.
  • 설명의 신뢰도는 반응 일관성에 의해 평가되며, 높은 점수는 설명이 모듈의 강한 활성화를 신뢰성 있게 예측함을 의미한다.
Figure 1: SASC pipeline for obtaining a natural language explanation given a module f . (i) SASC first generates candidate explanations (using a pre-trained LLM) based on the ngrams that elicit the most positive response from $f$ . (ii) SASC then evaluates each candidate explanation by generating sy
Figure 1: SASC pipeline for obtaining a natural language explanation given a module f . (i) SASC first generates candidate explanations (using a pre-trained LLM) based on the ngrams that elicit the most positive response from $f$ . (ii) SASC then evaluates each candidate explanation by generating sy

실험 결과

연구 질문

  • RQ1SASC는 내부 모델 파rameter에 접근하지 않고도 블랙박스 텍스트 모듈에 대해 정확하고 자연어 기반의 설명을 자동으로 생성할 수 있는가?
  • RQ2알려진 기저 패턴을 가진 합성 모듈에서 SASC는 참값 설명을 얼마나 잘 복원하는가?
  • RQ3SASC가 생성한 BERT 뉴런 설명은 인간 주석 기반 설명과 비슷한 품질을 가지며, 후행 작업의 의미론과 일치하는가?
  • RQ4fMRI 볼륨에 대한 설명은 의미 있는 의미론적 선택성을 반영하는가? 그리고 BERT 모듈의 설명과 다를까?
  • RQ5n그램 겹침이 적더라도 SASC가 생성한 설명은 실제 fMRI 반응을 예측할 수 있는가?

주요 결과

  • 합성 모듈에서는 SASC가 다양한 실험 조건에서 참값 설명을 높은 정확도로 복원하여 강력한 일치도를 보였다.
  • BERT 모듈의 경우, SASC 설명은 인간 주석 기반 설명과 유사한 품질을 보였으며, 많은 설명이 감성 또는 명시적 실체와 같은 작업 관련 의미론을 포괄했다.
  • BERT 모듈은 개별 단어에서 추상적 의미 개념에 이르기까지 다양한 현상에 대해 선택성을 보였으며, 이는 알려진 언어적 역할과 일치했다.
  • fMRI 볼륨 설명은 BERT 모듈 설명보다 사회적 개념(예: 관계, 가족)에 훨씬 더 집중되어 있었으며, 뇌 영역 내에서 기능적 조직이 다름을 시사했다.
  • fMRI 볼륨의 경우 설명 점수가 유의미하게 0을 초과했으며, 이는 높은 수준의 신뢰도를 의미했다.
  • 설명 텍스트를 기반으로 한 단순한 거리 기반 예측이 실제 fMRI 반응과 스피어만 상관계수 0.033 ± 0.002를 기록했으며, 이는 유의미하게 0을 초과했다(p < 0.001), 실제 뇌 활동과의 기반을 지닌다는 것을 보여주었다.
Figure 2: Cumulative accuracy at recovering the ground truth explanation increases as a function of explanation score. Error bars show standard error of the mean.
Figure 2: Cumulative accuracy at recovering the ground truth explanation increases as a function of explanation score. Error bars show standard error of the mean.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.