[논문 리뷰] Can Explanations Be Useful for Calibrating Black Box Models?
이 논문은 모델 설명과 인간이 만든 히ュ리스틱을 사용하여 파rameter 업데이트 없이 블랙박스 NLP 모델의 도메인 간 성능을 향상시키는 校정 방법을 제안한다. LIME 또는 SHAP 설명과 작업에 특화된 특징을 조합함으로써, 단순한 분류기가 모델의 정확성을 예측하며, 선택적 질의 응답에서 최신 기술 성능을 달성하고 일부 경우에서 미세조정을 능가한다. 이는 설명이 모델의 校정을 크게 향상시킬 수 있음을 보여준다.
NLP practitioners often want to take existing trained models and apply them to data from new domains. While fine-tuning or few-shot learning can be used to adapt a base model, there is no single recipe for making these techniques work; moreover, one may not have access to the original model weights if it is deployed as a black box. We study how to improve a black box model's performance on a new domain by leveraging explanations of the model's behavior. Our approach first extracts a set of features combining human intuition about the task with model attributions generated by black box interpretation techniques, then uses a simple calibrator, in the form of a classifier, to predict whether the base model was correct or not. We experiment with our method on two tasks, extractive question answering and natural language inference, covering adaptation from several pairs of domains with limited target-domain data. The experimental results across all the domain pairs show that explanations are useful for calibrating these models, boosting accuracy when predictions do not have to be returned on every example. We further show that the calibration model transfers to some extent between tasks.
연구 동기 및 목표
- 모델 가중치에 접근할 수 없는 새로운 도메인에 블랙박스 NLP 모델을 배포하는 데 있어 미세조정이 불가능한 상황에서의 과제를 해결하기 위해.
- 특징 설명(특성 기여도를 통한)을 통해 블랙박스 모델의 도메인 간 성능을 향상시킬 수 있는지 조사하기 위해.
- 모델 파rameter에 접근하지 않고도 인간의 직관과 모델 수준의 기여도를 활용하여 모델 예측의 정확성을 예측할 수 있는 校정기(calibrator)를 개발하기 위해.
- 특히 선택적 예측 설정에서, 다양한 도메인과 작업 간의 일반화 능력을 평가하기 위해.
제안 방법
- 이 방법은 LIME 또는 SHAP를 사용하여 입력 토큰과 그 기여도 점수를 추출하며, 이는 각 토큰이 모델 예측에 기여하는 정도를 수량화한다.
- 인간이 식별한 히ュ리스틱(예: 고유명사 또는 동사의 존재)과 해당 토큰의 기여도 점수를 조합한 특징 집합을 구성한다.
- 블랙박스 모델의 예측이 정확한지 예측하기 위해, 대상 도메인의 소량의 레이블이 부여된 예시를 기반으로 이진 분류기(즉, 校정기)를 훈련시킨다.
- 이 校정기는 표준 및 선택적 질의 응답 설정 모두에서 평가되며, 예측은 校정기가 신뢰할 수 있다고 판단될 경우에만 유지된다.
- 이 방법은 인스턴스별 설명을 활용하여 모델 신뢰도를 추정하는 메타러닝 기반의 접근을 취하며, 모델의 신뢰도 점수에 의존하지 않는다.
- 이 방법은 다섯 개의 소스-타겟 도메인 쌍에서 추출적 질의 응답 및 자연어 추론이라는 두 가지 작업에 대해 평가된다.
실험 결과
연구 질문
- RQ1블랙박스 모델 기여도에서 유도된 설명이 도메인 간 데이터에서 모델의 성능을 향상시키는 데 기여할 수 있는가?
- RQ2모델 기여도와 인간이 식별한 히ュ리스틱을 조합하면 설명을 사용하지 않는 기준 모델보다 더 나은 校정기 성능을 달성할 수 있는가?
- RQ3재학습 없이도 훈련된 校정기가 새로운 도메인이나 작업에 일반화될 수 있는가?
- RQ4선택적 예측 설정에서, 설명 기반의 校정기가 기존 방법보다 신뢰할 수 있는 예측을 더 잘 식별할 수 있는가?
주요 결과
- LimeCal이라는 이름의 설명 기반 校정기는 추출적 질의 응답 및 자연어 추론 작업에서 모두 다섯 개의 도메인 쌍에서 기준 모델을 일관되게 능가한다.
- 선택적 QA 설정에서 LimeCal은 모든 방법 중에서 가장 높은 성능을 기록하며, 특히 Squad-Adv를 OOD 분포로 사용할 경우 두드러진 성능을 보인다.
- 일부 설정에서는 설명 기반의 校정기가 타겟 도메인 데이터에 대해 전체 모델 파rameter에 접근할 수 있는 미세조정보다도 뛰어난 성능을 보였다.
- 교정기는 전이 가능성(transferability)을 보이며, 한 도메인에서 훈련된 모델이 다른 도메인으로 일반화됨을 시사하며, 학습된 히ュ리스틱이 다양한 도메인에서 강건함을 입증한다.
- 기본 모델이 도메인 간 예측에서 실패하더라도, 이 방법은 정확한 예측을 고도로 식별함으로써 모델 신뢰도를 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.