Skip to main content
QUICK REVIEW

[논문 리뷰] Finding Experts in Transformer Models

Xavier Suau, Luca Zappella|arXiv (Cornell University)|2020. 05. 15.
Topic Modeling참고 문헌 31인용 수 15
한 줄 요약

이 논문은 OneSec 데이터셋에서 추출한 1,641개의 개념에서 유래한 데이터셋을 사용하여 사전 훈련된 Transformer 모델 내의 '전문가 유닛'(특정 개념을 높은 평균 정밀도로 분류하는 뉴런)을 식별하고 활용하는 방법을 제안한다. 전문가 유닛의 품질이 모델의 일반화 능력과 강하게 상관되며(R² = 0.833), 추가 훈련 없이도 상위 전문가 유닛만 활성화하여 특정 개념 기반 텍스트 생성이 가능하고, 개념 공학 학습 분석을 통해 설명 가능성을 향상시킬 수 있음을 보여준다.

ABSTRACT

In this work we study the presence of expert units in pre-trained Transformer Models (TM), and how they impact a model's performance. We define expert units to be neurons that are able to classify a concept with a given average precision, where a concept is represented by a binary set of sentences containing the concept (or not). Leveraging the OneSec dataset (Scarlini et al., 2019), we compile a dataset of 1641 concepts that allows diverse expert units in TM to be discovered. We show that expert units are important in several ways: (1) The presence of expert units is correlated ($r^2=0.833$) with the generalization power of TM, which allows ranking TM without requiring fine-tuning on suites of downstream tasks. We further propose an empirical method to decide how accurate such experts should be to evaluate generalization. (2) The overlap of top experts between concepts provides a sensible way to quantify concept co-learning, which can be used for explainability of unknown concepts. (3) We show how to self-condition off-the-shelf pre-trained language models to generate text with a given concept by forcing the top experts to be active, without requiring re-training the model or using additional parameters.

연구 동기 및 목표

  • 사전 훈련된 Transformer 모델 내에 전문화된 뉴런(전문가 유닛)이 존재하는지, 그리고 그들이 모델 성능과 어떻게 관련되어 있는지 조사하기.
  • 추가 파라미터나 미세조정 없이 전문가 유닛을 식별하고 순위를 매기는 방법 개발하기.
  • 전문가 유닛을 특정 개념 기반 텍스트 생성에 어떻게 활용할 수 있는지 탐색하기.
  • 전문가 겹침을 통해 개념 간 공학 학습을 정량화하여 모델의 설명 가능성을 향상시키기.
  • 다양한 최종 작업에서 전문가 유닛 품질과 모델 일반화 능력 간의 상관관계를 확립하기.

제안 방법

  • OneSec 데이터셋에서 1,641개의 개념을 사용하여 개념을 양성/비양성 문장 쌍의 이진 집합으로 정의한다.
  • Transformer 모델 내 개별 뉴런을 후보 전문가 유닛으로 간주하고, 개념 분류에 대한 평균 정밀도(AP)를 계산한다.
  • 시퀀스 길이에 영향을 받지 않도록 토큰 수준의 뉴런 활성화에 대해 최대 풀링을 적용한다.
  • 전문가 유닛을 AP 점수 기준으로 순위를 매기고, 상위 전문가의 평균 AP를 '개념 전문성'으로 정의한다.
  • 전문가의 곱을 사용한 공식을 적용하여, 목표 개념에 대해 상위 전문가 유닛만 활성화함으로써 사전 훈련된 언어 모델을 자가조건화한다.
  • 일반화 성능과의 상관관계를 최대화하는 데 최적의 전문성 임계값을 결정하는 경험적 방법을 제안한다 (AP > 0.985).

실험 결과

연구 질문

  • RQ1사전 훈련된 Transformer 모델 내에 전문가 유닛이 존재하는가? 그리고 이들의 품질은 모델 일반화 능력과 어떻게 상관되는가?
  • RQ2추가 파라미터나 미세조정 없이도 전문가 유닛을 특정 개념 기반 텍스트 생성에 활용할 수 있는가?
  • RQ3개념 간 전문가 겹침을 어떻게 활용하여 공학 학습을 정량화하고 설명할 수 있는가?
  • RQ4일반화 성능과의 상관관계를 최대화하기 위한 전문가 품질의 최적 임계값(AP)은 무엇인가?
  • RQ5다양한 최종 작업에 대해 미세조정 없이도 전문가 유닛을 사용하여 모델 순위를 매길 수 있는가?

주요 결과

  • 전문가 유닛의 품질은 모델 일반화 능력과 강하게 상관되며, GLUE 및 SQuAD 작업에서 평균 성능과의 상관관계 R²가 0.833이다.
  • 일반화 상관관계를 최대화하기 위한 최적의 전문가 품질 임계값은 AP > 0.985이며, 이는 매우 높은 정밀도를 가진 전문가가 강력한 일반화 능력에 핵심적임을 시사한다.
  • GPT-2-L의 경우, 전체 414,720개 뉴런 중 상위 50개(0.012%)만으로도 재학습 없이도 특정 개념('football%1:04:00')을 풍부하게 포함한 텍스트 생성이 가능하다.
  • 전문가 간 겹침은 공학 학습을 의미 있는 방식으로 측정할 수 있으며, 관련 개념이 모델 내에서 어떻게 표현되는지 설명 가능성을 향상시킨다.
  • 이 방법을 통해 최종 작업에 대한 미세조정 없이도 모델 간 비교 및 순위 매김이 가능해져, 최종 작업 편향과 하이퍼파rameter 탐색을 줄일 수 있다.
  • 전문가 활성화를 통한 자가조건화는 도식 1에서 볼 수 있듯이 맥락적으로 관련된 텍스트를 성공적으로 생성한다. 여기서 'TM'은 스포츠 맥락에서 해석되며, 'coach'(코치)와 'shooting'(슛)이 두드러지게 나타난다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.