Skip to main content
QUICK REVIEW

[논문 리뷰] The Stem Cell Hypothesis: Dilemma behind Multi-Task Learning with Transformer Encoders

Han He, Jinho D. Choi|arXiv (Cornell University)|2021. 09. 14.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 스템 셀 가설을 제안하며, 공유된 어텐션 헤드가 트랜스포머 인코더에서 다중 자연어 처리(NLP) 작업을 본질적으로 잘 수행하지만, 상충하는 최적화 신호로 인해 공동 미세조정 시 성능이 떨어진다고 설명한다. 다섯 가지 핵심 NLP 작업(POS, NER, DEP, CON, SRL)에 걸쳐 광범위한 잘라내기와 파rameter-free 탐사 기법을 통해 저자들은 다중작업 학습(MTL)이 단일작업 학습보다 성능이 열 劣하는 이유가 이러한 '스템 셀' 헤드가 작업별 전문성을 상실하기 때문이며, 이로 인해 모든 작업의 성능이 악화된다고 밝힌다.

ABSTRACT

Multi-task learning with transformer encoders (MTL) has emerged as a powerful technique to improve performance on closely-related tasks for both accuracy and efficiency while a question still remains whether or not it would perform as well on tasks that are distinct in nature. We first present MTL results on five NLP tasks, POS, NER, DEP, CON, and SRL, and depict its deficiency over single-task learning. We then conduct an extensive pruning analysis to show that a certain set of attention heads get claimed by most tasks during MTL, who interfere with one another to fine-tune those heads for their own objectives. Based on this finding, we propose the Stem Cell Hypothesis to reveal the existence of attention heads naturally talented for many tasks that cannot be jointly trained to create adequate embeddings for all of those tasks. Finally, we design novel parameter-free probes to justify our hypothesis and demonstrate how attention heads are transformed across the five tasks during MTL through label analysis.

연구 동기 및 목표

  • 공유된 트랜스포머 인코더를 사용한 다중작업 학습(MTL)이 다양한 핵심 NLP 작업에서 단일작업 학습보다 성능이 열 劣하는 이유를 조사하는 것.
  • 작업 간 어텐션 헤드가 공유되는지 여부와 그들의 미세조정 동역학이 성능에 미치는 영향을 규명하는 것.
  • 어텐션 헤드 경쟁과 간섭을 원인으로 삼아 MTL 실패의 근본 원인을 설명하는 것.
  • '스템 셀' 어텐션 헤드 존재를 검증하는 것 — 본질적으로 다수의 작업에 능숙하지만 공동 학습 시 성능이 떨어지는 헤드.
  • 단일작업 및 다중작업 설정에서 어텐션 헤드 행동을 분석하기 위해 파rameter-free 탐사 방법을 개발하고 적용하는 것.

제안 방법

  • 공유된 BERT 기반 인코더를 사용해 다섯 가지 핵심 NLP 작업(POS, NER, DEP, CON, SRL)에서 다중작업 학습(MTL)을 수행하였다.
  • 각 작업에 필수적인 어텐션 헤드를 특정하기 위해 광범위한 구조적 잘라내기를 수행하였으며, 작업 간 높은 중첩이 드러났다.
  • 스템 셀 가설을 제안: 일부 어텐션 헤드는 본질적으로 다중작업 수행 능력을 지니지만, 상충하는 기울기로 인해 공동 미세조정 시 성능이 떨어진다.
  • 추가 파rameter 없이 어텐션 헤드 성능과 변환을 평가하기 위해 새로운 파rameter-free 탐사 방법을 설계하였다.
  • 동적 및 정적 잘라내기를 사용해 단일작업 및 다중작업 설정에서 헤드 활용도와 성능 트레이드오프를 측정하였다.
  • 헤드 할당 패턴을 추적하기 위해 RGB 인코딩된 런 집계를 사용해 레이어 및 작업 간 어텐션 헤드 활용도를 시각화하였다.

실험 결과

연구 질문

  • RQ1공유된 트랜스포머 인코더를 사용한 다중작업 학습이 다양한 NLP 작업에서 단일작업 학습보다 성능이 열 劣하는 이유는 무엇인가?
  • RQ2어떤 정도로 어텐션 헤드가 서로 다른 NLP 작업 간에 공유되는가? 이 공유가 모델 성능에 어떤 영향을 미치는가?
  • RQ3일부 어텐션 헤드가 본질적으로 다중작업 능력을 지니는가? 만약 그렇다면 공동 학습 시 실패하는 이유는 무엇인가?
  • RQ4단일작업과 다중작업 미세조정 간 탐사 결과 및 헤드 활용도 패턴은 어떻게 다를까?
  • RQ5파rameter-free 탐사 방법은 MTL에서 어텐션 헤드의 행동과 성능 저하를 효과적으로 드러낼 수 있는가?

주요 결과

  • 모든 다섯 가지 작업에서의 다중작업 학습(MTL-5)은 단일작업 학습보다 일관되게 성능이 열 劣하며, 특히 SRL에서 가장 열 열성인 성능을 보였다(단일작업: 83.56% 대비 MTL: 83.52%).
  • 다섯 가지 작업 모두 거의 동일한 어텐션 헤드 세트에 의존하여 공동 학습 시 경쟁과 간섭이 발생한다.
  • 파rameter-free 탐사 결과, 어떤 작업에도 미세조정되지 않은 헤드도 언어적 구조에서 높은 성능을 달성함으로써 자연스럽게 뛰어난 능력을 지닌 '스템 셀' 헤드 존재를 확인하였다.
  • 단일작업 학습 후 탐사 정확도는 작업 성능 향상과 함께 향상되었으며, 이는 스템 셀 헤드가 작업 전용 전문가로 진화함을 시사한다.
  • 다중작업 학습에서는 탐사 및 작업 성능이 뚜렷이 저하되었으며, 이는 상충하는 신호가 헤드 전문성에 악영향을 준다는 가설을 지지한다.
  • 헤드 활용도 분석 결과, MTL-DP 모델은 단일작업 모델 대비 더 높은 헤드 비율(예: BERT 기준 53.47%)을 사용함을 확인하여 경쟁 증가 및 비효율적 할당을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.