[논문 리뷰] Not All Attention Is All You Need
이 논문은 사전 훈련된 언어 모델에서 샘플별로, 계층별로 동적으로 드롭아웃 패턴을 생성하는 데에 자기주의(self-attention)를 사용하는 AttendOut을 제안한다. 이는 다운스트림 NLP 작업에서 강건성과 성능을 크게 향상시킨다. AttendOut은 적응형 주의 정규화를 학습하여, 고정 확률 및 정적 드롭아웃 방법을 초월해 여러 벤치마크에서 최고 성능을 기록한다.
Beyond the success story of pre-trained language models (PrLMs) in recent natural language processing, they are susceptible to over-fitting due to unusual large model size. To this end, dropout serves as a therapy. However, existing methods like random-based, knowledge-based and search-based dropout are more general but less effective onto self-attention based models, which are broadly chosen as the fundamental architecture of PrLMs. In this paper, we propose a novel dropout method named AttendOut to let self-attention empowered PrLMs capable of more robust task-specific tuning. We demonstrate that state-of-the-art models with elaborate training design may achieve much stronger results. We verify the universality of our approach on extensive natural language processing tasks.
연구 동기 및 목표
- 제한된 데이터로 작업에 특화된 피니튜닝 중에 깊은 자기주의 네트워크에서 과적합과 상호적응을 해결하기 위해.
- 고정 확률과 샘플 수준 적응성이 부족한 정적, 랜덤 기반 드롭아웃 방법의 한계를 극복하기 위해.
- 각 샘플과 계층별로 동적으로 주의에 기반한 드롭아웃 패턴을 생성하는 학습 가능한, 종단 간 드롭아웃 메커니즘을 개발하기 위해.
- AttendOut이 다양한 NLP 작업과 모델 아키텍처에서 보편적이고 효과적인지 입증하기 위해.
제안 방법
- AttendOut은 자기주의 메커니즘을 사용하여 각 주의 헤드와 샘플에 대해 동적 드롭아웃 마스크를 생성하는 학습 가능한 주의 기반 드롭아웃 모듈(G-Net)을 도입한다.
- 이 방법은 훈련 중에 주의 행렬에 이러한 학습된 마스크를 적용하여, 샘플별로 계층별로 드롭아웃을 통해 주의 상호적응을 효과적으로 정규화한다.
- 드롭아웃 패턴 생성은 미분 가능하며, backpropagation를 통해 종단 간으로 훈련되어 최적의 주의 정규화 패턴을 학습할 수 있다.
- AttendOut의 동적 패턴을 근사하기 위해 스케줄링된 베르누이 드롭아웃 기반 베이스라인을 도입하여, 학습된 구조의 효과성을 검증한다.
- 표준 사전 훈련된 모델인 RoBERTa에 적용되며, 아키텍처 변경 최소화와 추가 추론 비용 없이 구현된다.
- 표준 벤치마크를 사용하여 텍스트 분류 및 자연어 추론을 포함한 여러 NLP 작업에서 평가된다.
실험 결과
연구 질문
- RQ1동적이고 주의 기반의 드롭아웃 패턴은 자기주의 기반 사전 훈련된 언어 모델의 일반화 및 강건성 향상에 기여하는가?
- RQ2AttendOut은 고정 확률 드롭아웃 및 LayerDrop과 같은 계층 수준 정규화 방법에 비해 성능 및 안정성 측면에서 어떻게 비교되는가?
- RQ3학습 동역학을 관찰할 때, 학습된 드롭아웃 패턴이 작업별 및 계층별 정규화 요구를 얼마나 잘 반영하는가?
- RQ4AttendOut의 패턴을 스케줄링된 랜덤 기반 근사치로 구현하면 동일한 성능를 달성할 수 있는가? 이는 학습된 구조의 타당성을 시사하는가?
- RQ5AttendOut은 다양한 데이터 스케일과 복잡도를 가진 다양한 NLP 작업에서 보편적으로 효과적인가?
주요 결과
- AttendOut은 CoLA 벤치마크에서 바닐라 드롭아웃 대비 4.1%p의 절대적 향상을 기록하여 동적 정규화의 효과를 입증한다.
- QNLI에서 AttendOut은 RoBERTa의 정확도를 92.0에서 93.1로 향상시켜, 모든 작업에서 일관된 성능 향상을 보였다.
- LayerDrop 및 Attn.LayerDrop보다 우수하며, MNLI에서 1.0%p 향상되고 CoLA에서 1.7%p 향상되어 RoBERTa를 초월한다.
- 학습된 드롭아웃 패턴은 하위 계층에서 높은 확률을 보이며 동적 적응을 보이며, 특히 CoLA에서는 최대 0.9까지 증가하여 작은 데이터셋에 대해 더 강한 정규화를 나타낸다.
- 스케줄링된 베르누이 드롭아웃 기반 베이스라인이 AttendOut의 성능을 밀접하게 근사한다(0.8%p 향상, CoLA 기준)로, 동적 패턴 학습의 정확성을 검증한다.
- 수렴 곡선은 AttendOut이 더 빠르고 안정적인 훈련을 가능하게 하며, 성능이 에포크가 진행되면서 안정적으로 향상됨을 보여주며, 기준 모델이 정체되거나 감소하는 것과 대비된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.