Skip to main content
QUICK REVIEW

[논문 리뷰] KronA: Parameter Efficient Tuning with Kronecker Adapter

Ali Edalati, Marzieh S. Tahaei|arXiv (Cornell University)|2022. 12. 20.
Topic Modeling인용 수 11
한 줄 요약

KronA는 저랭크 분해 대신 크로네커 곱 분해를 사용하여 트랜스포머 기반 사전 훈련된 언어 모델을 위한 파라미터 효율적 튜닝 방법을 제안한다. 저랭크 어댑터를 크로네커 기반 모듈로 대체함으로써, 추론 지연 시간의 증가 없이 GLUE 벤치마크에서 최신 기술 수준의 성능을 달성하며, $ ext{KronA}^{ ext{B}}$ 및 $ ext{KronA}^{ ext{B}}_{ ext{res}}$를 통해 더 높은 성능 향상을 이룰 수 있다. 이는 더 높은 지연 시간을 수반한다.

ABSTRACT

Fine-tuning a Pre-trained Language Model (PLM) on a specific downstream task has been a well-known paradigm in Natural Language Processing. However, with the ever-growing size of PLMs, training the entire model on several downstream tasks becomes very expensive and resource-hungry. Recently, different Parameter Efficient Tuning (PET) techniques are proposed to improve the efficiency of fine-tuning PLMs. One popular category of PET methods is the low-rank adaptation methods which insert learnable truncated SVD modules into the original model either sequentially or in parallel. However, low-rank decomposition suffers from limited representation power. In this work, we address this problem using the Kronecker product instead of the low-rank representation. We introduce KronA, a Kronecker product-based adapter module for efficient fine-tuning of Transformer-based PLMs. We apply the proposed methods for fine-tuning T5 on the GLUE benchmark to show that incorporating the Kronecker-based modules can outperform state-of-the-art PET methods.

연구 동기 및 목표

  • 대규모 사전 훈련된 언어 모델을 위한 파라미터 효율적 튜닝(PET) 방법에서 저랭크 분해의 표현력 제한 문제를 해결하기 위해.
  • 추론 지연 시간을 증가시키지 않고 기존 PET 방법들인 LoRA 및 어댑터보다 성능을 향상시키기 위해.
  • 미세조정에서 저랭크 업데이트의 더 표현력 있는 대안으로 크로네커 곱 분해를 사용해 볼 수 있는지 탐색하기 위해.
  • GLUE 벤치마크에서 KronA 및 그 변종($\text{KronA}^{\text{B}}$, $\text{KronA}^{\text{B}}_{\text{res}}$)의 효과를 평가하기 위해.
  • 크로네커 기반 모듈이 전체 미세조정 정확도에 도달하거나 초월하면서도 파라미터 효율성을 유지할 수 있음을 보여주기 위해.

제안 방법

  • KronA는 저랭크 어댑터 모듈을 크로네커 곱 기반의 학습 가능한 파라미터로 대체하여, 가중치 업데이트를 두 개의 더 작은 행렬의 곱으로 분해한다.
  • 크로네커 분해는 T5의 어텐션 및 피드포워드 레이어의 업데이트 행렬에 적용되어, 저랭크 분해보다 더 표현력 있는 파라미터 업데이트를 가능하게 한다.
  • 변종인 $\text{KronA}^{\text{B}}$는 피드포워드 네트워크와 병렬로 크로네커 모듈을 삽입하여 더 강력한 모델링 능력을 가능하게 한다.
  • $\text{KronA}^{\text{B}}_{\text{res}}$에서는 추가로 학습 가능한 잔차 연결을 도입하여 표현력의 강화를 도모한다.
  • 모든 학습 가능한 파라미터는 추론 중 冻결되어 낮은 지연 시간을 유지하며, 최종 작업별 가중치는 원본 모델과 병합될 수 있다.
  • 학습률, 크로네커 인자 형태, 스케일링 인자와 같은 하이퍼파rameter는 개별 작업의 검증 세트 성능을 기반으로 튜닝되었다.

실험 결과

연구 질문

  • RQ1크로네커 곱 분해가 사전 훈련된 언어 모델의 파라미터 효율적 미세조정에서 저랭크 분해보다 우월한 성능을 낼 수 있는가?
  • RQ2제안된 KronA 모듈은 LoRA 및 어댑터와 같은 최신 기술 수준의 PET 방법보다 뛰어난 성능을 내며 추론 지연 시간을 유지할 수 있는가?
  • RQ3피드포워드 경로에 병렬적으로 삽입된 KronA($\text{KronA}^{\text{B}}$)가 전체 미세조정을 초월한 성능 향상을 이룰 수 있는가?
  • RQ4학습 가능한 잔차 연결을 $\text{KronA}^{\text{B}}_{\text{res}}$에 추가함으로써 추가적인 정확도 향상이 이루어지며, 이는 지연 시간 증가를 수반하는가?
  • RQ5크로네커 인자의 하이퍼파rameter 설정이 다양한 GLUE 작업 간의 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • KronA는 추론 지연 시간의 증가 없이 GLUE 벤치마크에서 최신 기술 수준의 PET 방법들, 즉 LoRA 및 어댑터를 모두 능가한다.
  • $\text{KronA}^{\text{B}}$ 변종은 MNLI 및 QNLI를 포함한 여러 작업에서 전체 미세조정보다 높은 GLUE 점수를 달성한다.
  • $\text{KronA}^{\text{B}}_{\text{res}}$ 변종은 학습 가능한 잔차 연결을 통합함으로써 성능을 추가로 향상시켜 여러 GLUE 작업에서 최신 기술 수준의 결과를 달성한다.
  • 크로네커 기반 모듈은 더 적은 파라미터로도 저랭크 분해보다 뛰어난 표현력을 가지며, 이는 더 높은 정확도로 입증된다.
  • 이 방법은 낮은 추론 지연 시간을 유지하므로 지연 시간이 중요한 응용 분야에 적합하다.
  • 크로네커 인자의 하이퍼파rameter 튜닝은 성능에 상당한 영향을 미치며, 최적의 설정은 작업에 따라 다를 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.