Skip to main content
QUICK REVIEW

[논문 리뷰] Polyhistor: Parameter-Efficient Multi-Task Adaptation for Dense Vision Tasks

Yen‐Cheng Liu, Chih‐Yao Ma|arXiv (Cornell University)|2022. 10. 07.
Multimodal Machine Learning Applications인용 수 15
한 줄 요약

Polyhistor 및 Polyhistor-Lite는 밀도 높은 시각 작업을 위한 비용 효율적인 다중 작업 적응 방법으로, 시각 트랜스포머를 사용하며, 분해된 하이퍼네트워크와 계층별 스케일링 커널을 도입하여 학습 가능한 파라미터를 최대 90% 감소시키면서도 전체 미세조정 성능에 맞추거나 초월한다. 이 방법은 기존 방법보다 약 10%의 파라미터만을 사용하여 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

Adapting large-scale pretrained models to various downstream tasks via fine-tuning is a standard method in machine learning. Recently, parameter-efficient fine-tuning methods show promise in adapting a pretrained model to different tasks while training only a few parameters. Despite their success, most existing methods are proposed in Natural Language Processing tasks with language Transformers, and adaptation to Computer Vision tasks with Vision Transformers remains under-explored, especially for dense vision tasks. Further, in multi-task settings, individually fine-tuning and storing separate models for different tasks is inefficient. In this work, we provide an extensive multi-task parameter-efficient benchmark and examine existing parameter-efficient fine-tuning NLP methods for vision tasks. Our results on four different dense vision tasks showed that existing methods cannot be efficiently integrated due to the hierarchical nature of the Hierarchical Vision Transformers. To overcome this issue, we propose Polyhistor and Polyhistor-Lite, consisting of Decomposed HyperNetworks and Layer-wise Scaling Kernels, to share information across different tasks with a few trainable parameters. This leads to favorable performance improvements against existing parameter-efficient methods while using fewer trainable parameters. Specifically, Polyhistor achieves competitive accuracy compared to the state-of-the-art while only using ~10% of their trainable parameters. Furthermore, our methods show larger performance gains when large networks and more pretraining data are used.

연구 동기 및 목표

  • 기존의 파라미터 효율적인 미세조정 방법이 계층적 시각 트랜스포머를 사용하는 밀도 높은 시각 작업에서 비효율적인 문제를 해결하기 위해.
  • 다중 작업 밀도 높은 시각 기준 평가에서 어댑터 기반 및 하이퍼네트워크 기반 방법의 한계를 극복하기 위해.
  • 다양한 밀도 높은 시각 작업 간 지식을 공유하면서도 학습 가능한 파라미터를 최소화하는 통합된 파라미터 효율적 프레임워크를 설계하기 위해.
  • 모델 크기와 사전학습 데이터 제약 조건이 다양한 경우에 파라미터 효율적 방법의 확장성과 성능을 평가하기 위해.
  • 더 큰 모델과 더 많은 사전학습 데이터가 제안된 방법의 성능 향상에 기여하는지 입증하기 위해.

제안 방법

  • 단일 큰 하이퍼네트워크를 두 개의 더 작은 저질서 하이퍼네트워크로 분할하는 분해된 라이트-하이퍼네트워크를 제안하여 어댑터 가중치를 생성함으로써 파라미터 수를 줄이고 성능를 유지한다.
  • 어댑터 가중치 행렬을 크론커 곱을 통해 템플릿 커널과 크기 조절 가능한 스케일링 커널으로 분해하는 계층별 스케일링 커널을 도입함으로써 계층적 시각 트랜스포머에서 계층 간 파라미터 공유를 가능하게 한다.
  • 모든 계층에 공통된 템플릿 커널을 사용하고, 계층의 특징 차원에 따라 스케일링 커널 크기를 조절함으로써 파라미터 수를 늘리지 않고도 효율적인 적응을 가능하게 한다.
  • 작업별 임bedding을 사용해 하이퍼네트워크를 조절함으로써 각 작업이 고유한 적응 경로를 가지면서도 핵심적인 파라미터 효율적 메커니즘은 공유할 수 있도록 한다.
  • 스윙 트랜스포머 기반 모델에 이 방법을 적용하여 세분화, 인스턴스 세분화, 시각적 주목도 예측, 노멀 벡터 추정 등 다양한 작업을 함께 학습시키며 최소한의 파라미터 업데이트로 가능하게 한다.
  • 기존의 NLP 기반 파라미터 효율적 방법과 공정하게 비교할 수 있도록 일관된 학습 및 평가 프로토콜을 갖춘 통합 벤치마크 프레임워크를 구축한다.

실험 결과

연구 질문

  • RQ1비디오 트랜스포머를 사용할 때, NLP 기반 파라미터 효율적 미세조정 방법이 밀도 높은 시각 작업에 효과적으로 적용될 수 있는가?
  • RQ2왜 어댑터 기반 및 하이퍼네트워크 기반 방법은 계층적 시각 트랜스포머에서 다중 작업 학습에 대해 효율적으로 확장되지 않는가?
  • RQ3성능을 훼손하지 않으면서도 다중 작업 시각 적응의 학습 가능한 파라미터 수를 어떻게 줄일 수 있는가?
  • RQ4파라미터 효율적 방법의 성능 향상은 모델 크기와 사전학습 데이터 크기에 따라 비례하는가?
  • RQ5작업 간 공통의 적응 메커니즘을 통해 태스크 전용 미세조정보다 더 적은 파라미터로도 뛰어난 성능을 낼 수 있는가?

주요 결과

  • Polyhistor-Lite는 ImageNet-1k 사전학습을 기반으로 한 Swin-Tiny에서 단일 작업 전체 미세조정 대비 평균 정확도 1.74% 향상 달성과 同시에 뿌리 파라미터 0.41M개(전체 모델의 0.36%)만을 사용한다.
  • 기존의 상위 기술 수준의 다중 작업 파라미터 효율적 방법보다 훨씬 더 많은 파라미터를 사용하지만도 경쟁력 있는 성능를 달성하며, 그들의 학습 가능한 파라미터의 약 10%만으로도 성능를 확보한다.
  • 모델 크기가 커질수록 성능 향상이 증가한다: Swin-Base에서 Swin-Tiny보다 더 큰 향상이 관찰되어 모델 크기에 따른 확장성 확인.
  • ImageNet-22k에서 사전학습한 모델는 ImageNet-1k보다 더 큰 성능 향상을 보이며, 동일한 성능 수준에 도달하기 위해 더 적은 학습 가능한 파라미터가 필요하다.
  • 더 큰 작업 임bedding 차원(최대 64)은 평균 성능 향상에 기여하며, k=64를 사용할 경우 전체 미세조정 대비 1.74% 향상 달성.
  • 이 방법은 세분화, 인스턴스 세분화, 시각적 주목도 예측, 노멀 벡터 추정 등 다양한 밀도 높은 시각 작업에서 강력한 성능를 유지하며 광범위한 적용 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.