Skip to main content
QUICK REVIEW

[논문 리뷰] SAM-PARSER: Fine-tuning SAM Efficiently by Parameter Space Reconstruction

Zelin Peng, Zhengqin Xu|arXiv (Cornell University)|2023. 08. 28.
Advanced Neural Network ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 세그먼테이션 어芮비어리티 모델(SAM)을 위한 파라미터 효율적 파인튜닝 방법인 SAM-PARSER를 제안한다. 이 방법은 SAM의 원본 가중치에 대한 특이값 분해(SVD)를 통해 최종 작업에 특화된 파라미터 공간을 재구성함으로써, 거의 추가로 학습 가능한 파라미터가 없는 상태에서 파인튜닝을 가능하게 한다. 이는 자연 이미지, 원격 감시 이미지, 의료 영상 데이터셋 전반에서 최신 기술 수준의 세그먼테이션 성능를 달성하면서도, 기존 방법 대비 학습 가능한 파라미터를 약 290배 감소시킨다.

ABSTRACT

Segment Anything Model (SAM) has received remarkable attention as it offers a powerful and versatile solution for object segmentation in images. However, fine-tuning SAM for downstream segmentation tasks under different scenarios remains a challenge, as the varied characteristics of different scenarios naturally requires diverse model parameter spaces. Most existing fine-tuning methods attempt to bridge the gaps among different scenarios by introducing a set of new parameters to modify SAM's original parameter space. Unlike these works, in this paper, we propose fine-tuning SAM efficiently by parameter space reconstruction (SAM-PARSER), which introduce nearly zero trainable parameters during fine-tuning. In SAM-PARSER, we assume that SAM's original parameter space is relatively complete, so that its bases are able to reconstruct the parameter space of a new scenario. We obtain the bases by matrix decomposition, and fine-tuning the coefficients to reconstruct the parameter space tailored to the new scenario by an optimal linear combination of the bases. Experimental results show that SAM-PARSER exhibits superior segmentation performance across various scenarios, while reducing the number of trainable parameters by $\approx 290$ times compared with current parameter-efficient fine-tuning methods.

연구 동기 및 목표

  • 다양한 최종 작업 세그먼테이션 시나리오에 대해 파라미터 업데이트를 최소화하면서 SAM을 파인튜닝하는 데 도전하는 것.
  • 세그먼테이션 성능를 유지하거나 향상시키면서 SAM 파인튜닝 시 학습 가능한 파라미터 수를 줄이는 것.
  • SAM의 원본 파라미터 공간이 새로운 작업 전용 파라미터 공간을 새로운 파라미터를 추가하지 않고도 충분히 재구성할 수 있는지 탐색하는 것.
  • 새로운 학습 가능한 헤드나 어댑터를 추가하는 것을 피하고, 분해된 기저의 계수를 파인튜닝하는 데 의존하는 방법을 개발하는 것.

제안 방법

  • 이 방법은 SAM의 컨볼루션 인코더 가중치에 대해 특이값 분해(SVD)를 수행하여 정규직교 기저와 관련 계수를 추출한다.
  • 원본 파라미터 공간이 이러한 기저의 선형 조합을 통해 새로운 작업 전용 파라미터 공간을 재구성하는 데 충분히 완전하다고 가정한다.
  • 적응 과정에서 오직 SVD 계수만 파인튜닝되며, 거의 새로운 학습 가능한 파라미터가 발생하지 않는다.
  • 파라미터 오버헤드를 최소화하기 위해 이 접근법은 SAM 인코더의 컨볼루션 레이어에만 집중한다. 트랜스포머 레이어에는 적용하지 않는다.
  • 최적의 기저 조합은 목표 시나리오의 파라미터 공간과 일치하도록 계수를 파인튜닝하여 학습된다.
  • 이 방법은 자연 이미지, 원격 감시, 의료 영상 세그먼테이션이라는 세 가지 다른 시나리오에 적용된다.

실험 결과

연구 질문

  • RQ1SAM의 원본 파라미터 공간이 새로운 최종 작업 세그먼테이션 작업에 적응하기 위해 새로운 파라미터를 추가하지 않고도 충분히 재구성될 수 있는가?
  • RQ2SVD 기반 계수 파인튜닝을 통한 파라미터 공간 재구성은 LoRA나 어댑터와 같은 기존의 파라미터 효율적 방법과 비교해 세그먼테이션 성능와 파라미터 효율성에서 어떻게 다른가?
  • RQ3SAM의 원본 파라미터 공간의 완전성 가정이 깨지는 시나리오는 어떤 경우이며, 이를 어떻게 완화할 수 있는가?
  • RQ4전체 모델이나 트랜스포머 구성 요소를 파인튜닝하는 것보다 컨볼루션 인코더 레이어에만 집중하는 것이 더 높은 효율성과 성능을 낳는가?

주요 결과

  • SAM-PARSER는 최신 기술 수준의 파라미터 효율적 방법인 LoRA 대비 학습 가능한 파라미터를 약 290배 감소시킨다.
  • PASCAL VOC2012 데이터셋에서 SAM-PARSER는 mIoU 86.7%를 기록하여 베이스라인 및 LoRA를 모두 초월한다.
  • NWPU VHR-10 원격 감시 데이터셋에서 SAM-PARSER는 베이스라인 대비 mIoU를 1.3%포인트 향상시켰다.
  • CT Abdominal organ 테스트 세트에서 SAM-PARSER는 DSC 91.1%를 달성하여 LoRA의 90.3%를 0.8%포인트 초월했다.
  • SSDD 레이더 이미지 데이터셋의 실패 케이스에서 SAM-PARSER는 LoRA 및 어댑터보다 성능이 열 劣하므로, 새로운 도메인이 SAM의 사전학습 분포와 너무 다를 경우의 한계를 보여준다.
  • 정성적 결과에서는 SAM-PARSER가 다양한 시나리오에서 LoRA 및 어댑터보다 더 정확하고 일관성 있는 세그먼테이션 마스크를 생성함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.