Skip to main content
QUICK REVIEW

[논문 리뷰] Prompt-Matched Semantic Segmentation

Lingbo Liu, Jianlong Chang|arXiv (Cornell University)|2022. 08. 22.
Advanced Neural Network Applications인용 수 12
한 줄 요약

이 논문은 정적 시각 기초 모델의 의미 분할을 위한 파rameter 효율적인 미세조정을 위한 단계별 프롬프트 매칭 프레임워크를 제안한다. CNN 및 Transformer 기반 모델의 단계 사이에 경량의 의미 인식 프롬프트 매처(Semantic-aware Prompt Matcher, SPM)를 삽입함으로써 중간 의미 맵을 이용해 점진적으로 효과적인 시각 프롬프트를 학습하는 방법으로, 전면 미세조정 및 이전의 프롬프트 미세조정 방법보다 뛰어난 성능을 내며, 학습 가능한 파라미터 수가 단 176만 개에 불과하다.

ABSTRACT

The objective of this work is to explore how to effectively and efficiently adapt pre-trained visual foundation models to various downstream tasks of semantic segmentation. Previous methods usually fine-tuned the entire networks for each specific dataset, which will be burdensome to store massive parameters of these networks. A few recent works attempted to insert some extra trainable parameters into the frozen networks to learn visual prompts for parameter-efficient tuning. However, these works showed poor generality as they were designed specifically for Transformers. Moreover, using limited information in these schemes, they exhibited a poor capacity to learn beneficial prompts. To alleviate these issues, we propose a novel Stage-wise Prompt-Matched Framework for generic and effective visual prompt tuning. Specifically, to ensure generality, we divide the pre-trained backbone with frozen parameters into multiple stages and perform prompt learning between different stages, which makes the proposed scheme applicable to various architectures of CNN and Transformer. For effective tuning, a lightweight Semantic-aware Prompt Matcher (SPM) is designed to progressively learn reasonable prompts with a recurrent mechanism, guided by the rich information of interim semantic maps. Working as deep matched filter of representation learning, the proposed SPM can well transform the output of the previous stage into a desirable input for the next stage, thus achieving the better matching/stimulating for the pre-trained knowledge. Extensive experiments on four benchmarks demonstrate that the proposed scheme can achieve a promising trade-off between parameter efficiency and performance effectiveness. Our code and models will be released.

연구 동기 및 목표

  • 기존의 프롬프트 튜닝 방법이 트랜스포머에 국한되어 있고 파라미터 효율성이 떨어지며 일반화 성능이 열 劣한 데 대비하여 이를 해결하고자 한다.
  • 정적 CNN 및 트랜스포머 기반 모델의 효과적이고 일반적인 미세조정을 가능하게 하고자 한다.
  • 최종 분류 손실 외에 rich한 중간 의미 표현을 활용하여 프롬프트 학습을 향상시키고자 한다.
  • 고속 및 단계 통합 추론 장치에 적용 가능한 파라미터 효율적인 튜닝 프레임워크를 설계하고자 한다.
  • 다양한 아키텍처 간 호환성을 유지하면서 최소한의 학습 가능한 파라미터로 뛰어난 성능을 달성하고자 한다.

제안 방법

  • 정적 기반 모델을 다수의 단계로 나누고, 인접한 단계 사이에 경량의 의미 인식 프롬프트 매처(Semantic-aware Prompt Matcher, SPM)를 삽입하여 프롬프트 튜닝을 수행한다.
  • SPM은 이전 단계의 중간 의미 맵을 기반으로 하여 순환 구조를 통해 시각 프롬프트를 점진적으로 개선한다.
  • SPM은 특징 맵과 의미 확률 벡터를 연결, 1×1 컨볼루션, PDC 모듈을 통해 융합하여 정교화된 프롬프트를 생성한다.
  • SPM은 깊은 매칭 필터 역할을 하여 한 단계의 출력을 다음 단계의 최적 입력으로 변환함으로써 지식 전이를 향상시킨다.
  • 이 프레임워크는 ResNet과 같은 CNN과 ViT와 같은 트랜스포머 모두에 적용 가능하여 다양한 아키텍처에 일반화 가능하다.
  • SPM은 기반 모델의 구조를 수정하지 않고도 분류 헤드 손실만을 사용하여 엔드 투 엔드로 학습된다.

실험 결과

연구 질문

  • RQ1기반 아키텍처의 수정 없이도 CNN과 트랜스포머 아키텍처에 모두 일반화 가능한 프롬프트 튜닝 프레임워크를 설계할 수 있는가?
  • RQ2최종 분류 손실 외에 중간 의미 맵을 효과적으로 활용하여 프롬프트 학습을 향상시킬 수 있는가?
  • RQ3단계별로 순환 구조를 가진 프롬프트 학습 메커니즘이 성능과 파라미터 효율성 측면에서 기존의 프롬프트 튜닝 방법을 능가할 수 있는가?
  • RQ4전체 미세조정 및 헤드 튜닝에 비해 학습 가능한 파라미터 수를 크게 줄였을 때도 강력한 성능을 유지할 수 있는가?
  • RQ5이 프레임워크는 자연 이미지, 위성 이미지, 의료 영상 분할과 같은 다양한 응용 분야에 효과적으로 적용될 수 있는가?

주요 결과

  • 제안된 방법은 Cityscapes 벤치마크에서 mIoU 45.05를 달성하여 전면 미세조정(47.53)과 다른 프롬프트 튜닝 방법을 능가한다.
  • COCO-Stuff 데이터셋에서 176만 개의 학습 가능한 파라미터로만 mIoU 44.18을 달성하여 높은 파라미터 효율성을 입증한다.
  • 이미지 인식 작업에서는 CIFAR-100에서 100만 개의 학습 가능한 파라미터로 top-1 정확도 86.62%를 기록하여 전면 미세조정(85.90%)과 AdaptFormer(85.90%)를 능가한다.
  • 모든 벤치마크에서 평균적으로 전면 미세조정 대비 학습 가능한 파라미터 수를 1.16%로 줄였으며, 성능은 유지하거나 초월한다.
  • SPM 프레임워크는 아키텍처 간 일반화가 잘 되어 있으며 자연, 위성, 의료 영상 분할 데이터셋에서 뛰어난 성능을 기록한다.
  • 제거 분석 결과, 중간 의미 맵을 사용할 경우 블랙박스 최적화에 비해 프롬프트 품질과 최종 성능이 크게 향상됨을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.