[논문 리뷰] TransHP: Image Classification with Hierarchical Prompting
TransHP는 이미지 분류 성능을 햖을 수 있도록 중간 레이어에 코arse-class 프롬프트를 통합하는 새로운 계층적 프롬프팅 메커니즘을 제안한다. 이는 정확도, 데이터 효율성, 모델 해석 가능성 향상에 기여한다. ImageNet에서 ViT-B/16의 정확도를 +2.83% 향상시키며, 훈련 데이터가 10%일 경우 데이터 효율성도 +12.69% 향상시킨다.
This paper explores a hierarchical prompting mechanism for the hierarchical image classification (HIC) task. Different from prior HIC methods, our hierarchical prompting is the first to explicitly inject ancestor-class information as a tokenized hint that benefits the descendant-class discrimination. We think it well imitates human visual recognition, i.e., humans may use the ancestor class as a prompt to draw focus on the subtle differences among descendant classes. We model this prompting mechanism into a Transformer with Hierarchical Prompting (TransHP). TransHP consists of three steps: 1) learning a set of prompt tokens to represent the coarse (ancestor) classes, 2) on-the-fly predicting the coarse class of the input image at an intermediate block, and 3) injecting the prompt token of the predicted coarse class into the intermediate feature. Though the parameters of TransHP maintain the same for all input images, the injected coarse-class prompt conditions (modifies) the subsequent feature extraction and encourages a dynamic focus on relatively subtle differences among the descendant classes. Extensive experiments show that TransHP improves image classification on accuracy (e.g., improving ViT-B/16 by +2.83% ImageNet classification accuracy), training data efficiency (e.g., +12.69% improvement under 10% ImageNet training data), and model explainability. Moreover, TransHP also performs favorably against prior HIC methods, showing that TransHP well exploits the hierarchical information. The code is available at: https://github.com/WangWenhao0716/TransHP.
연구 동기 및 목표
- ImageNet 및 iNaturalist와 같은 데이터셋의 계층적 의미 구조를 활용하여 비전 트랜스포머의 이미지 분류 정확도를 향상시키기 위해.
- 코어스-클래스 프롬프트를 사용하여 저데이터 환경에서 모델의 일반화 능력을 향상시켜 데이터 효율성을 높이기 위해.
- 계층적 프롬프팅을 통해 주의 집중을 중요한 국소 영역으로 이끌어 모델의 해석 가능성을 향상시키기 위해.
- 조상 클래스를 동적 프롬프트로 사용하여 인간의 시각 인식 방식을 모방하고, 유사한 클래스 간 미세한 차이를 집중적으로 인식하도록 유도하기 위해.
제안 방법
- TransHP는 계층 내 모든 코어스(조상) 클래스를 표현하기 위한 프롬프트 토큰의 집합을 학습한다.
- 중간 허브리지 블록이 각 입력 이미지에 대해 실시간으로 코어스-클래스 예측을 수행한다.
- 예측된 코어스-클래스 프롬프트 토큰이 크로스 어텐션을 통해 중간 특징에 통합되어 이후 특징 추출 과정을 조절한다.
- 통합된 프롬프트가 어텐션 동역학을 수정하여 코어스-클래스 분류 이후에 미세한 특징을 강조하도록 유도한다.
- 프롬프트 토큰을 패치 토큰 및 클래스 토큰과 다르게 기반으로 통합하기 위해 소프트 어텐션 가중치를 사용한다.
- 아키텍처는 입력에 관계없이 고정된 파라미터를 유지하여 파라미터 공유 변경 없이 동적 어텐션 조절이 가능하다.
실험 결과
연구 질문
- RQ1계층적 프롬프팅은 비전 트랜스포머의 이미지 분류 작업에서 정확도 향상에 기여하는가?
- RQ2계층적 프롬프팅은 특히 저데이터 훈련 환경에서 데이터 효율성을 향상시키는가?
- RQ3코어스-토-파인 프롬프팅을 통해 모델의 어텐션 메커니즘이 더 해석 가능해지는가?
- RQ4기존의 프롬프팅 및 계층적 분류 방법과 비교했을 때, 계층적 프롬프팅은 성능과 강건성 측면에서 어떻게 다른가?
주요 결과
- TransHP는 기준 모델 대비 ImageNet에서 ViT-B/16의 상위-1 정확도를 +2.83% 향상시켰다.
- 10% 훈련 데이터 조건에서 TransHP는 기준 모델 대비 정확도 향상률이 +12.69%로, 뛰어난 데이터 효율성을 입증했다.
- 데이터 부족 상황에서 TransHP의 정확도 감소율은 10% 데이터일 때 40.72%로 기준 모델의 50.97%보다 훨씬 낮아 강건성을 잘 보여준다.
- 10% 훈련 데이터 조건에서 TransHP는 경쟁 기법인 HiMulConE를 7.17% 초월하여 저데이터 환경에서의 효과성을 입증했다.
- 시각화 결과, 프롬프트 통합 후 TransHP는 전반적인 시야에서 국소적이고 중요한 영역(예: 골드피시의 얼굴과 면류관)으로 어텐션을 이동시키며 집중도와 해석 가능성을 향상시켰다.
- 메서드는 코어스 카테고리들을 프롬프트로 사용하여 인간의 시각 인식 방식을 성공적으로 모방하며, 미세한 차이를 집중적으로 인식하도록 어텐션을 유도했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.