Skip to main content
QUICK REVIEW

[논문 리뷰] Open Vocabulary Multi-Label Classification with Dual-Modal Decoder on Aligned Visual-Textual Features

Shichao Xu, Yikang Li|arXiv (Cornell University)|2022. 08. 19.
Text and Document Classification Technologies인용 수 4
한 줄 요약

이 논문은 시각적 및 텍스처적 특징을 융합하는 이중모달 디코더(DM-Decoder)를 사용하는 새로운 오픈 뷰포인트 다중라벨 분류 프레임워크인 ADDS를 제안한다. 이는 오픈 뷰포인트, 단일에서 다중, 기존의 다중라벨 분류에서 최고 성능을 기록하며, 시각-텍스트 정렬, 고해상도 적응을 위한 피라미드 포워딩, 선택적 언어 감독을 통해 기존 방법을 초월한다. NUS-WIDE, ImageNet-1k, ImageNet-21k, MS-COCO 벤치마크에서 SOTA 성능을 달성한다.

ABSTRACT

In computer vision, multi-label recognition are important tasks with many real-world applications, but classifying previously unseen labels remains a significant challenge. In this paper, we propose a novel algorithm, Aligned Dual moDality ClaSsifier (ADDS), which includes a Dual-Modal decoder (DM-decoder) with alignment between visual and textual features, for open-vocabulary multi-label classification tasks. Then we design a simple and yet effective method called Pyramid-Forwarding to enhance the performance for inputs with high resolutions. Moreover, the Selective Language Supervision is applied to further enhance the model performance. Extensive experiments conducted on several standard benchmarks, NUS-WIDE, ImageNet-1k, ImageNet-21k, and MS-COCO, demonstrate that our approach significantly outperforms previous methods and provides state-of-the-art performance for open-vocabulary multi-label classification, conventional multi-label classification and an extreme case called single-to-multi label classification where models trained on single-label datasets (ImageNet-1k, ImageNet-21k) are tested on multi-label ones (MS-COCO and NUS-WIDE).

연구 동기 및 목표

  • 학습 중에 볼 수 없었던 라벨을 포함한 다중라벨 이미지 인식에서의 도전 과제를 해결하기 위해, 테스트 라벨이 훈련 중에 나타나지 않는 오픈 뷰포인트 환경에서의 분류 문제를 해결한다.
  • 사전 훈련된 시각-언어 모델을 활용하여 정렬된 시각적 및 텍스트 임베딩을 통해 볼 수 있는 라벨을 초월한 일반화 능력을 향상시키기 위해 노력한다.
  • 재훈련 없이도 고해상도 이미지에서 효과적인 다중라벨 분류를 가능하게 하기 위해 해상도 적응형 추론 메커니즘을 제공한다.
  • 특히 자원이 제한된 환경이나 단일에서 다중 라벨 전이 시나리오에서 성능 향상을 위해 선택적 언어 감독을 통해 모델 성능을 향상시킨다.

제안 방법

  • 핵심은 시각적 특징과 텍스트 임베딩을 점진적으로 융합하여 의미 이해를 향상시키는 트랜스포머 기반의 이중모달 디코더(DM-Decoder)이다.
  • 사전 훈련 중에 대비 학습 목표를 사용하여 시각적 및 텍스트적 특징을 정렬함으로써, 의미적으로 유사한 이미지-텍스트 쌍이 공통 임베딩 공간에서 가까워지도록 보장한다.
  • 피라미드 포워딩은 여러 척도에서 특징 맵을 처리하여 고해상도 추론을 가능하게 하며, 공간적 세부 정보를 유지하고 대용량 입력에 대한 성능을 향상시킨다.
  • 선택적 언어 감독은 피니튜닝 중에 관련 라벨에 집중함으로써 훈련을 향상시키고, 볼 수 없는 라벨로의 일반화 능력을 향상시킨다.
  • 프레임워크는 ImageNet-1k 및 ImageNet-21k에서 훈련되고, NUS-WIDE 및 MS-COCO에서 평가되며, 다중라벨 및 오픈 뷰포인트 설정으로의 제로샷 전이가 수행된다.
  • 모델은 이미지 인코더로 ViT-L-336을 사용하고, 사전 훈련된 텍스트 인코더에서 유도된 라벨 임베딩에 대해 교차 엔트로피 손실을 사용하여 피니튜닝된다.

실험 결과

연구 질문

  • RQ1시각적 및 텍스트적 특징을 융합하는 이중모달 디코더가 기존 방법을 초월해 제로샷 및 오픈 뷰포인트 다중라벨 분류 성능을 향상시킬 수 있는가?
  • RQ2기존에 저해상도에서 훈련된 모델에 대해 재훈련 없이도 피라미드 포워딩이 고해상도 추론을 얼마나 효과적으로 가능하게 하는가?
  • RQ3선택적 언어 감독을 통해 훈련 클래스 수를 늘리면 단일에서 다중 라벨 분류 성능이 향상되는가?
  • RQ4오픈 뷰포인트 환경에서 성능 향상에 기여하는 요소로, 이미지 또는 텍스트 인코더 자체보다 시각-텍스트 정렬이 얼마나 중요한가?
  • RQ5NUS-WIDE, ImageNet-1k, ImageNet-21k, MS-COCO를 포함한 다양한 벤치마크에서 ML-Decoder 및 Q2L 등의 SOTA 모델과 비교해 본 결과, 제안된 방법은 어떻게 성능을 내는가?

주요 결과

  • ADDS는 ViT-L-336을 사용한 DM-Decoder를 활용해 NUS-WIDE에서 오픈 뷰포인트 다중라벨 분류에서 39.28%의 mAP를 기록하며 이전 SOTA 방법을 초월한다.
  • ML-Decoder 기준선 대비 DM-Decoder가 mAP를 2.5포인트 향상시켰으며, 3개의 스택된 디코더 레이어를 사용할 경우 38.68%의 mAP를 기록한다.
  • MS-COCO에서 1344×1344 해상도에서 피라미드 포워딩은 mAP를 91.76%에서 93.54%로 향상시켜 고해상도 추론에서의 효과를 입증한다.
  • ImageNet-21k의 15,000개 클래스에서 훈련한 모델은 ImageNet-1k의 1,000개 클래스에서 훈련한 모델보다 NUS-WIDE에서 mAP를 31.02%에서 37.92%로 향상시켜 더 많은 훈련 클래스의 이점이 있음을 보여준다.
  • 비교적 시각-텍스트 정렬이 없는 모델, 예를 들어 대비 손실 없이 피니튜닝된 BLIP 모델은 mAP가 2.52%로 급격히 하락하여 정렬이 성능 향상에 필수적임을 입증한다.
  • 이 방법은 오픈 뷰포인트 다중라벨, 기존 다중라벨, 단일에서 다중 라벨 분류의 세 가지 과제에서 모두 SOTA 성능을 달성하여 광범위한 적용 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.