Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-layered Semantic Representation Network for Multi-label Image Classification

Xiwen Qu, Hao Che|arXiv (Cornell University)|2021. 06. 22.
Text and Document Classification Technologies참고 문헌 33인용 수 6
한 줄 요약

이 논문은 레이블 동시출현 그래프를 통해 국소적이고 전역적인 레이블 의미를 동시에 모델링하고, 의미 유도 주의 메커니즘을 사용해 다중 컨볼루션 레이어를 거쳐 이미지 표현을 학습하는 다층 의미 표현 네트워크(MSRN)를 제안한다. MSRN은 네 가지 벤치마크 데이터셋에서 최신 기술을 초월하는 성능을 기록하며, COCO와 VOC 2007에서 mAP 및 CF1 기준 최대 0.4% 향상된 성과를 보였다.

ABSTRACT

Multi-label image classification (MLIC) is a fundamental and practical task, which aims to assign multiple possible labels to an image. In recent years, many deep convolutional neural network (CNN) based approaches have been proposed which model label correlations to discover semantics of labels and learn semantic representations of images. This paper advances this research direction by improving both the modeling of label correlations and the learning of semantic representations. On the one hand, besides the local semantics of each label, we propose to further explore global semantics shared by multiple labels. On the other hand, existing approaches mainly learn the semantic representations at the last convolutional layer of a CNN. But it has been noted that the image representations of different layers of CNN capture different levels or scales of features and have different discriminative abilities. We thus propose to learn semantic representations at multiple convolutional layers. To this end, this paper designs a Multi-layered Semantic Representation Network (MSRN) which discovers both local and global semantics of labels through modeling label correlations and utilizes the label semantics to guide the semantic representations learning at multiple layers through an attention mechanism. Extensive experiments on four benchmark datasets including VOC 2007, COCO, NUS-WIDE, and Apparel show a competitive performance of the proposed MSRN against state-of-the-art models.

연구 동기 및 목표

  • 국소적이고 전역적인 레이블 상관관계를 모델링하여 다중 레이블 이미지 분류 성능을 향상시키기 위해.
  • CNN의 다중 컨볼루션 레이어에서 추출한 특징을 활용하여 의미 표현 학습을 향상시키기 위해.
  • 주어진 레이블 의미를 기반으로 주의 메커니즘을 통해 관심 영역을 유도하여 특징 학습을 개선하기 위해.
  • 기존 방법들이 최종 컨볼루션 레이어나 국소적 레이블 의미에만 집중하는 한계를 해결하기 위해.

제안 방법

  • 레이블 동시출현 그래프를 사용해 국소적 레이블 의미와 전역적 그룹 의미를 모두 포착하는 레이블 그룹 임베딩(LGE) 모듈을 도입한다.
  • 레이블 및 그룹 임베딩을 활용해 CNN이 관련 이미지 영역에 집중하도록 유도하는 의미 유도 주의(SGA) 모듈을 설계한다.
  • 다양한 CNN 레이어의 다중 특징 맵과 LGE를 주의 메커니즘을 통해 결합하여 공유 의미 표현을 생성한다.
  • ResNet-101의 마지막 세 개 또는 모든 네 개의 리스크 블록에서 특징을 추출하기 위해 다중 분기 아키텍처를 활용한다.
  • 정규화를 포함한 공동 최적화 프레임워크를 사용해 레이블 임베딩 학습과 특징 표현 학습 간 균형을 유지한다.
  • 공동 빈도 기반 클러스터링 전략을 적용해 고차원 상관관계 모델링이 가능한 레이블 그룹화를 수행한다.

실험 결과

연구 질문

  • RQ1국소적이고 전역적인 레이블 의미를 함께 모델링하면 다중 레이블 이미지 분류 성능이 향상되는가?
  • RQ2다양한 컨볼루션 레이어를 거쳐 의미 표현을 학습하는 것이 최종 레이어만 사용하는 것보다 더 나은 특징 분류 성능을 낳는가?
  • RQ3레이블 의미를 기반으로 유도된 주의 메커니즘이 다중 레이블 예측을 위한 관련 영역의 국소화를 향상시키는가?
  • RQ4레이블 그룹 수 및 정규화 강도와 같은 하이퍼파rameter에 대해 모델의 민감도는 얼마나 되는가?
  • RQ5제안된 프레임워크에서 레이블별 의미와 그룹 수준 의미 중 어느 것이 더 중요한 기여를 하는가?

주요 결과

  • VOC 2007에서 MSRN은 94.85% mAP를 기록했으며, 이는 이전 최신 기술 대비 CF1 기준 0.4% 향상되고 OF1 기준 0.2% 향상된 성과이다.
  • COCO에서 MSRN은 42.1% mAP를 기록했으며, 두 번째로 우수한 모델보다 0.1% 높았고, CF1 기준 0.2% 향상되고 CF1-3 기준 0.4% 향상된 성과를 보였다.
  • NUS-WIDE에서 MSRN은 61.5% mAP와 74.0% OF1를 기록했으며, 비교된 모든 방법 중 최고 순위를 기록했다.
  • Apparel 데이터셋에서 MSRN은 99.65% mAP를 기록했으며, ResNet-101 대비 0.18% 높고 이전 최신 기술 대비 0.06% 높은 성능을 기록했다.
  • 제거 실험 결과, 레이블 임베딩과 그룹 임베딩 모두 필수적임을 확인했으며, 단일 유형의 임베딩만 사용한 변종보다 전체 MSRN 모델이 더 높은 성능을 보였다.
  • 모델은 하이퍼파rameter 변화에 대해 강건했으며, 그룹 수(m)와 정규화 강도(λ)의 다양한 값에서도 mAP가 0.5% 이내로 변동하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.