Skip to main content
QUICK REVIEW

[논문 리뷰] GiT: Graph Interactive Transformer for Vehicle Re-identification

Fei Shen, Yi Xie|arXiv (Cornell University)|2021. 07. 12.
Advanced Neural Network Applications참고 문헌 40인용 수 14
한 줄 요약

이 논문은 차량 재식별을 위한 그래프 인터랙티브 트랜스포머(GiT)를 제안하며, 새로운 국소 상관관계 그래프(LCG)를 통해 동시적으로 분류 가능한 국소 특징을 학습하고, 스택형 인터랙티브 블록 아키텍처에서 자기주의 주의(self-attention)를 통해 강력한 전역 특징을 학습한다. 이 방법은 세 개의 대규모 벤치마크에서 최신 기술 성능(SOTA)을 달성하였으며, 가장 큰 설정에서 VeRi776에서 97.22% R1과 81.48% mAP의 성능을 기록하였다.

ABSTRACT

Transformers are more and more popular in computer vision, which treat an image as a sequence of patches and learn robust global features from the sequence. However, pure transformers are not entirely suitable for vehicle re-identification because vehicle re-identification requires both robust global features and discriminative local features. For that, a graph interactive transformer (GiT) is proposed in this paper. In the macro view, a list of GiT blocks are stacked to build a vehicle re-identification model, in where graphs are to extract discriminative local features within patches and transformers are to extract robust global features among patches. In the micro view, graphs and transformers are in an interactive status, bringing effective cooperation between local and global features. Specifically, one current graph is embedded after the former level's graph and transformer, while the current transform is embedded after the current graph and the former level's transformer. In addition to the interaction between graphs and transforms, the graph is a newly-designed local correction graph, which learns discriminative local features within a patch by exploring nodes' relationships. Extensive experiments on three large-scale vehicle re-identification datasets demonstrate that our GiT method is superior to state-of-the-art vehicle re-identification approaches.

연구 동기 및 목표

  • 순수한 CNN과 트랜스포머의 한계를 해결하기 위해 국소 및 전역 특징을 동시에 모델링함으로써 차량 재식별 성능을 향상시키는 것.
  • 기존의 CNN-GNN 또는 CNN-Transformer 하이브리드 모델에서 국소 및 전역 특징 학습 간의 상호작용 부족 문제를 해결하는 것.
  • 이미지 패치 내에서 노드 간 관계를 모델링하여 국소 특징의 분류 능력을 향상시키는 새로운 국소 상관관계 그래프(LCG)를 설계하는 것.
  • 그래프 및 트랜스포머 모듈이 레이어 간에 협력하는 스택형 인터랙티브 아키텍처를 개발하여 특징 표현을 향상시키는 것.
  • 이 방법이 차량 재식별을 넘어 사람 재식별 작업으로까지 일반화 가능한지를 입증하는 것.

제안 방법

  • GiT 모델은 다수의 GiT 블록을 스택하여 구성되며, 각 블록은 상호작용적이고 연쇄적인 방식으로 국소 상관관계 그래프(LCG)와 트랜스포머 레이어를 통합한다.
  • 각 블록에서 이전 블록의 그래프와 트랜스포머 이후의 현재 그래프가 임bedded되며, 현재 그래프와 이전 트랜스포머 이후의 현재 트랜스포머가 임bedded되어 계층 간 특징 상호작용을 가능하게 한다.
  • LCG 모듈은 가중치를 학습 가능한 매개변수와 그래프 컨volution 연산을 사용하여 패치 내 공간 노드 간의 관계를 모델링함으로써 국소 특징을 학습한다.
  • 트랜스포머에서는 멀티헤드 자기주의 주의를 사용하여 패치 간 장거리 의존성을 포착하며, 다운샘플링을 피하는 설계로 공간 해상도를 유지한다.
  • 전역 및 국소 특징의 분류 능력을 최적화하기 위해 병렬 트리플릿 손실과 크로스 엔트로피 손실을 함께 사용하여 모델을 훈련한다.
  • 깊이(D)와 어텐션 헤드 수(H)를 통해 모델 용량을 확장 가능하게 하여 모델 용량에 대한 분석(ablation)을 가능하게 한다.

실험 결과

연구 질문

  • RQ1그래프 기반 국소 특징 학습과 트랜스포머 기반 전역 특징 학습 간의 상호작용이 재식별 정확도에 어떤 영향을 미치는가?
  • RQ2제안된 국소 상관관계 그래프(LCG) 모듈이 바퀴나 조명과 같은 미세한 차량 특징을 포착하는 데 기여하는 정도는 어떠한가?
  • RQ3순수한 CNN, 순수한 트랜스포머, CNN-GNN 하이브리드 모델과 비교했을 때 제안된 GiT 아키텍처의 성능 및 효율성은 어떠한가?
  • RQ4GiT가 사람 재식별과 같은 다른 재식별 작업으로 얼마나 잘 일반화되는가?
  • RQ5모델의 깊이(D)와 어텐션 헤드 수(H)가 성능 및 파rameter 효율성에 미치는 영향은 어떠한가?

주요 결과

  • VeRi776 데이터셋에서 GiT-H12-D18은 97.22% R1과 81.48% mAP를 기록하여 이전의 모든 방법들을 능가하였다.
  • 가장 큰 GiT 설정(H12-D18)은 134.1M 파라미터를 가진 상태에서 VeRi776에서 97.22% R1과 81.48% mAP를 달성하여 중간 복잡도로 뛰어난 성능을 보였다.
  • Market-1501에서 GiT는 95.7% R1과 88.9% mAP를 기록하여 비교된 모든 방법 중 mAP 기준 1위를 차지하였다.
  • 더 큰 MSMT17 데이터셋에서 GiT는 85.6% R1과 64.8% mAP를 기록하여 두 지표에서 모두 최신 기술 방법들을 능가하였다.
  • 민감도 분석 결과, 파라미터 증가에 비해 깊이(D)를 늘리는 것이 어텐션 헤드(H)를 늘리는 것보다 성능 향상에 더 유리한 영향을 미쳤으며, H=12는 H=3 대비 파라미터를 162.3% 증가시켰다.
  • GiT-Tiny(H3-D12)는 정확도와 FLOPs 모두에서 ViT-Base를 능가하여 소규모에서도 효율성과 효과성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.