Skip to main content
QUICK REVIEW

[논문 리뷰] Visual-Textual Association with Hardest and Semi-Hard Negative Pairs Mining for Person Search

Jing Ge, Guangyu Gao|arXiv (Cornell University)|2019. 12. 06.
Multimodal Machine Learning Applications참고 문헌 32인용 수 10
한 줄 요약

이 논문은 시각적-텍스트적 연관을 위한 새로운 프레임워크를 제안하며, 교차 모odal의 가장 어려운 및 반중간 어려운 음성 쌍 마이닝, 주의 메커니즘(S-GMP 및 메모리 보강형 양방향 LSTM), 그리고 트리플릿 손실과 교차 엔트로피를 조합한 하이브리드 손실을 사용한다. 이는 CUHK-PEDES에서 새로운 최고 성능(top-1 정확도 55.32%)을 달성하며, 어려운 음성 예제에서의 개선된 특징 정렬과 분류 학습을 통해 뚜렷한 성과 향상을 보여준다.

ABSTRACT

Searching persons in large-scale image databases with the query of natural language description is a more practical important applications in video surveillance. Intuitively, for person search, the core issue should be visual-textual association, which is still an extremely challenging task, due to the contradiction between the high abstraction of textual description and the intuitive expression of visual images. However, for this task, while positive image-text pairs are always well provided, most existing methods doesn't tackle this problem effectively by mining more reasonable negative pairs. In this paper, we proposed a novel visual-textual association approach with visual and textual attention, and cross-modality hardest and semi-hard negative pair mining. In order to evaluate the effectiveness and feasibility of the proposed approach, we conduct extensive experiments on typical person search datasdet: CUHK-PEDES, in which our approach achieves the top1 score of 55.32% as a new state-of-the-art. Besides, we also evaluate the semi-hard pair mining approach in COCO caption dataset, and validate the effectiveness and complementarity of the methods.

연구 동기 및 목표

  • 텍스트 기술이 추상적이고 이미지는 통합적일 때 발생하는 시각적-텍스트적 연관 문제를 해결하기 위해, 특징 매칭에서의 부정확한 정렬을 완화한다.
  • 더 일관된 교차 모달 매칭을 위해 시각적 및 텍스트적 주의 메커니즘을 통합하여 특징 표현을 향상시킨다.
  • 특히 교차 모달 난이도에 중점을 두고, 다양한 모달 간의 어려운 및 반중간 어려운 음성 쌍을 마이닝하여 모델의 분류 능력을 향상시킨다.
  • 단일 모달에 대한 트리플릿 손실과 교차 모달의 어려운 쌍에 대한 교차 엔트로피 손실을 조합하여 보다 우수한 일반화 성능을 확보하는 학습 전략을 개발한다.
  • 광범위한 아블레이션 및 교차 데이터셋 평가를 통해 제안된 구성 요소들의 효과성과 상호 보완성을 검증한다.

제안 방법

  • 텍스트 기술과 정렬된 주목적 영역에 초점을 맞춰 더 집중적인 시각적 특징을 추출하기 위해, 부드러운 전역 최대 풀링(S-GMP)을 도입한다.
  • 텍스트적 특징에서 더 엄격한 교차 모달 대응을 보장하기 위해, LSTM 셀 상태 기반의 메모리 보강형 주의 메커니즘을 활용한다.
  • 이중 단계 음성 마이닝 전략을 제안한다: 먼저 각 모달 내에서 어려운 및 반중간 어려운 음성 쌍을 식별하고, 그 다음 교차 모달 어려운 쌍에 집중하여 분류 능력을 향상시킨다.
  • 단일 모달 특징에 대한 트리플릿 손실과 교차 모달의 가장 어려운 및 반중간 어려운 쌍에 대한 교차 엔트로피 손실을 조합하여 특징 임bedding과 랭킹을 동시에 최적화한다.
  • 학습 중에 오직 양성 쌍에만 드롭아웃을 적용하여, 노이즈가 많은 음성 샘플에서 잘못된 정렬을 학습하는 것을 방지한다.

실험 결과

연구 질문

  • RQ1고수준의 텍스트 추상화와 시각적 복잡성 하에서, 시각적 및 텍스트적 주의 메커니즘이 어떻게 교차 모달 정렬을 향상시킬 수 있는가?
  • RQ2특히 교차 모달 쌍인 가장 어려운 및 반중간 어려운 음성 쌍 마이닝이 시각-텍스트 연관에서 모델 성능에 어떤 영향을 미치는가?
  • RQ3단일 모달 특징에 대한 트리플릿 손실과 교차 모달 어려운 쌍에 대한 교차 엔트로피 손실을 조합할 경우, 특징의 분류 능력과 일반화 능력에 어떤 영향을 미치는가?
  • RQ4S-GMP와 메모리 보강형 양방향 LSTM 주의 메커니즘이 표준 풀링 및 은닉 상태 추출 방식에 비해 특징 표현을 얼마나 향상시키는가?
  • RQ5제안된 방법은 CUHK-PEDES를 초월해 일반화 가능한가? 그리고 COCO Caption 등의 다른 벤치마크에서의 성능은 어떠한가?

주요 결과

  • 제안된 방법은 ResNet-50 기반으로 CUHK-PEDES 데이터셋에서 새로운 최고 성능(top-1 정확도 55.32%)을 달성하며, 이는 이전 방법들을 크게 능가한다.
  • 아블레이션 연구를 통해 S-GMP는 항상 더 나은 시각적 특징 추출을 보이며, 평균 풀링 및 최대 풀링보다 뛰어난 성능(55.32% top-1 정확도)을 기록한다.
  • 메모리 보강형 양방향 LSTM 주의 메커니즘은 가장 높은 성능(55.32% top-1)을 기록하며, 최종 은닉 상태 및 풀링 기반의 텍스트 특징 추출 방식을 모두 능가한다.
  • 트리플릿 손실과 반중간 어려운 음성 쌍 마이닝을 조합할 경우 점진적인 성능 향상이 이루어지며, 각각 50.7% (반중간 어려운 음성 쌍만), 53.01% (트리플릿 + 반중간 어려운 음성 쌍), 55.32% (전체 방법)의 성능을 기록한다.
  • 아블레이션 결과에 따르면, 오직 양성 쌍에만 드롭아웃을 적용할 경우 음성 쌍 학습의 성능 저하를 방지하며, 전체 방법은 55.32% top-1 정확도를 달성한다.
  • 모듈 간의 강력한 상호 보완성이 확인되었으며, 각 구성 요소가 상호 보완적으로 기여하여 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.