Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly Supervised Attention Learning for Textual Phrases Grounding

Zhiyuan Fang, Shu Kong|arXiv (Cornell University)|2018. 05. 01.
Multimodal Machine Learning Applications참고 문헌 11인용 수 7
한 줄 요약

이 논문은 정규화된 이차 풀링과 종단간 학습을 사용하여 이미지 내 텍스트 어휘를 정렬하기 위한 약한 지도 학습 주의 학습 방법을 제안한다. 이는 픽셀 수준의 애너테이션 없이도 국소화를 가능하게 한다. 합성된 다중-MNIST 데이터셋에서 최대 67.07% IoU를 달성하여 자원이 제한된 환경에서의 강건성과 일반화 능력을 입증한다.

ABSTRACT

Grounding textual phrases in visual content is a meaningful yet challenging problem with various potential applications such as image-text inference or text-driven multimedia interaction. Most of the current existing methods adopt the supervised learning mechanism which requires ground-truth at pixel level during training. However, fine-grained level ground-truth annotation is quite time-consuming and severely narrows the scope for more general applications. In this extended abstract, we explore methods to localize flexibly image regions from the top-down signal (in a form of one-hot label or natural languages) with a weakly supervised attention learning mechanism. In our model, two types of modules are utilized: a backbone module for visual feature capturing, and an attentive module generating maps based on regularized bilinear pooling. We construct the model in an end-to-end fashion which is trained by encouraging the spatial attentive map to shift and focus on the region that consists of the best matched visual features with the top-down signal. We demonstrate the preliminary yet promising results on a testbed that is synthesized with multi-label MNIST data.

연구 동기 및 목표

  • 감독 학습 시 고비용의 픽셀 수준 애너테이션이 요구되는 문제를 해결하기 위해.
  • 이미지 수준 또는 어휘 수준의 레이블만을 사용하여 유연한 약한 지도 학습 기반의 이미지 내 텍스트 어휘 국소화를 가능하게 하기 위해.
  • 세밀한 애너테이션이 제한된 도메인으로의 일반화 및 이식 가능성 향상을 위해.
  • 주의 맵과 특징 표현을 동시에 최적화하는 종단간 학습 가능한 아키텍처를 개발하기 위해.
  • 가능성과 강건성을 입증하기 위해 합성된 다중 레이블 MNIST 데이터셋에서 방법을 평가하기 위해.

제안 방법

  • 이미지의 전역 시각적 특징을 추출하기 위해 사전 훈련된 ResNet-18 백본을 사용한다.
  • 이차 풀링 기반의 주의 모듈을 적용하여 시각적 및 텍스트적 특징에서 공간 주의 맵을 생성한다.
  • 텍스트 임베딩을 시각적 특징 차원에 맞추어 확장하고, 다중모odal 이차 풀링(MCB)을 통해 융합한다.
  • 분류를 위한 교차 엔트로피 손실과 클래스 간 분산을 증가시키고 클래스 내 밀도를 높이는 특징 학습 손실을 조합하여 모델을 종단간으로 훈련한다.
  • 주의 맵에 L2 정규화를 적용하여 흐릿한 영역보다는 주목할 만한 영역에 집중하도록 유도한다.
  • 모델이 경계 상자 애너테이션 없이도 입력 어휘와 일치하는 영역에 주의를 기울일 수 있도록 약한 지도 신호를 활용한다.

실험 결과

연구 질문

  • RQ1픽셀 수준의 애너테이션이 필요 없이도 약한 지도 학습 방법이 정확한 텍스트 어휘 정렬을 달성할 수 있는가?
  • RQ2정규화된 이차 풀링이 관련 이미지 영역을 국소화하는 데 효과적인 주의 맵을 생성하는 데 얼마나 효과적인가?
  • RQ3사전 훈련된 백본을 미세조정하는 것이 초기 학습에서의 수렴 및 성능 향상에 기여하는가?
  • RQ4입력 어휘가 이미지에 존재하지 않을 경우 모델은 어떻게 일반화되는가?
  • RQ5특징 학습 손실이 시각적 표현의 분류 능력을 얼마나 향상시키는가?

주요 결과

  • 백본을 미세조정할 경우 다중-MNIST 데이터셋에서 평균 IoU가 67.07%에 도달하여 강력한 국소화 정확도를 보였다.
  • IoU 임계값 0.5에서 mAP가 71.53%에 도달하여 약한 지도 학습 하에서 어휘 정렬 성능이 뛰어났다.
  • 사전 훈련된 백본을 미세조정하면 수렴 속도가 빨라지지만, 초기 학습과 비교해도 최종 성능는 유사했다.
  • 입력 어휘가 이미지에 존재하지 않을 경우 주의 맵은 거의 흐린 상태를 유지하여 모델이 잘못된 경고를 억제하는 능력을 확인했다.
  • 그림 3의 다중 쿼리 결과에서 볼 수 있듯이, 모델은 단일 이미지 내에서 여러 어휘를 성공적으로 국소화했다.
  • 특징 학습 손실은 클래스 간 분리도 향상시키고 클래스 내 밀도를 높여 표현 품질을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.