Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly supervised cross-domain alignment with optimal transport

Siyang Yuan, Ke Bai|arXiv (Cornell University)|2020. 08. 14.
Multimodal Machine Learning Applications참고 문헌 64인용 수 5
한 줄 요약

이 논문은 명시적인 엔티티 또는 대응 관계 애너테이션 없이 세분화된 이미지-텍스트 의미 유사도를 학습하기 위해 최적 운반(OT)을 사용하는 약한 감독 기반의 교차 도메인 정렬 방법을 제안한다. 특징 매칭에 대해 OT를 미분 가능한 정규화 요소로 설정함으로써, 다양한 시각-언어 작업에서 성능을 향상시키며, 더 단순한 모델이 검색 및 어휘 위치 지정 벤치마크에서 더 복잡한 아키텍처를 능가할 수 있도록 한다.

ABSTRACT

Cross-domain alignment between image objects and text sequences is key to many visual-language tasks, and it poses a fundamental challenge to both computer vision and natural language processing. This paper investigates a novel approach for the identification and optimization of fine-grained semantic similarities between image and text entities, under a weakly-supervised setup, improving performance over state-of-the-art solutions. Our method builds upon recent advances in optimal transport (OT) to resolve the cross-domain matching problem in a principled manner. Formulated as a drop-in regularizer, the proposed OT solution can be efficiently computed and used in combination with other existing approaches. We present empirical evidence to demonstrate the effectiveness of our approach, showing how it enables simpler model architectures to outperform or be comparable with more sophisticated designs on a range of vision-language tasks.

연구 동기 및 목표

  • 엔티티나 그 대응 관계가 애너테이션되지 않은 약한 감독 하에서 이미지와 텍스트 간의 교차 도메인 정렬(CDA) 문제를 해결하기 위해.
  • 강한 애너테이션을 필요로 하지 않고 이미지 및 텍스트 엔티티 간의 세분화된 의미 유사도를 학습하기 위한 원칙적이고 미분 가능한 방법을 개발하기 위해.
  • 통합된 OT 기반 정규화 요소를 사용하여 이미지-텍스트 검색, 어휘 위치 지정, 시각적 질의 응답과 같은 시각-언어 작업에서의 성능을 향상시키기 위해.
  • OT 기반 정렬이 최첨단 모델을 능가하거나 근사할 수 있으며, 더 단순한 모델 아키텍처를 가능하게 함을 보여주기 위해.

제안 방법

  • 이미지 및 텍스트 특징 간의 운반 계획을 계산하기 위해 최적 운반(OT)을 사용하여 교차 도메인 정렬을 이원 매칭 문제로 공식화한다.
  • 표준 딥 러닝 프레임워크와 함께 엔드 투 엔드 훈련이 가능한, 손실 함수 내에서 OT를 미분 가능한 정규화 요소로 도입한다.
  • 확장성 확보를 위해 스inkihrn 기반 근사법을 사용하여, OT의 이중 공식화를 활용해 이미지 및 텍스트 임베딩 간의 운반 비용을 효율적으로 계산한다.
  • 이미지 및 텍스트 인코더 양쪽에 OT 정규화 요소를 적용하여, 특징 표현과 정렬을 함께 최적화할 수 있도록 한다.
  • 최적 운반 계획 T를 해석 가능한 어텐션 유사 매트릭스로 활용하여, 희소하고 자기 정규화된 정렬을 제공한다.
  • SCAN 및 빌리네어 어텐션 네트워크와 같은 기존 모델에 OT 정규화 요소를 통합하여 아키텍처 변경 없이 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1최적 운반을 사용하여 이미지와 텍스트 간의 약한 감독 기반 교차 도메인 정렬을 향상시키기 위한 원칙적이고, 미분 가능한 정규화 요소로 활용할 수 있는가?
  • RQ2성능 및 해석 가능성 측면에서 OT 기반 정렬은 어텐션 메커니즘과 순위 기반 손실 함수에 비해 어떻게 비교되는가?
  • RQ3아키텍처의 복잡성 없이도 OT가 이미지-텍스트 검색 및 어휘 위치 지정과 같은 시각-언어 작업에서 성능 향상에 얼마나 기여할 수 있는가?
  • RQ4약한 감독 하에서 OT 정규화 요소가 이미지 및 텍스트 인코더의 특징 학습을 더 잘 개선하는가?
  • RQ5표준 어텐션 매트릭스에 비해 OT 운반 계획이 더 해석 가능하고 희소한 정렬을 제공하는가?

주요 결과

  • Flickr30k 데이터셋에서 제안된 OT_T 및 OT_S 모델은 각각 R@1 점수 35.98과 41.12를 기록하여 기준 모델인 SCAN(20.79)을 초월한 어휘 위치 지정 성능을 보였다.
  • λ=2 및 η=0.12를 사용한 OT 강화 모델은 이미지-텍스트 검색에서 총 검색 점수(Rsum) 466.3을 기록하여 기준 코사인 유사도 모델(450.8)을 뛰어넘었다.
  • 제거 실험 결과, 코사인 유사도에 OT를 추가하면 모든 지표에서 일관되게 성능 향상이 이루어졌으며, R@1은 4.5점, Rsum는 1.6점 상승하였다.
  • 시각화 결과, 표준 어텐션 매트릭스에 비해 OT 운반 계획 T가 더 희소하고 더 해석 가능한 정렬을 생성했으며, 이미지 영역과 텍스트 어휘 간의 명확한 대응 관계를 보였다.
  • 이 방법을 통해 더 단순한 모델이 더 복잡한 아키텍처를 능가하거나 균일하게 성능을 내는 데 성공하였으며, OT가 정규화 요소로서의 효과를 입증하였다.
  • 정성적 결과는 정확한 쌍이 아닌 이미지와 문장을 포함하여도 모델이 의미적으로 관련된 이미지와 문장을 성공적으로 검색함을 확인하였으며, 이는 뛰어난 일반화 능력을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.