[논문 리뷰] ViSTA: Vision and Scene Text Aggregation for Cross-Modal Retrieval
ViSTA는 시각적 및 현장 텍스트 특징을 새로운 융합 토큰 메커니즘과 이중 대비 학습을 통해 융합함으로써 시나리오별로 장면 텍스트 인식이 가능한지 여부에 관계없이 종합적인 트랜스포머 기반 프레임워크를 제안한다. 이는 최신 기술 수준을 초월하는 성능을 달성하며, 장면 텍스트 인식이 가능한 검색에서 Recall@1을 8.4% 향상시키고, 이전 방법보다 최소 3배 빠른 속도로 실행된다.
Visual appearance is considered to be the most important cue to understand images for cross-modal retrieval, while sometimes the scene text appearing in images can provide valuable information to understand the visual semantics. Most of existing cross-modal retrieval approaches ignore the usage of scene text information and directly adding this information may lead to performance degradation in scene text free scenarios. To address this issue, we propose a full transformer architecture to unify these cross-modal retrieval scenarios in a single $ extbf{Vi}$sion and $ extbf{S}$cene $ extbf{T}$ext $ extbf{A}$ggregation framework (ViSTA). Specifically, ViSTA utilizes transformer blocks to directly encode image patches and fuse scene text embedding to learn an aggregated visual representation for cross-modal retrieval. To tackle the modality missing problem of scene text, we propose a novel fusion token based transformer aggregation approach to exchange the necessary scene text information only through the fusion token and concentrate on the most important features in each modality. To further strengthen the visual modality, we develop dual contrastive learning losses to embed both image-text pairs and fusion-text pairs into a common cross-modal space. Compared to existing methods, ViSTA enables to aggregate relevant scene text semantics with visual appearance, and hence improve results under both scene text free and scene text aware scenarios. Experimental results show that ViSTA outperforms other methods by at least $\bf{8.4}\%$ at Recall@1 for scene text aware retrieval task. Compared with state-of-the-art scene text free retrieval methods, ViSTA can achieve better accuracy on Flicker30K and MSCOCO while running at least three times faster during the inference stage, which validates the effectiveness of the proposed framework.
연구 동기 및 목표
- 장면 텍스트가 없거나 노이즈가 있을 경우 성능이 저하되는 기존 다중 모달 검색 모델의 한계를 해결하기 위해.
- 모든 시나리오에서 성능 저하 없이 장면 텍스트 인식 및 비인식 검색을 하나의 확장 가능한 프레임워크로 통합하기 위해.
- 장면 텍스트가 존재할 경우에만 관련된 장면 텍스트 의미를 효율적으로 집계하여 경량 융합 메커니즘을 통해 시각적 표현을 향상시키기 위해.
- 장면 텍스트가 누락되었을 경우에도 정렬을 유지할 수 있도록 이중 대비 학습을 통해 시각 모odal의 강건성을 강화하기 위해.
- 최소한의 계산 오버헤드로 이중 인코더 아키텍처를 활용하여 효율적인 고속 추론을 가능하게 하기 위해.
제안 방법
- ViSTA는 이미지 패치와 장면 텍스트 임베딩을 별도로 처리하기 위해 전체 트랜스포머 아키텍처를 사용하며, 모달 간 정보를 교환하는 전용 융합 토큰을 통해 이를 융합한다.
- 융합 토큰 메커니즘은 시각적 및 장면 텍스트 특징 간 선택적이고 주의 기반의 상호작용을 가능하게 하여 각 모달에서 가장 두드러진 특징에 집중한다.
- 이중 대비 학습이 도입되며, 하나의 손실은 이미지-텍스트 쌍을 정렬하고, 다른 하나는 이미지-융합 쌍을 정렬함으로써 모달 부재 상황에서도 시각적 특징의 강건성을 향상시킨다.
- 모델은 효율적인 추론을 위해 이중 인코더 설정을 사용하며, 이미지 및 텍스트 특징을 사전에 오프라인으로 계산하여 대규모에서의 빠른 유사도 계산을 가능하게 한다.
- 융합 메커니즘은 최대 4개의 레이어에 걸쳐 적용되며, 분석 실험 결과 최적의 성능는 4개 레이어에서 달성된다.
- 융합 전략을 비교하는 분석 실험을 통해 글로벌 어텐션, 크로스 어텐션, 후기 융합 전략과 비교하여 융합 토큰 전략이 우월함을 입증한다.
실험 결과
연구 질문
- RQ1일관된 다중 모달 검색 프레임워크가 성능 저하 없이 장면 텍스트 인식 및 비인식 시나리오를 모두 효과적으로 처리할 수 있는가?
- RQ2장면 텍스트가 존재하지 않을 경우 간섭을 방지하기 위해 장면 텍스트 정보를 어떻게 선택적으로 시각적 특징과 융합할 수 있는가?
- RQ3트랜스포머 기반 아키텍처에서 시각적 및 장면 텍스트 특징을 융합하기 위한 최적의 융합 메커니즘은 무엇인가?
- RQ4이중 대비 학습은 장면 텍스트가 누락되거나 노이즈가 있을 경우 시각적 표현의 강건성을 향상시키는가?
- RQ5제안된 방법은 대규모 검색에서 높은 정확도를 달성하면서도 고속 추론 속도를 유지할 수 있는가?
주요 결과
- ViSTA는 장면 텍스트 인식 시나리오에서 이미지-텍스트 검색에 대해 CTC-1K 벤치마크에서 Recall@1 52.5%를 달성하며, 이는 이전 최신 기술 수준의 방법보다 최소 8.4% 향상된 성능이다.
- 장면 텍스트 비인식 시나리오에서도 강력한 성능 유지를 보이며, CTC-1K에서 Recall@1 47.0%를 기록하여 최신 기술 수준의 방법과 유사하거나 이를 초월한다.
- ViSTA는 이중 인코더 설계와 효율적인 융합 메커니즘 덕분에 기존 방법보다 최소 3배 빠른 속도로 추론을 수행한다.
- 분석 실험 결과 융합 토큰 전략이 글로벌 어텐션, 크로스 어텐션, 후기 융합 전략보다 뛰어나며, 이미지-텍스트 검색에서 52.5% R@1을 달성함을 확인했다.
- 이중 대비 학습은 성능 향상에 크게 기여하며, 전체 손실 설정에서는 52.5% R@1을 달성했고, 하나의 대비 손실만 사용할 경우 46.6% R@1을 기록하여 명확한 성능 향상을 보였다.
- 융합 레이어 수를 늘릴수록 성능 향상이 이루어지며, 4개 레이어에서 최고 성능인 52.5% R@1을 기록하여 더 깊은 융합이 특징 학습을 향상시킴을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.