Skip to main content
QUICK REVIEW

[논문 리뷰] T-MARS: Improving Visual Representations by Circumventing Text Feature Learning

Pratyush Maini, Sachin Goyal|arXiv (Cornell University)|2023. 07. 06.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

T-MARS는 텍스트가 시각적 특징을 지배하는 이미지-캡션 쌍을 식별하고 제거함으로써 시각적 표현 학습을 향상시키는 새로운 데이터 필터링 방법을 제안한다. 이는 텍스트 마스킹과 CLIP 유사도 재평가를 통해 이루어지며, DataComp 벤치마크에서 이미지넷의 제로샷 정확도에서 이전 방법보다 6.5% 향상되었고, 데이터 규모 증가에 따라 선형적인 정확도 향상을 보였다.

ABSTRACT

Large web-sourced multimodal datasets have powered a slew of new methods for learning general-purpose visual representations, advancing the state of the art in computer vision and revolutionizing zero- and few-shot recognition. One crucial decision facing practitioners is how, if at all, to curate these ever-larger datasets. For example, the creators of the LAION-5B dataset chose to retain only image-caption pairs whose CLIP similarity score exceeded a designated threshold. In this paper, we propose a new state-of-the-art data filtering approach motivated by our observation that nearly 40% of LAION's images contain text that overlaps significantly with the caption. Intuitively, such data could be wasteful as it incentivizes models to perform optical character recognition rather than learning visual features. However, naively removing all such data could also be wasteful, as it throws away images that contain visual features (in addition to overlapping text). Our simple and scalable approach, T-MARS (Text Masking and Re-Scoring), filters out only those pairs where the text dominates the remaining visual features -- by first masking out the text and then filtering out those with a low CLIP similarity score of the masked image. Experimentally, T-MARS outperforms the top-ranked method on the "medium scale" of DataComp (a data filtering benchmark) by a margin of 6.5% on ImageNet and 4.7% on VTAB. Additionally, our systematic evaluation on various data pool sizes from 2M to 64M shows that the accuracy gains enjoyed by T-MARS linearly increase as data and compute are scaled exponentially. Code is available at https://github.com/locuslab/T-MARS.

연구 동기 및 목표

  • 웹 스케일의 시각-언어 데이터셋에서 텍스트가 지배하는 이미지로 인해 시각적 특징 학습보다 광학 문자 인식(OCR) 학습이 유도되는 문제를 해결하기 위해.
  • 시각적으로 rich한 이미지를 유지하면서 텍스트 특징가 지배하는 이미지를 필터링하는 확장 가능하고 효과적인 데이터 정제 방법을 개발하기 위해.
  • 대상 필터링을 통한 데이터 품질 향상으로 제로샷 및 희소샷 시각 성능 향상을 위해.
  • 특정 규모에서 '나쁜' 예시(텍스트 전용 이미지)를 제거하는 것이 더 많은 데이터를 추가하는 것보다 유익하다는 것을 입증하기 위해.

제안 방법

  • T-MARS는 사전 학습된 OCR 모델을 사용해 이미지 내 모든 텍스트를 마스킹하여 시각적 특징을 분리한다.
  • 그 후 마스킹된 이미지와 해당 캡션 간의 CLIP 임베딩 유사도를 계산한다.
  • 마스킹 후 유사도 점수가 낮은 쌍은 필터링되며, 이는 텍스트가 매칭에 주로 기여했음을 시사한다.
  • 사전에 계산된 CLIP 특징을 활용함으로써 빌리언 스케일 데이터셋에서도 효율적이고 확장 가능한 방식으로 작동한다.
  • 전체 재학습을 피하기 위해 마스킹된 이미지-캡션 유사도에 기반한 임계값 기반 필터링 전략을 사용한다.
  • DataComp 및 이미지넷을 포함한 다양한 벤치마크에서 200만에서 6400만 개의 샘플로 구성된 다양한 데이터 풀 크기에서 평가되었다.

실험 결과

연구 질문

  • RQ1텍스트가 시각적 특징을 지배하는 이미지-캡션 쌍을 필터링하면 더 나은 시각적 표현 학습이 이루어지는가?
  • RQ2간단한 마스킹-재평가 접근 방식이 대규모에서 기존 데이터 필터링 베이스라인을 능가할 수 있는가?
  • RQ3데이터 및 컴퓨팅 예산 증가에 따라 데이터 필터링으로 인한 정확도 향상은 어떻게 스케일링되는가?
  • RQ4다양한 유형의 데이터—예를 들어, 시각 전용, 텍스트 전용, 또는 시각+텍스트 조합—는 최종 시각 성능에 어떤 상대적 기여를 하는가?
  • RQ5저품질(텍스트 지배) 예시를 제거하는 것이 더 많은 고품질 데이터를 추가하는 것보다 더 유익한가?

주요 결과

  • T-MARS는 DataComp 벤치마크의 '중규모'에서 이미지넷 제로샷 정확도에서 상위 랭킹 방법보다 6.5% 높고, VTAB에서 4.7% 높은 성능을 기록했다.
  • 200만에서 6400만 개 샘플로 구성된 데이터 풀에서, T-MARS는 데이터 및 컴퓨팅 규모가 기하급수적으로 증가함에 따라 정확도 향상이 선형적으로 증가하는 경향을 보였다.
  • T-MARS를 통한 필터링은 단지 절반의 학습 샘플과 50%의 컴퓨팅 자원을 사용함에도 불구하고, CLIP 점수 기반 필터링된 데이터셋으로 학습한 모델보다 성능이 뛰어났다.
  • 오직 텍스트 특징만을 지닌 이미지는 부정적인 유용성(U = -0.89)을 보이며, 잘못 레이블링된 데이터와 유사하게 최종 성능에 악영향을 미친다.
  • 시각적 특징과 텍스트 특징을 모두 지닌 이미지는 오직 시각적 특징만을 지닌 이미지와 거의 동일한 긍정적 유용성(U ≈ +0.23에서 +0.27)을 보이며, 유지하는 것이 타당하다.
  • 나쁜 예시(텍스트 전용 이미지)를 제거하는 것은 새로운 좋은 예시를 추가하는 것보다 3배 이상 높은 유용성 향상을 제공하며, 데이터 품질의 중요성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.