[논문 리뷰] Interpreting CLIP's Image Representation via Text-Based Decomposition
이 논문은 CLIP의 이미지 표현을 분해하여 개별 주의 헤드와 이미지 패치의 기여도를 기여도 기반으로 해석하는 텍스트 기반 분해 방법을 제안한다. CLIP의 시각-언어 통합 공간을 활용함으로써 주의 헤드에 대해 해석 가능한, 성질에 특화된 역할(예: 모양, 위치)을 식별하고, 54.50 mIoU를 기록하는 제로샷 이미지 세그멘테이션을 실현하며, 이는 이전 방법들을 능가한다.
We investigate the CLIP image encoder by analyzing how individual model components affect the final representation. We decompose the image representation as a sum across individual image patches, model layers, and attention heads, and use CLIP's text representation to interpret the summands. Interpreting the attention heads, we characterize each head's role by automatically finding text representations that span its output space, which reveals property-specific roles for many heads (e.g. location or shape). Next, interpreting the image patches, we uncover an emergent spatial localization within CLIP. Finally, we use this understanding to remove spurious features from CLIP and to create a strong zero-shot image segmenter. Our results indicate that a scalable understanding of transformer models is attainable and can be used to repair and improve models.
연구 동기 및 목표
- CLIP의 비전 트랜스포머 구성 요소가 최종 이미지 표현에 기여하는 방식을 이해하는 것.
- CLIP의 텍스트 인코더에서 유도된 자연어 기술을 활용해 주의 헤드와 이미지 패치를 해석하는 것.
- 불필요한 관련성에 기여하는 주의 헤드를 제거함으로써 최종 작업에서 불필요한 상관관계를 감소시키는 것.
- 해석 가능한, 성질에 특화된 표현 기반으로 강력한 제로샷 이미지 세그멘테이션 방법을 개발하는 것.
- 스케일이 가능한 트랜스포머 모델의 해석이 모델 수리와 성능 향상으로 이어질 수 있음을 보여주는 것.
제안 방법
- 잔차 연결을 활용하여 CLIP의 이미지 표현을 이미지 패치, 주의 헤드, 모델 레이어에 따라 합으로 분해한다.
- 각 주의 헤드의 출력 공간에 대해 자연어 기술로 레이블이 부여된 해석 가능한 기저를 찾기 위해 TextSpan 알고리즘을 적용한다.
- 공간 주의 메커니즘을 사용하여 각 기저 방향에 대해 특정 이미지 위치에 대한 기여도를 할당한다.
- 헤드와 이미지 토큰을 동시에 분해하여 각 자연어 기술이 부여된 방향에 기여하는 영역를 시각화한다.
- 특정 주의 헤드를 제거함으로써 불필요한 특징을 제거하고, Waterbirds 데이터셋에서 검증한다.
- 공간 분해와 성질에 특화된 헤드 표현을 조합하여 제로샷 이미지 세그멘터를 구축한다.
실험 결과
연구 질문
- RQ1CLIP-ViT의 어떤 주의 헤드가 모양, 색상, 위치와 같은 특정 시각적 특성을 인코딩하는 데 담당하는가?
- RQ2개별 주의 헤드의 출력 공간을 덮는 자연어 기술을 자동으로 발견할 수 있는가?
- RQ3CLIP의 표현에서 잠재적인 공간 국소화가 발생하는가, 그리고 이는 제로샷 세그멘테이션에 활용될 수 있는가?
- RQ4불필요한 신호에 기여하는 헤드를 제거하면 편향된 데이터셋에서 최악의 그룹 정확도가 향상되는가?
- RQ5헤드와 이미지 토큰의 공동 분해를 통해 발견된 텍스트 기반 방향의 해석 가능성은 검증될 수 있는가?
주요 결과
- 마지막 네 개의 레이어를 제외한 나머지 주의 헤드를 제거해도 제로샷 분류 정확도에 거의 영향을 주지 않으며, 이는 후행 레이어가 이미지 표현을 주로 구성한다는 것을 시사한다.
- TextSpan은 주의 헤드에 대해 해석 가능한, 성질에 특화된 역할을 식별한다 — 예를 들어, 한 헤드는 '이sovceles 삼각형'이나 '타원형' 같은 모양에 특화되어 있다.
- 불필요한 신호에 기여하는 헤드를 제거함으로써 Waterbirds 데이터셋에서 최악의 그룹 정확도가 48%에서 73%로 향상된다.
- 헤드와 이미지 토큰의 공동 분해 결과, 자연어 기술(예: Eiffel Tower)과 일치하는 영역가 해당 기저 방향에 가장 큰 기여를 한다.
- 제안된 제로샷 이미지 세그멘터는 ImageNet-segmentation에서 54.50 mIoU를 기록하며, LRP, GradCAM, rollout과 같은 기존 방법들을 능가한다.
- 이 방법은 색상, 위치, 질감과 같은 발견된 의미적 유사성 기반으로 검색을 가능하게 하여 분류를 넘어서는 유용성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.