[논문 리뷰] Optimizing Relevance Maps of Vision Transformers Improves Robustness
이 논문은 도메인 분포 변화에 대한 강건성을 향상시키기 위해 시각 Transformer(ViTs)의 관련성 맵을 최적화하는 피닝튜닝 방법을 제안한다. 이는 배경이 아닌 전경 물체에 모델의 주의를 집중시키는 데 목적이 있다. 자동으로 생성된 자기지도 학습 ViT를 통해 확보한 소수의 이미지-전경 마스크 쌍을 사용하여, 배경 관련성 감소, 전경 커버리지 확대, 높은 신뢰도 유도를 위한 세 가지 손실 항목을 도입함으로써, 원래의 정확도를 유지하면서도 분포가 다른 데이터셋에서의 정확도를 크게 향상시킨다.
It has been observed that visual classification models often rely mostly on the image background, neglecting the foreground, which hurts their robustness to distribution changes. To alleviate this shortcoming, we propose to monitor the model's relevancy signal and manipulate it such that the model is focused on the foreground object. This is done as a finetuning step, involving relatively few samples consisting of pairs of images and their associated foreground masks. Specifically, we encourage the model's relevancy map (i) to assign lower relevance to background regions, (ii) to consider as much information as possible from the foreground, and (iii) we encourage the decisions to have high confidence. When applied to Vision Transformer (ViT) models, a marked improvement in robustness to domain shifts is observed. Moreover, the foreground masks can be obtained automatically, from a self-supervised variant of the ViT model itself; therefore no additional supervision is required.
연구 동기 및 목표
- 데이터셋 편향과 유사 상관관계로 인해 ViT가 배경 신호에 과도하게 의존하는 문제를 해결하기 위해.
- 주의 메커니즘을 조작하여 전경 물체에 주의를 집중시킴으로써 모델의 분포 이탈에 대한 강건성을 향상시키기 위해.
- 인간 레이블링이 필요한 최소한의 데이터를 사용하고, 대신 자기지도 학습 전경 마스크를 활용하는 피닝튜닝 방법을 개발하기 위해.
- 원래 훈련 분포에서의 높은 분류 정확도를 유지하면서도, 분포가 다른 데이터에 대한 일반화 능력을 향상시키기 위해.
- ViT 기반 분류기의 해석 가능성과 강건성을 향상시키기 위한 사후적, 모델 독립적인 방법을 제공하기 위해.
제안 방법
- 소수의 이미지-마스크 쌍을 사용하여 사전 훈련된 ViT에 피닝튜닝 절차를 적용하며, 세 가지 다른 손실 성분을 포함한다.
- 첫 번째 손실은 배경 영역에 할당된 관련성 점수를 최소화하여 객체에 주의를 집중시키도록 한다.
- 두 번째 손실은 관련성 맵에서 전경 물체의 더 넓은 커버리지를 유도하여 희소 활성화를 줄인다.
- 세 번째 손실은 원래 모델이 훈련 분포에서 분류 정확도를 유지하도록 정규화 역할을 한다.
- 전경 마스크는 자기지도 학습 ViT 변형을 통해 확보되며, 인간 레이블링 마스크가 필요 없게 된다.
- 이 방법은 사후 훈련에 적용되며, 다시 시작부터 훈련하거나 아키텍처 변경이 필요하지 않다.
실험 결과
연구 질문
- RQ1ViT의 관련성 맵 최적화가 배경 신호 의존도를 줄이고 도메인 분포 변화에 대한 강건성을 향상시키는가?
- RQ2소수의 이미지-마스크 쌍으로 인한 성능 향상은 도메인 내 성능 저하 없이 얼마나 효과적인가?
- RQ3자기지도 학습 전경 마스크 생성 기법이 인간 레이블링의 부담 없이 이 방법을 가능하게 하는가?
- RQ4이 방법의 실패 케이스는 물체 크기, 맥락 의존성 또는 희귀 클래스와 어떻게 관련되는가?
- RQ5이 방법이 인간이 인식한 물체 영역과 더 밀접하게 일치하는 주의 맵을 만들어 해석 가능성을 향상시키는가?
주요 결과
- 이 방법은 ImageNet-A, ImageNet-R, ImageNet-Sketch, SI-Score와 같은 분포가 다른 데이터셋에서 분류 정확도를 크게 향상시키며, 특히 도메인 이탈 기준 테스트에서 두드러진 성과를 보였다.
- ImageNet-A는 매우 분포가 다른 테스트 세트이지만, 이 방법은 강건성을 높이면서도 예측에 대한 높은 신뢰도를 유지하였다.
- 피닝튜닝된 모델이 생성한 관련성 맵은 전경 물체에 집중하는 데서 눈에 띄게 향상되었으며, 배경의 지배적 영향이 감소하였다.
- 작은 크기이거나 맥락 의존적인 물체가 포함된 클래스에서는 성능 향상이 가장 크게 나타났으며, 특히 원래 모델이 배경 신호에 의존한 경우에 두드러졌다.
- 원래 ImageNet 데이터셋에서의 정확도 저하가 최소한이었으며, 이는 도메인 내 성능 유지 능력이 뛰어나다는 것을 보여주었다.
- 실패 케이스는 제한적이며 주로 희귀 클래스나 모호한 전경을 가진 경우에서 발생했으며, 예를 들어 혼란스러운 전경 물체가 있는 풀 테이블이나 유사한 개 품종(미니어처 풀독과 토이 풀독) 등에서 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.