[논문 리뷰] Query Attack via Opposite-Direction Feature:Towards Robust Image Retrieval
이 논문은 이미지 검색을 위한 백색 상자 적대적 공격인 반대 방향 특징 공격(ODFA)을 제안한다. 이 공격은 분류 예측이 아닌 중간층의 딥 특징을 타겟으로 하며, 표현 공간에서 특징 간 거리를 최대화함으로써 높은 공격 성공률을 달성한다. 미세한 변형을 통해 검색 성능을 심각하게 떨어뜨리며, 시각적으로 구별하기 어려운 정도의 변형을 사용한다. 또한 블랙박스 환경에서도 강력한 전이성(transferability)을 보여준다.
Most existing works of adversarial samples focus on attacking image recognition models, while little attention is paid to the image retrieval task. In this paper, we identify two inherent challenges in applying prevailing image recognition attack methods to image retrieval. First, image retrieval demands discriminative visual features, which is significantly different from the one-hot class prediction in image recognition. Second, due to the disjoint and potentially unrelated classes between the training and test set in image retrieval, predicting the query category from predefined training classes is not accurate and leads to a sub-optimal adversarial gradient. To address these limitations, we propose a new white-box attack approach, Opposite-Direction Feature Attack (ODFA), to generate adversarial queries. Opposite-Direction Feature Attack (ODFA) effectively exploits feature-level adversarial gradients and takes advantage of feature distance in the representation space. To our knowledge, we are among the early attempts to design an attack method specifically for image retrieval. When we deploy an attacked image as the query, the true matches are prone to receive low ranks. We demonstrate through extensive experiments that (1) only crafting adversarial queries is sufficient to fool the state-of-the-art retrieval systems; (2) the proposed attack method, ODFA, leads to a higher attack success rate than classification attack methods, validating the necessity of leveraging characteristics of image retrieval; (3) the adversarial queries generated by our method have good transferability to other retrieval models without accessing their parameters, i.e.,the black-box setting.
연구 동기 및 목표
- 이미지 검색 시스템의 강건성 평가 부족 문제를 해결하기 위해.
- 기존의 분류 기반 적대적 공격 방법이 이미지 검색 작업에 적용되었을 때의 한계를 규명하기 위해.
- 검색 순위 성능을 떨어뜨리기 위해 딥 특징을 직접 조작하는 타겟 공격 방법을 개발하기 위해.
- 검색 모델에 대해 백색 상자 및 블랙박스 환경에서 특징 수준의 공격 효과를 검증하기 위해.
- 데이터베이스를 수정하지 않고도 상태의 최신 검색 시스템을 효과적으로 속일 수 있는 적대적 쿼리만으로도 충분히 효과가 있음을 보여주기 위해.
제안 방법
- ODFA는 검색 모델의 중간층 딥 특징을 타겟으로 하는 백색 상자 공격을 제안한다. 분류 헤드가 아닌 중간층의 특징을 공격 대상으로 삼는다.
- 표현 공간에서 원본 쿼리 특징과 변형된 쿼리 특징 간의 각도 거리를 최대화하는 손실 함수를 도입한다.
- 작은 스텝 크기를 가진 반복 최적화를 사용하여 시각적으로 구별하기 어려운 변형을 생성하며, 이는 쿼리 특징을 원래 특징 벡터의 반대 방향으로 이동시킨다.
- 변형된 쿼리가 유사도 순위 기준으로 잘못 분류되도록 하기 위해 특징 거리 메트릭을 명시적으로 고려한다.
- 모델 내부 파rameter에 접근하지 않아도 되는 전이성(transferability)을 갖추어, 미리 알 수 없는 검색 모델에 대한 효과적인 블랙박스 공격이 가능하도록 설계되었다.
- 다양한 데이터셋과 검색 모델(분류 기반 및 순위 기반 아키텍처 포함)에서 방법을 평가하였다.
실험 결과
연구 질문
- RQ1이미지 검색 시스템은 분류 예측이 아닌 특징 유사도에 의존하므로, 적대적 공격를 효과적으로 적용할 수 있는가?
- RQ2기본적인 분류 기반 적대적 공격 방법이 이미지 검색 작업에 적용되었을 때 실패하는 이유는 무엇인가?
- RQ3딥 표현을 조작하는 특징 수준의 공격가 분류 기반 공격보다 이미지 검색에서 더 높은 성공률을 달성할 수 있는가?
- RQ4제안된 ODFA 방법이 블랙박스 검색 모델에 대해 강력한 전이성을 보일 수 있는가?
- RQ5데이터베이스를 수정하지 않고도 적대적 쿼리만으로도 최신 검색 시스템의 성능을 떨어뜨릴 수 있는가?
주요 결과
- Market-1501 데이터셋에서 ODFA는 오직 적대적 쿼리만을 사용하여 Recall@1을 92.70%에서 34.00%로, mAP를 77.14%에서 21.52%로 감소시켰다.
- Cifar-10 데이터셋에서 WideResNet-28 모델을 공격했을 때, ODFA는 Top-1 정확도를 0.34%로, Top-5 정확도를 1.29%로 떨어뜨렸다.
- 모든 평가 기준에서 ODFA는 기존의 빠른 기울기 부호 방법(FGSM)보다 공격 성공률에서 뛰어난 성능을 보였으며, 검색에 특화된 설계의 필요성을 확인했다.
- 방법은 강력한 전이성을 보였으며, 모델 파라미터에 접근하지 못하는 블랙박스 환경에서도 미리 알 수 없는 검색 모델을 성공적으로 공격했다.
- 특징 공간의 시각화 결과, 적대적 예제가 원래 특징의 반대 방향으로 항상 이동하는 것으로 나타나, ODFA의 核심 메커니즘을 검증했다.
- 변형은 시각적으로 구별하기 어려웠으며, 이는 공격가 성능 저하를 심각하게 유도하면서도 도청성(stealthiness)을 유지하고 있음을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.