[논문 리뷰] Semantic Equivalent Adversarial Data Augmentation for Visual Question Answering
이 논문은 시각적 질의 응답(VQA)을 위한 의미적 등가의 적대적 데이터 증강(SEADA)을 제안한다. 이는 이미지와 질문 양쪽에 대해 눈에 띄지 않게, 의미적으로 동일한 적대적 예제를 생성하여 모델의 일반화 능력과 내구성을 향상시킨다. 이러한 합성 예제를 기반으로 BUTD 모델을 적대적으로 훈련시킴으로써, 정제된 검증 세트에서 VQAv2에 대해 65.16%의 정확도를 달성하였으며, 이는 기준 모델 대비 1.84% 향상된 성능이며, 시각적 및 텍스트적 공격을 동시에 받을 경우 내구성은 21.55% 향상되었다.
Visual Question Answering (VQA) has achieved great success thanks to the fast development of deep neural networks (DNN). On the other hand, the data augmentation, as one of the major tricks for DNN, has been widely used in many computer vision tasks. However, there are few works studying the data augmentation problem for VQA and none of the existing image based augmentation schemes (such as rotation and flipping) can be directly applied to VQA due to its semantic structure -- an $\langle image, question, answer angle$ triplet needs to be maintained correctly. For example, a direction related Question-Answer (QA) pair may not be true if the associated image is rotated or flipped. In this paper, instead of directly manipulating images and questions, we use generated adversarial examples for both images and questions as the augmented data. The augmented examples do not change the visual properties presented in the image as well as the extbf{semantic} meaning of the question, the correctness of the $\langle image, question, answer angle$ is thus still maintained. We then use adversarial learning to train a classic VQA model (BUTD) with our augmented data. We find that we not only improve the overall performance on VQAv2, but also can withstand adversarial attack effectively, compared to the baseline model. The source code is available at https://github.com/zaynmi/seada-vqa.
연구 동기 및 목표
- 시각적 <이미지, 질문, 답변> 트리플릿의 의미적 정합성을 유지하는 효과적인 VQA 데이터 증강 기법의 부족 문제를 해결하기 위해.
- 의사결정 경계를 탐색하면서도 의미적으로 동일한 적대적 예제를 생성하여 VQA 모델의 일반화 능력과 내구성을 향상시키기 위해.
- 시각적 및 텍스트적 입력을 동시에 적대적 편향과 어휘 재구성 기법을 활용해 향상시키는 통합된 데이터 증강 프레임워크를 개발하기 위해.
- 이러한 증강된 데이터로 적대적 훈련을 수행했을 때, 정제된 데이터에서의 성능 향상과 적대적 공격에 대한 저항력 향상 여부를 평가하기 위해.
제안 방법
- 통제된 편향 크기 ε와 스텝 크기 α를 가진 비타겟, 기울기 기반 공격자(IFGSM)를 사용하여 시각적 적대적 예제를 생성한다.
- 의미를 유지하면서 VQA 모델이 잘못된 예측을 하도록 유도하는 문장 재구성 기법을 통해 텍스트적 적대적 예제를 생성한다.
- 시각적 및 텍스트적 적대적 예제를 모두 적대적 훈련 방식의 증강 학습 데이터로 사용한다.
- 정제된 데이터와 적대적 예제의 혼합을 통해 BUTD 모델을 엔드 투 엔드로 훈련시키며, 적대적 예제를 정규화 요소로 간주한다.
- 일반화 능력과 내구성을 평가하기 위해 훈련 및 평가 시 다양한 공격자(IFGSM, FGSM, PGD)를 적용한다.
- 의미 유사도 점수와 레이블 일치도를 활용해 인간 평가를 통해 어휘 재구성의 의미 일致성 여부를 검증한다.
실험 결과
연구 질문
- RQ1이미지와 질문 양쪽에 대해 의미적으로 동일한 적대적 예제를 생성하면 정제된 데이터에서 VQA 모델의 성능 향상이 이루어지는가?
- RQ2이러한 증강된 데이터로 적대적 훈련을 수행하면 시각적 및 텍스트적 적대적 공격에 대한 모델의 내구성이 향상되는가?
- RQ3제안된 방법은 VQA 분야의 기준 모델 및 기존 데이터 증강 기법과 비교해 어떤 성능을 보이는가?
- RQ4생성된 어휘 재구성 문장들이 원본 질문의 의미를 어느 정도 유지하는가?
- RQ5성능 향상 요인이 적대적 예제의 정규화 효과 때문인지, 아니면 특정 공격자에 의존적인 것인가?
주요 결과
- 제안된 방법은 VQAv2의 정제된 검증 세트에서 65.16%의 정확도를 달성하였으며, 기준 모델인 BUTD 대비 1.84% 향상된 성능을 보였다.
- 합성된 시각적 및 텍스트적 적대적 예제에 대해 적대적으로 훈련된 모델은 기준 모델 대비 21.55% 내구성 향상을 보였다.
- 강력한 PGD 공격자(ε=0.5, α=0.125, n=6)에 의해 생성된 적대적 예제에서 모델은 22.64%의 정확도를 기록하였으며, 기준 모델 대비 4.59% 높은 성능을 보였다.
- 인간 평가 결과, 원본 질문과 그 어휘 재구성 문장 간 의미 유사도에 대해 84%의 일치도를 보였으며, 높은 의미 일致성 여부를 확인하였다.
- IFGSM, FGSM, PGD 등 다양한 공격자에 대해 우수한 성능을 보여, 특정 공격 유형에 국한되지 않는 일반화 능력을 보였다.
- SEADA로 훈련된 모델는 기준 모델 대비 텍스트적 적대적 질문에서 18.8%의 플립 비율을 기록하여, 더 높은 내구성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.