Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Equivalent Adversarial Data Augmentation for Visual Question Answering

Ruixue Tang, Chao Ma|arXiv (Cornell University)|Jul 19, 2020
Multimodal Machine Learning Applications参考文献 46被引用数 10
ひとこと要約

本稿では、視覚的質問応答(VQA)のための意味的同等の敵対的データ拡張(SEADA)を提案する。この手法は、画像および質問の両方に対して、人間が認識できないが意味的に同等の敵対的例を生成し、モデルの汎化性能と耐性を向上させる。これらの合成例を用いて敵対的訓練を行うことで、VQAv2のクリーンな検証セットで65.16%の精度を達成し、ベースラインより1.84%高い。また、視覚的および文語的攻撃の組み合わせに対して21.55%の耐性向上を達成した。

ABSTRACT

Visual Question Answering (VQA) has achieved great success thanks to the fast development of deep neural networks (DNN). On the other hand, the data augmentation, as one of the major tricks for DNN, has been widely used in many computer vision tasks. However, there are few works studying the data augmentation problem for VQA and none of the existing image based augmentation schemes (such as rotation and flipping) can be directly applied to VQA due to its semantic structure -- an $\langle image, question, answer angle$ triplet needs to be maintained correctly. For example, a direction related Question-Answer (QA) pair may not be true if the associated image is rotated or flipped. In this paper, instead of directly manipulating images and questions, we use generated adversarial examples for both images and questions as the augmented data. The augmented examples do not change the visual properties presented in the image as well as the extbf{semantic} meaning of the question, the correctness of the $\langle image, question, answer angle$ is thus still maintained. We then use adversarial learning to train a classic VQA model (BUTD) with our augmented data. We find that we not only improve the overall performance on VQAv2, but also can withstand adversarial attack effectively, compared to the baseline model. The source code is available at https://github.com/zaynmi/seada-vqa.

研究の動機と目的

  • 「画像、質問、回答」の三つ組の意味的整合性を保つような、VQAに効果的なデータ拡張手法の不足に取り組むこと。
  • 意思決定境界を探索しながら意味的に同等の敵対的例を生成することにより、VQAモデルの汎化性能と耐性を向上させること。
  • 視覚的および文語的入力を同時に敵対的摂動と並記法を用いて強化する統合的データ拡張フレームワークを構築すること。
  • このような拡張データを用いた敵対的訓練が、クリーンデータにおける性能向上および敵対的攻撃への耐性向上をもたらすかどうかを評価すること。

提案手法

  • 制御された摂動サイズεおよびステップサイズαを用いた非標的で勾配ベースの攻撃者(IFGSM)を用いて、視覚的敵対的例を生成する。
  • 意味を保持しつつVQAモデルの誤った予測を誘発するように、並記法を用いて文語的敵対的例を生成する。
  • 視覚的および文語的敵対的例を、敵対的訓練スキームにおける拡張訓練データとして使用する。
  • クリーン例と敵対的例の混合を用いてBUTDモデルをエンドツーエンドで訓練し、敵対的例を正則化子として扱う。
  • 一般化性能および耐性を評価するために、訓練および評価時に異なる攻撃者(IFGSM、FGSM、PGD)を適用する。
  • 意味的類似度スコアおよびラベル一致度を用いて、並記法の妥当性を人間による評価で検証する。

実験結果

リサーチクエスチョン

  • RQ1画像および質問の両方に対して意味的に同等の敵対的例を生成することで、クリーンデータ上でのVQAモデル性能が向上するか?
  • RQ2このような拡張データを用いた敵対的訓練により、視覚的および文語的敵対的攻撃に対するモデルの耐性が向上するか?
  • RQ3提案手法の性能は、ベースラインモデルおよび既存のVQAにおけるデータ拡張技術と比較してどの程度優れているか?
  • RQ4生成された並記法が、元の質問の意味的意味をどの程度保持しているか?
  • RQ5性能向上は敵対的例の正則化効果によるものか、それとも特定の攻撃者に依存するものか?

主な発見

  • 提案手法は、VQAv2のクリーンな検証セットで65.16%の精度を達成し、アンサンブルベースラインの63.32%を1.84%上回った。
  • 視覚的および文語的攻撃の組み合わせに対して、敵対的訓練を施したモデルはベースラインより21.55%の耐性向上を示した。
  • 強力なPGD攻撃者(ε=0.5、α=0.125、n=6)によって生成された敵対的例において、モデルは22.64%の精度を達成し、ベースラインより4.59%高い性能を示した。
  • 人間による評価では、元の質問とその並記法の間で84%の一致度が確認され、高い意味的整合性が裏付けられた。
  • IFGSM、FGSM、PGDといった異なる攻撃者に対しても良好な性能を示したため、特定の攻撃タイプに依存しない一般化性能が確認された。
  • SEADAを用いて訓練されたモデルは、文語的敵対的質問において18.8%のフリップ率を示し、ベースラインの36.72%を下回り、より高い耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。