Skip to main content
QUICK REVIEW

[論文レビュー] Google's Cloud Vision API Is Not Robust To Noise

Hossein Hosseini, Baicen Xiao|arXiv (Cornell University)|Apr 16, 2017
Adversarial Robustness in Machine Learning参考文献 16被引用数 11
ひとこと要約

この論文は、GoogleのCloud Vision APIが入力ノイズに対して極めて脆弱であることを示している。最小限のインパルスノイズまたはガウスノイズを加えるだけで、人間の観察者が元のコンテンツを認識できる状態であっても、APIが画像を完全に誤分類することがある。主な発見は、処理の前に単純なノイズフィルタを適用することで、元のモデルを再トレーニングせずにAPIの正確性が回復することである。

ABSTRACT

Google has recently introduced the Cloud Vision API for image analysis. According to the demonstration website, the API "quickly classifies images into thousands of categories, detects individual objects and faces within images, and finds and reads printed words contained within images." It can be also used to "detect different types of inappropriate content from adult to violent content." In this paper, we evaluate the robustness of Google Cloud Vision API to input perturbation. In particular, we show that by adding sufficient noise to the image, the API generates completely different outputs for the noisy image, while a human observer would perceive its original content. We show that the attack is consistently successful, by performing extensive experiments on different image types, including natural images, images containing faces and images with texts. For instance, using images from ImageNet dataset, we found that adding an average of 14.25% impulse noise is enough to deceive the API. Our findings indicate the vulnerability of the API in adversarial environments. For example, an adversary can bypass an image filtering system by adding noise to inappropriate images. We then show that when a noise filter is applied on input images, the API generates mostly the same outputs for restored images as for original images. This observation suggests that cloud vision API can readily benefit from noise filtering, without the need for updating image analysis algorithms.

研究の動機と目的

  • アドバーシャルノイズ摂動に対してGoogle Cloud Vision APIの耐性を評価すること。
  • ノイズがAPIに誤ったラベルを生成させたり、物体・顔・テキストを検出不能にさせることを調査すること。
  • 汚染された入力に対して前処理としてノイズフィルタを適用することで、APIのパフォーマンスが元に戻るかどうかを特定すること。
  • ノイズフィルタリングが、モデルを変更せずに耐性を向上させる実用的で即座に適用可能なソリューションであるかどうかを評価すること。

提案手法

  • 研究では、ImageNetおよびFaces94データセットの画像を対象に、インパルスノイズとガウスノイズを用いて摂動を加えた。
  • ノイズの密度を変化させることで(例:10%〜20%のインパルスノイズ)、APIの出力が元のものからどれほど逸脱するかをテストした。
  • 復元のシミュレーションとして、重み付き平均フィルタを用いてノイズが加えられた画像を復元した。
  • ガウスノイズが加えられた画像に対しては、ローパスフィルタを用いて復元効果を評価した。
  • 元の画像、ノイズが加えられた画像、復元された画像の各々に対してAPIの出力ラベルを比較し、ラベルの一貫性を評価した。
  • 画像の復元品質を定量化するためにPSNRを用い、耐性を測る指標としてラベル類似度を用いた。

実験結果

リサーチクエスチョン

  • RQ1画像にノイズを加えることで、Google Cloud Vision APIが完全に誤ったラベルを生成するが、人間が元の内容を読み取れる状態に保たれることがあるか?
  • RQ2インパルスまたはガウスノイズのどの程度のノイズが、多様な画像タイプにおいて一貫してAPIをだますのに必要か?
  • RQ3汚染された入力に対してノイズフィルタを適用することで、APIの元のラベリング正確性が回復するか?
  • RQ4ノイズフィルタリングが、モデルを変更せずに耐性を向上させる実用的でモデルに依存しない対策として機能するか?

主な発見

  • ImageNet画像に平均14.25%のインパルスノイズを加えるだけで、Google Cloud Vision APIが関連のないラベルを生成することがある。
  • 顔画像では、APIをだますために平均23.8%のインパルスノイズ密度が必要であり、顔認識タスクにおける感受性がより高いことが示された。
  • テキストが人間には読み取り可能であっても、ノイズが加えられた画像ではAPIがテキストを検出しなくなることがあり、テキスト認識における脆弱性が明らかになった。
  • 入力に対してノイズフィルタを適用した後、APIは元の画像とほとんど同一のラベルを生成したため、機能の回復が有効に達成された。
  • 復元画像のPSNR値は、元の画像に対してそれぞれ33.16 dB、37.26 dB、40.05 dBを達成しており、高い視覚的忠実度が確認された。
  • 結果から、ノイズフィルタリングがモデル更新なしに性能を回復させる実用的で即座に適用可能な対策であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。