[論文レビュー] Hu-Fu: Hardware and Software Collaborative Attack Framework against Neural Networks
本稿では、入力画像を変更せずにニューラルネットワークにバックドアトロイの埋め込みを可能にする、ハードウェア・ソフトウェア連携型の攻撃フレームワークであるHu-Fuを提案する。トレーニング中にソフトウェアベースのトロイアン重み注入とハードウェアトロイアンを組み合わせることで、CIFAR-10では92.6%の攻撃成功率、YouTube Facesでは100%の攻撃成功率を達成した一方で、通常動作時の精度はほぼ元のモデルと同等を維持した。
Recently, Deep Learning (DL), especially Convolutional Neural Network (CNN), develops rapidly and is applied to many tasks, such as image classification, face recognition, image segmentation, and human detection. Due to its superior performance, DL-based models have a wide range of application in many areas, some of which are extremely safety-critical, e.g. intelligent surveillance and autonomous driving. Due to the latency and privacy problem of cloud computing, embedded accelerators are popular in these safety-critical areas. However, the robustness of the embedded DL system might be harmed by inserting hardware/software Trojans into the accelerator and the neural network model, since the accelerator and deploy tool (or neural network model) are usually provided by third-party companies. Fortunately, inserting hardware Trojans can only achieve inflexible attack, which means that hardware Trojans can easily break down the whole system or exchange two outputs, but can't make CNN recognize unknown pictures as targets. Though inserting software Trojans has more freedom of attack, it often requires tampering input images, which is not easy for attackers. So, in this paper, we propose a hardware-software collaborative attack framework to inject hidden neural network Trojans, which works as a back-door without requiring manipulating input images and is flexible for different scenarios. We test our attack framework for image classification and face recognition tasks, and get attack success rate of 92.6% and 100% on CIFAR10 and YouTube Faces, respectively, while keeping almost the same accuracy as the unattacked model in the normal mode. In addition, we show a specific attack scenario in which a face recognition system is attacked and gives a specific wrong answer.
研究の動機と目的
- 安全で重要な応用分野におけるサードパーティ提供の埋め込み型ディープラーニングアクセラレータの増加するセキュリティリスクに対処すること。
- 入力の操作を必要とする純粋なソフトウェアトロイアンの限界と、柔軟性に欠ける純粋なハードウェアトロイアンの限界を克服すること。
- 通常動作時には検出されず、特定のターゲットに対してバックドア行動を実行できる、隠れ性の高い攻撃フレームワークの開発。
- 入力データを変更せずに動作をトリガーできる、ハードウェアとソフトウェアが共同設計されたトロイアンの実現可能性を示すこと。
- 画像分類および顔認識タスクにおける実世界応用の妥当性を実証すること。
提案手法
- 推論時に中間特徴マップを操作することで、バックドア行動を発動させるハードウェアトロイアン回路を設計する。
- DSDにインspiredされた新しいトレーニング手順を導入し、全体のモデル精度を低下させずにサブネットワークにトロイアン重みを注入する。
- 入力チャネルまたはピクセルレベルの並列処理を用いて、メインネットワークの性能を維持したまま、トロイアン対応サブネットワークを分離してトレーニングする。
- プルーニングされたサブネットワークに悪意ある重みを埋め込み、ハードウェアトロイアンがトリガーされた場合にのみトロイアンが活性化されるようにする。
- プルーニングパラメータとトレーニングスケジュールを慎重に選択することで、通常モードの精度を元のモデルとほぼ同一に保つ。
- 推論時にハードウェアトロイアンをアクティブ化することで、特徴マップをトロイアンサブネットワークに再ルーティングし、誤分類を引き起こす。
実験結果
リサーチクエスチョン
- RQ1入力画像を変更せずに、ハードウェア・ソフトウェア連携型フレームワークがニューラルネットワークに対して隠れ性の高いバックドア攻撃を可能にできるか?
- RQ2通常動作時に検出されない形で、どのようにハードウェアトロイアンを設計すれば、悪意ある動作を発動できるか?
- RQ3通常モードでの高精度を維持しつつ、どの程度サブネットワークにトロイアン重みをトレーニングできるか?
- RQ4ピクセル並列処理と入力チャネル並列処理の異なる並列化戦略における、性能上のトレードオフは何か?
- RQ5このフレームワークは、顔認識や画像分類といった実世界の応用分野で、高い攻撃成功率を達成できるか?
主な発見
- Hu-Fuフレームワークは、CIFAR-10データセットで通常モード精度の低下を最小限に抑えつつ、92.6%の攻撃成功率を達成した(入力チャネル並列処理では91.61%)。
- YouTube Facesデータセットでは、ラベル交換およびバックドアシナリオの両方で100%の攻撃成功率を達成した一方、通常モード精度は99.48%を維持した。
- トリガーされたモードでは、未知の人物(アンドレス・マヌエル・ロペス・オブラドール)が44.4%の成功率でフランク・ビーマーに誤分類された。平均信頼度は70%であった。
- すべての構成において、通常モード精度は元のモデルとほとんど区別がつかず、0.1%から0.3%の低下にとどまった。
- 入力画像が変更されていないため、通常動作時には攻撃が検出不可能であり、トロイアンはハードウェアによる信号によってのみ活性化される。
- ピクセルレベルの並列処理が入力チャネル並列処理よりも優れたパフォーマンスを示すなど、異なる並列化戦略においてもスケーラビリティと有効性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。