Skip to main content
QUICK REVIEW

[論文レビュー] DolphinAtack: Inaudible Voice Commands

Guoming Zhang, Chen Yan|arXiv (Cornell University)|Aug 31, 2017
Speech and Audio Processing参考文献 29被引用数 126
ひとこと要約

DolphinAttackは、聴感上は聞こえない超音波の音声コマンドが、非線形ハードウェアを介してMEMS/ECMマイクロフォンで復調され、一般的なSRシステムによって解釈されることで、デバイス間でのステルスなアクティベーションとコマンド実行を可能にすることを示し、防御策も提案する。

ABSTRACT

Speech recognition (SR) systems such as Siri or Google Now have become an increasingly popular human-computer interaction method, and have turned various systems into voice controllable systems(VCS). Prior work on attacking VCS shows that the hidden voice commands that are incomprehensible to people can control the systems. Hidden voice commands, though hidden, are nonetheless audible. In this work, we design a completely inaudible attack, DolphinAttack, that modulates voice commands on ultrasonic carriers (e.g., f > 20 kHz) to achieve inaudibility. By leveraging the nonlinearity of the microphone circuits, the modulated low frequency audio commands can be successfully demodulated, recovered, and more importantly interpreted by the speech recognition systems. We validate DolphinAttack on popular speech recognition systems, including Siri, Google Now, Samsung S Voice, Huawei HiVoice, Cortana and Alexa. By injecting a sequence of inaudible voice commands, we show a few proof-of-concept attacks, which include activating Siri to initiate a FaceTime call on iPhone, activating Google Now to switch the phone to the airplane mode, and even manipulating the navigation system in an Audi automobile. We propose hardware and software defense solutions. We validate that it is feasible to detect DolphinAttack by classifying the audios using supported vector machine (SVM), and suggest to re-design voice controllable systems to be resilient to inaudible voice command attacks.

研究の動機と目的

  • 音声制御システム(VCS)を対象とした聴覚で気づかれない音声コマンド注入の実現可能性を示す。
  • マイクの非線性によって超音波変調が復調され、SRシステムに到達する仕組みを説明する。
  • 複数のSRシステムとデバイスプラットフォームにわたって攻撃を検証し、セキュリティへの影響を評価する。
  • 聴覚で気づかれないコマンド攻撃を緩和するためのハードウェア/ソフトウェア防御策を提案する。

提案手法

  • 振幅変調(AM)を用いて基底帯の音声コマンドを超音波搬送波へ変調する。
  • マイクの非線性を利用してLPF段より前で復調・基底帯コマンドを回復する。
  • マイクの非線形性を特徴づけ、MEMSおよびECMマイクロフォンでの復調を実証する。
  • 実用的な送信機を設計する(卓上型および携帯スマートフォンベース)。
  • 多様なSRシステム(Siri、Google Now、Alexa など)でのアクティベーションおよび一般的な制御コマンドを評価する。
  • 攻撃を最適化するための搬送波周波数選択、変調深度、音声選択を評価する。

実験結果

リサーチクエスチョン

  • RQ1聴覚で気づかない超音波コマンドは、典型的なマイクロフォンハードウェアで復調され、SRシステムでデコードされ得るか。
  • RQ2DolphinAttackの成功に影響を与えるハードウェアおよびソフトウェア要因は何か。
  • RQ3主要なSRプラットフォーム上で、聴覚で気づかれない注入を介してどのようなアクティベーションおよび制御コマンドを発行できるか。
  • RQ4そのような聴覚で気づかれないコマンド攻撃を効果的に検出または緩和する防御策は何か。

主な発見

  • DolphinAttackは超音波搬送波上で聴覚で気づかれないコマンドを注入でき、それらがSiri、Google Now、AlexaなどのSRシステムでデコードされる。
  • 所有者の声のサンプルがなくてもアクティベーションコマンドを生成でき、89件のアクティベーションコマンドタイプを試験し39%の成功、うち35件成功。
  • この攻撃は7つのSRシステムと16のデバイス/プラットフォームで検証された。
  • 実験ではMEMSおよびECMマイクの両方でマイクの非線形性による基底帯信号の復調に成功したことを示している。
  • 本研究には実用的な送信機設計(卓上型および携帯型)を含み、実世界の攻撃シナリオ(例:FaceTime、機内モード、ナビゲーション)を示している。
  • 著者らはDolphinAttackを緩和するためのハードウェア/ソフトウェア防御策を提案している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。