Skip to main content
QUICK REVIEW

[논문 리뷰] Continuous Authentication for Voice Assistants

Huan Feng, Kassem Fawaz|arXiv (Cornell University)|2017. 01. 17.
User Authentication and Security Systems참고 문헌 24인용 수 12
한 줄 요약

VAuth는 보행자 기반의 웨어러블 기기(예: 이어버드, 목걸이)에서 발생하는 신체 표면 진동을 이용해 음성 보조 기기에서 사용자 신원을 실시간으로 확인하는 연속 인증 시스템이다. 사용자의 신체에서 유도된 가속도계 신호를 음성 보조 기기의 마이크로폰 신호와 비교함으로써 VAuth는 거의 완벽한 정확도(거짓 긍정률 <0.1%)를 달성하며, 재생 공격, 모조 공격, 왜곡된 음성 공격에 저항할 수 있으며, 낮은 지연 시간과 에너지 소모로 작동한다.

ABSTRACT

Voice has become an increasingly popular User Interaction (UI) channel, mainly contributing to the ongoing trend of wearables, smart vehicles, and home automation systems. Voice assistants such as Siri, Google Now and Cortana, have become our everyday fixtures, especially in scenarios where touch interfaces are inconvenient or even dangerous to use, such as driving or exercising. Nevertheless, the open nature of the voice channel makes voice assistants difficult to secure and exposed to various attacks as demonstrated by security researchers. In this paper, we present VAuth, the first system that provides continuous and usable authentication for voice assistants. We design VAuth to fit in various widely-adopted wearable devices, such as eyeglasses, earphones/buds and necklaces, where it collects the body-surface vibrations of the user and matches it with the speech signal received by the voice assistant's microphone. VAuth guarantees that the voice assistant executes only the commands that originate from the voice of the owner. We have evaluated VAuth with 18 users and 30 voice commands and find it to achieve an almost perfect matching accuracy with less than 0.1% false positive rate, regardless of VAuth's position on the body and the user's language, accent or mobility. VAuth successfully thwarts different practical attacks, such as replayed attacks, mangled voice attacks, or impersonation attacks. It also has low energy and latency overheads and is compatible with most existing voice assistants.

연구 동기 및 목표

  • 음성 보조 기기 시스템에서의 연속 인증 부족 문제를 해결하여 재생 공격, 모조 공격, 왜곡된 음성 공격에 취약한 점을 보완한다.
  • 기존 음성 생체 인식 기술의 한계를 극복하며, 예를 들어 특징 충돌에 취약하거나 泄露된 음성 프린트의 복구 불가능성 문제를 해결한다.
  • 사용자 맞춤형 훈련이나 재설정이 필요 없이 지속적인 물리적 신뢰성 보장을 제공하는 시스템을 설계한다.
  • 기존 음성 보조 기기와의 호환성을 확보하면서도 실생활 배포에 적합한 낮은 에너지 및 지연 시간 소모를 유도한다.

제안 방법

  • 사용자의 음성통로에서 발생하는 말할 때의 실시간 진동을 신체에 착용한 가속도계(예: 이어버드, 목걸이)를 통해 캡처한다.
  • 동시에 음성 보조 기기의 마이크로폰을 통해 음성 신호를 기록하여 비교를 위한 이중 채널 입력을 생성한다.
  • 특징 추출 없이 원시 가속도계 신호와 마이크로폰 신호를 시간 도메인에서 세그먼트 단위로 직접 비교하는 알고리즘을 구현한다.
  • 런타임 중 일치하지 않는 말하기 세그먼트를 필터링하여, 인증된 명령어만 음성 보조 기기에 전달한다.
  • 영어 모음음소에 대해 한 번만 훈련된 머신러닝 모델을 적용하여 다양한 발음, 다국어, 이동성에 강건한 일치를 가능하게 한다.
  • 동기화된 가속도계 및 마이크로폰 데이터 스트림을 수신하는 경량 서버 측 일치 서비스를 사용하여 인증 결정을 반환한다.

실험 결과

연구 질문

  • RQ1웨어러블 기기에서 발생하는 신체 표면 진동이 음성 보조 기기 시스템에서 연속적인 사용자 신원 인증을 위한 신뢰할 만한 물리적 보장을 제공할 수 있는가?
  • RQ2시간 도메인에서 원시 신호를 직접 비교하는 접근 방식이 기존 특징 기반 생체 인식 방법보다 왜곡된 음성 공격 및 재생 공격에 더 잘 대응할 수 있는가?
  • RQ3사용자 맞춤형 훈련 없이 다양한 사용자 발음, 말 속도, 이동 수준, 언어에서 VAuth의 성능은 어떠한가?
  • RQ4일반 소매 웨어러블 하드웨어를 사용한 연속 인증의 에너지 및 지연 시간 소모는 얼마나 되는가?
  • RQ5기존 음성 보조 기기의 핵심 아키텍처를 변경하지 않고 VAuth를 배포할 수 있는가?

주요 결과

  • 18명의 사용자와 30개의 음성 명령어를 대상으로 VAuth는 기기 배치, 발음, 언어, 이동성과 관계없이 거짓 긍정률이 0.1% 미만을 유지한다.
  • 음성과 신체 진동 간의 물리적 상관관계를 검증함으로써 시스템은 재생 공격, 왜곡된 음성 공격, 모조 공격를 성공적으로 방지한다.
  • 30단어 이내의 명령어에 대해 지연 시간은 1초 이내이며, 성공적인 일치의 평균 지연은 364ms, 실패한 경우는 319ms이다.
  • 일반적인 사용 조건(일일 100개의 명령어)에서 에너지 소비는 일일 평균 6.3mA이며, 500mAh 배터리는 약 일주일간 지속 가능하다.
  • 다양한 조건에서도 뛰어난 정확도 유지를 보이며, 재훈련 없이 다양한 언어, 발음, 사용자 이동 상태에서도 높은 정확도를 유지한다.
  • 기존 웨어러블 기기에 통합할 경우 에너지 소모가 일일 10mAh 미만으로 증가하여 실생활 배포에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.