Skip to main content
QUICK REVIEW

[논문 리뷰] Real-Time Lightweight Chaotic Encryption for 5G IoT Enabled Lip-Reading Driven Secure Hearing-Aid

Ahsan Adeel, Jawad Ahmad|arXiv (Cornell University)|2018. 09. 13.
Speech and Audio Processing참고 문헌 17인용 수 4
한 줄 요약

이 논문은 5G IoT 기반 실시간 경량 음성-시각 청취 보조 장치를 제안하며, 음성 향상에 립 리딩 기반 딥러닝을 활용하고, 안전한 통신을 위한 새로운 혼돈 암호화 기법을 도입한다. 이 프레임워크는 5ms 미만의 라운드트립 지연을 달성하며, 저 SNR 환경(예: -12dB SNR)에서 음성 전용 방법보다 뛰어난 성능을 보이며, 99.95% NPCR 및 33.39% UACI로 강력한 보안성을 확보한다.

ABSTRACT

Existing audio-only hearing-aids are known to perform poorly in noisy situations where overwhelming noise is present. Next-generation audio-visual (lip-reading driven) hearing-aids stand as a major enabler to realise more intelligible audio. However, high data rate, low latency, low computational complexity, and privacy are some of the major bottlenecks to the successful deployment of such advanced hearing aids. To address these challenges, we envision an integration of 5G Cloud-Radio Access Network, Internet of Things (IoT), and strong privacy algorithms to fully benefit from the possibilities these technologies have to offer. The envisioned 5G IoT enabled secure audio-visual (AV) hearing-aid transmits the encrypted compressed AV information and receives encrypted enhanced reconstructed speech in real-time which fully addresses cybersecurity attacks such as location privacy and eavesdropping. For security implementation, a real-time lightweight AV encryption is utilized. For speech enhancement, the received AV information in the cloud is used to filter noisy audio using both deep learning and analytical acoustic modelling (filtering based approach). To offload the computational complexity and real-time optimization issues, the framework runs deep learning and big data optimization processes in the background on the cloud. Specifically, in this work, three key contributions are reported: (1) 5G IoT enabled secure audio-visual hearing-aid framework that aims to achieve a round-trip latency up to 5ms with 100 Mbps datarate (2) Real-time lightweight audio-visual encryption (3) Lip-reading driven deep learning approach for speech enhancement in the cloud. The critical analysis in terms of both speech enhancement and AV encryption demonstrate the potential of the envisioned technology in acquiring high-quality speech reconstruction and secure mobile AV hearing aid communication.

연구 동기 및 목표

  • 소음 환경에서 음성 인식도가 높아도 증폭만으로는 여전히 낮은 성능을 보이는 기존 음성 전용 청취 보조 장치의 한계를 해결한다.
  • 고속 데이터 전송, 낮은 지연, 낮은 계산 복잡도, 강력한 프라이버시 요구 사항을 충족하는 실시간 AV 청취 보조 장치 구현의 과제를 극복한다.
  • 5G 클라우드 라디오 액세스 네트워크(C-RAN)와 IoT를 통합하여 압축된 음성-시각 데이터의 안전하고 낮은 지연 전송을 가능하게 한다.
  • 일반적인 사이버 공격(예: 도청, 위치 추적)에 저항할 수 있는 경량 실시간 암호화 기법을 개발한다.
  • 클라우드 기반 딥러닝 및 음향 모델링을 통해 계산 복잡도를 외부로 이관하면서도 실시간 성능를 유지한다.

제안 방법

  • 스트림 암호 기반의 음성-시각 암호화를 위해 조각별 선형 혼돈 맵(PWLCM)과 체비셰프 맵을 활용해 가짜 난수 시퀀스를 생성한다.
  • 혼돈 맵과 보안 해시 함수를 사용해 새로운 치환상자(S-Box)를 설계하여 암호화 과정에서 혼동과 확산을 향상시킨다.
  • 클라우드에서 립 리딩 기반 딥러닝 모델(LSTM 기반)을 활용해 압축된 음성-시각 입력에서 향상된 음성을 재구성한다.
  • 딥러닝과 병행하여 분석 기반 음향 모델링(필터링 기반 접근)을 적용해 음성 향상의 강건성을 향상시킨다.
  • 5G-CRAN를 통해 클라우드에 무거운 계산(딥러닝 및 대용량 데이터 최적화)을 이관하여 실시간 제약 조건을 충족시킨다.
  • 엔드 투 엔드 암호화를 통합: 원본 AV 데이터는 전송 전 청취 보조 장치에서 압축 및 암호화되며, 향상된 음성이 수신된 후에만 복호화된다.

실험 결과

연구 질문

  • RQ15G IoT 기반 음성-시각 청취 보조 장치는 100 Mbps 데이터 전송 속도에서 5ms 이내의 라운드트립 지연을 달성할 수 있는가?
  • RQ2제안된 경량 혼돈 암호화 기법은 낮은 계산 오버헤드를 유지하면서도 일반적인 사이버 공격에 대해 음성-시각 데이터를 효과적으로 보호할 수 있는가?
  • RQ3저 SNR 환경에서 립 리딩 기반 딥러닝은 음성 전용 방법 대비 음성 향상 성능를 얼마나 향상시킬 수 있는가?
  • RQ4제안된 암호화 기법의 보안 강도는 키 공간, 무작위성, 미분 공격에 대한 저항성 측면에서 어떻게 평가될 수 있는가?
  • RQ5카페, 거리, 대중교통 등 실생활의 소음 환경에서 제안된 시스템은 어떤 성능을 보이는가?

주요 결과

  • 제안된 5G IoT 기반 AV 청취 보조 장치 프레임워크는 100 Mbps 데이터 전송 속도에서 라운드트립 지연이 5ms 미만으로 측정되어 실시간 통신 요구 조건을 충족시켰다.
  • 음성 암호화 기법은 픽셀 변경 수율(NPCR) 99.95% 및 통합 평균 변화 강도(UACI) 33.39%를 기록하여 입력 변화에 매우 민감하고, 미분 공격에 강력한 저항성을 보였다.
  • 암호화된 신호의 상관계수는 0.00022로, 인접한 샘플 간 거의 상관관계가 없음을 보이며 효과적인 정보 은폐를 입증했다.
  • 제안된 기법의 키 길이는 약 10^45로, 최소 기준치인 2^100를 훨씬 초월해 브루트 포스 공격에 강력한 저항성을 확보했다.
  • 저 SNR 조건(-12dB, -6dB, -3dB)에서 제안된 EVWF(향상된 시각 보조 융합) 음성 향상 방법은 음성 전용 기준(SS 및 LMMSE)보다 뚜렷이 뛰어난 성능을 보였으며, PESQ 점수로 우수한 음성 품질을 입증했다.
  • 주관적 听음 테스트(MOS, 평균 의견 점수) 결과, 제안된 AV 방법은 -12dB SNR에서 점수 4.2를 기록해 음성 전용 방법을 능가했으며, 고 SNR 조건에서는 음성 전용 방법과 유사한 성능를 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.