Skip to main content
QUICK REVIEW

[論文レビュー] Real-Time Lightweight Chaotic Encryption for 5G IoT Enabled Lip-Reading Driven Secure Hearing-Aid

Ahsan Adeel, Jawad Ahmad|arXiv (Cornell University)|Sep 13, 2018
Speech and Audio Processing参考文献 17被引用数 4
ひとこと要約

本論文は、唇読み駆動型ディープラーニングを用いた音声強調と、新たなカオス的暗号化方式を用いた安全な通信を実現する、5G IoT対応でリアルタイムな軽量な音声・映像補聴器システムを提案する。このフレームワークは5ms未満のラウンドトリップ遅延を達成し、低SNR環境(例:-12dB SNR)において音声のみの手法を上回り、99.95%のNPCRおよび33.39%のUACIを示し、高いセキュリティを実現した。

ABSTRACT

Existing audio-only hearing-aids are known to perform poorly in noisy situations where overwhelming noise is present. Next-generation audio-visual (lip-reading driven) hearing-aids stand as a major enabler to realise more intelligible audio. However, high data rate, low latency, low computational complexity, and privacy are some of the major bottlenecks to the successful deployment of such advanced hearing aids. To address these challenges, we envision an integration of 5G Cloud-Radio Access Network, Internet of Things (IoT), and strong privacy algorithms to fully benefit from the possibilities these technologies have to offer. The envisioned 5G IoT enabled secure audio-visual (AV) hearing-aid transmits the encrypted compressed AV information and receives encrypted enhanced reconstructed speech in real-time which fully addresses cybersecurity attacks such as location privacy and eavesdropping. For security implementation, a real-time lightweight AV encryption is utilized. For speech enhancement, the received AV information in the cloud is used to filter noisy audio using both deep learning and analytical acoustic modelling (filtering based approach). To offload the computational complexity and real-time optimization issues, the framework runs deep learning and big data optimization processes in the background on the cloud. Specifically, in this work, three key contributions are reported: (1) 5G IoT enabled secure audio-visual hearing-aid framework that aims to achieve a round-trip latency up to 5ms with 100 Mbps datarate (2) Real-time lightweight audio-visual encryption (3) Lip-reading driven deep learning approach for speech enhancement in the cloud. The critical analysis in terms of both speech enhancement and AV encryption demonstrate the potential of the envisioned technology in acquiring high-quality speech reconstruction and secure mobile AV hearing aid communication.

研究の動機と目的

  • 騒音環境下でも音声の理解性が低いにもかかわらず増幅が行われる既存の音声のみの補聴器の限界を解消する。
  • 高データレート、低遅延、低計算複雑性、強力なプライバシー要件を満たすリアルタイムAV補聴器の展開に伴う課題を克服する。
  • 5Gクラウド無線アクセスネットワーク(C-RAN)とIoTを統合し、圧縮された音声・映像データの安全で低遅延な送信を可能にする。
  • 一般的なサイバー攻撃(盗聴や位置追跡など)に対して耐性がある、軽量でリアルタイムな暗号化方式を開発する。
  • クラウドベースのディープラーニングと音響モデリングを活用し、計算負荷を軽減しながらリアルタイム性能を維持する。

提案手法

  • ストリーム暗号に基づく音声・映像暗号化に使用する擬似乱数列を生成するために、区分的線形カオス写像(PWLCM)とチェビシェフ写像を採用する。
  • カオス写像とセキュアハッシュ関数を用いて新しい置換箱(S-Box)を設計し、暗号化プロセスにおける混乱と拡散を強化する。
  • クラウドで動作する唇読み駆動型ディープラーニングモデル(LSTMベース)を活用し、圧縮された音声・映像入力をもとに強化された音声を再構築する。
  • ディープラーニングと並行して、解析的音響モデリング(フィルタリングベースの手法)を適用し、音声強調のロバスト性を向上させる。
  • 5G-CRANを介してクラウドに重い計算(ディープラーニングおよびビッグデータ最適化)をオフロードし、リアルタイム制約を満たす。
  • エンドツーエンド暗号化を統合:元のAVデータは送信前に圧縮および暗号化され、強化された音声受信後にのみ復号化される。

実験結果

リサーチクエスチョン

  • RQ15G IoT対応の音声・映像補聴器は、100 Mbpsのデータレートで5ms未満のラウンドトリップ遅延を達成し、リアルタイム性能を満たすことができるか?
  • RQ2提案された軽量なカオス的暗号化方式は、一般的なサイバー攻撃(盗聴や位置追跡など)からAVデータを保護しながら、計算オーバーヘッドを低く保てるか?
  • RQ3低SNR環境下において、唇読み駆動型ディープラーニングは音声のみの手法に比べて、音声強調の効果をどの程度高められるか?
  • RQ4提案された暗号化方式のセキュリティ強度は、鍵空間、ランダムネス、微分攻撃に対する耐性という観点でどの程度か?
  • RQ5本手法はカフェ、通り、公共交通機関など実世界の騒音環境でも効果的に機能するか?

主な発見

  • 提案された5G IoT対応のAV補聴器フレームワークは、100 Mbpsのデータレートで5ms未満のラウンドトリップ遅延を達成し、リアルタイム通信要件を満たした。
  • 音声暗号化方式は、ピixeルドンジェンス率(NPCR)が99.95%、統合平均変化強度(UACI)が33.39%を達成し、入力変更に対して高い感度を示し、微分攻撃に対して強い耐性を示した。
  • 暗号化信号の相関係数は0.00022であり、隣接するサンプル間の相関がほぼゼロであることを示し、効果的な情報隠しを実現した。
  • 提案方式の鍵長は10^45と推定され、最小基準値2^100をはるかに上回り、ブルートフォース攻撃に対して強い耐性を示した。
  • 低SNR状態(-12dB、-6dB、-3dB)において、提案されたEVWF(強化された視覚支援統合)音声強調手法は、音声のみのベンチマーク(SSおよびLMMSE)を顕著に上回り、PESQスコアが優れた音声品質を示した。
  • MOS(平均意見スコア)を用いた主観的聴取テストでは、-12dB SNRで提案されたAV手法が4.2のスコアを達成し、音声のみの手法を上回り、高SNR環境でも音声のみの手法と同等の性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。