Skip to main content
QUICK REVIEW

[論文レビュー] Emotionless: Privacy-Preserving Speech Analysis for Voice Assistants

Ranya Aloufi, Hamed Haddadi|arXiv (Cornell University)|Aug 9, 2019
Emotion and Mood Recognition参考文献 21被引用数 16
ひとこと要約

本稿では、クラウドサービスへの送信前に、感傷的情報を除去することで音声信号をプライバシー保護するためのEmotionlessというフレームワークを提案する。CycleGANベースの特徴抽出器とWORLD音声合成器を用い、感情認識の正確性を約96%低下させつつ、音声認識および話者識別において高い性能を維持しており、音声認識のWERは35%、話者識別におけるEERは0.12%上昇にとどまる。

ABSTRACT

Voice-enabled interactions provide more human-like experiences in many popular IoT systems. Cloud-based speech analysis services extract useful information from voice input using speech recognition techniques. The voice signal is a rich resource that discloses several possible states of a speaker, such as emotional state, confidence and stress levels, physical condition, age, gender, and personal traits. Service providers can build a very accurate profile of a user's demographic category, personal preferences, and may compromise privacy. To address this problem, a privacy-preserving intermediate layer between users and cloud services is proposed to sanitize the voice input. It aims to maintain utility while preserving user privacy. It achieves this by collecting real time speech data and analyzes the signal to ensure privacy protection prior to sharing of this data with services providers. Precisely, the sensitive representations are extracted from the raw signal by using transformation functions and then wrapped it via voice conversion technology. Experimental evaluation based on emotion recognition to assess the efficacy of the proposed method shows that identification of sensitive emotional state of the speaker is reduced by ~96 %.

研究の動機と目的

  • 音声信号から感情、ストレス、健康状態などの感受性の高い特徴を推定できる音声アシスタントに伴うプライバシーリスクに対処すること。
  • 感情状態などの感受性の高い副言語的情報を除去しつつ、音声の内容および話者識別を維持するシステムの開発。
  • 実世界のIoTアプリケーションにおけるプライバシー保護と音声認識性能のトレードオフを評価すること。
  • ユーザーとクラウドサービスの間で実用的かつリアルタイムに動作する中間層を提供し、使いやすさを損なわず音声入力を匿名化すること。

提案手法

  • 感傷的副言語的特徴(例:感情)を生の音声信号から抽出するために、CycleGANアーキテクチャを用いる。
  • 抽出された特徴を用いて、元の音声を中立的な感情的コンテンツを持つプライバシー保護型バージョンに変換する音声変換モデルを訓練する。
  • 最先端の音声合成器(WORLD)を用いて、変換された特徴から変換済み音声信号を再構築し、言語的内容を保持する。
  • フレームワークはリアルタイムで音声を処理でき、クラウド送信の前にエッジデバイスにデプロイ可能である。
  • 評価にはRAVDESSデータセットを用い、プライバシーの主な指標として感情認識の正確性を測定する。
  • 音声認識と話者識別性能は、それぞれWord Error Rate(WER)およびEqual Error Rate(EER)で測定する。

実験結果

リサーチクエスチョン

  • RQ1感情状態を効果的に隠蔽しつつ、音声の内容と話者識別を維持できる音声変換システムは実現可能か?
  • RQ2提案手法は、音声認識および話者識別性能にどの程度の悪影響を及ぼすか?
  • RQ3感情認識モデルの正確性を低下させるという点で、このフレームワークはどの程度効果的か?
  • RQ4リソース制限のあるエッジデバイス上で、実世界のIoTアプリケーションに実用的にリアルタイムにデプロイ可能か?

主な発見

  • Emotionlessフレームワークを適用した後、感情認識の正確性は約96%低下し、感情状態に対する強力なプライバシー保護が実証された。
  • 音声認識性能は最小限の影響を受けており、RAVDESSデータセットで平均35%のWord Error Rate(WER)を示した。
  • 話者認識性能はわずかに低下し、Equal Error Rate(EER)はたった0.12%上昇にとどまった。
  • フレームワークは、言語的内容と話者識別を効果的に保持しつつ、感受性の高い副言語的特徴を効果的に匿名化した。
  • この手法は、コアとなる音声分析タスクにおいて高い有用性を維持しており、音声対応IoTシステムにおける実世界のデプロイに適している。
  • 結果から、クラウドベースの音声分析においてプライバシーと有用性のバランスを取るため、音声変換は有効な手法であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。