Skip to main content
QUICK REVIEW

[论文解读] End-to-end Audiovisual Speech Activity Detection with Bimodal Recurrent Neural Models

Fei Tao, Carlos Busso|arXiv (Cornell University)|Sep 12, 2018
Speech and Audio Processing参考文献 51被引用 3
一句话总结

本文提出了一种用于视听语音活动检测(AV-SAD)的端到端双模态循环神经网络(BRNN),通过LSTM直接从原始数据中学习声学与视觉特征,并建模跨模态的时间动态。该框架在嘈杂环境下的便携式平板电脑上实现了92.7%的F1分数,仅比理想条件下的性能低1.0%,相比纯音频DNN基线模型,F1分数绝对提升最高达1.2%。

ABSTRACT

Speech activity detection (SAD) plays an important role in current speech processing systems, including automatic speech recognition (ASR). SAD is particularly difficult in environments with acoustic noise. A practical solution is to incorporate visual information, increasing the robustness of the SAD approach. An audiovisual system has the advantage of being robust to different speech modes (e.g., whisper speech) or background noise. Recent advances in audiovisual speech processing using deep learning have opened opportunities to capture in a principled way the temporal relationships between acoustic and visual features. This study explores this idea proposing a \emph{bimodal recurrent neural network} (BRNN) framework for SAD. The approach models the temporal dynamic of the sequential audiovisual data, improving the accuracy and robustness of the proposed SAD system. Instead of estimating hand-crafted features, the study investigates an end-to-end training approach, where acoustic and visual features are directly learned from the raw data during training. The experimental evaluation considers a large audiovisual corpus with over 60.8 hours of recordings, collected from 105 speakers. The results demonstrate that the proposed framework leads to absolute improvements up to 1.2% under practical scenarios over a VAD baseline using only audio implemented with deep neural network (DNN). The proposed approach achieves 92.7% F1-score when it is evaluated using the sensors from a portable tablet under noisy acoustic environment, which is only 1.0% lower than the performance obtained under ideal conditions (e.g., clean speech obtained with a high definition camera and a close-talking microphone).

研究动机与目标

  • 开发一种鲁棒的语音活动检测系统,利用音频与视觉双模态信息,提升在嘈杂环境下的性能。
  • 通过实现判别性表征的端到端学习,克服传统多模态SAD中手工设计特征与临时融合方案的局限性。
  • 利用循环神经网络建模音频与视觉模态内部及跨模态的时间依赖关系,以提高检测精度。
  • 在涵盖多种声学与信道条件(包括实际嘈杂环境)的大规模音视频语料上评估所提出的框架。

提出的方法

  • 该框架采用三个子网络:两个单向LSTM分别处理音频与视觉模态的表征,捕捉模态内部的时间动态。
  • 声学特征直接从梅尔倒谱系数提取,而视觉特征则通过卷积层从原始唇部图像端到端学习。
  • 将两个模态的高层表征拼接后输入第三个LSTM子网络,用于建模跨模态时间依赖关系,实现帧级语音活动预测。
  • 整个系统通过反向传播进行端到端训练,无需手工设计特征,实现特征学习与分类的联合优化。
  • 采用单向LSTM可降低延迟,相比双向模型更有利于实时应用。
  • 该模型在CRSS-4English-14语料库上进行评估,该语料库包含来自105名说话人的超过60.8小时录音,涵盖清晰与嘈杂环境。

实验结果

研究问题

  • RQ1一种直接从原始数据端到端学习音视频特征的深度学习框架,是否能在语音活动检测中超越依赖手工设计特征的传统系统?
  • RQ2与纯音频方法相比,视觉信息的引入在SAD系统中如何提升对声学噪声的鲁棒性?
  • RQ3能够捕捉跨模态时间动态的双模态循环模型,在实际嘈杂环境中在多大程度上提升了检测精度?
  • RQ4在音频质量下降的实际设备(如便携式平板电脑)上测试时,所提出的BRNN框架是否仍能保持高性能?

主要发现

  • 所提出的BRNN框架在嘈杂声学环境下的便携式平板电脑上实现了92.7%的F1分数,仅比理想条件下的94.0% F1分数低1.0%。
  • 在实际场景中,该系统相比最先进的纯音频DNN基线SAD模型,F1分数绝对提升最高达1.2%。
  • 在清晰条件下,双模态系统实现了94.0%的F1分数,显著优于纯音频系统(92.8%)和纯视觉系统(57.2%)。
  • 即使在嘈杂条件下,双模态系统仍保持92.7%的F1分数,显著优于纯音频系统(91.5%)和纯视觉系统(68.9%),且差异具有统计学显著性。
  • 纯视觉系统在使用相同数据训练时,其在嘈杂条件下的表现优于清晰条件,这是由于视觉特征在声学退化条件下具有相对稳定性。
  • 从原始数据端到端学习特征相比使用手工设计音视频特征的BRNN变体表现更优,证明了联合表征学习的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。