Skip to main content
QUICK REVIEW

[论文解读] Semantic Communication Systems for Speech Transmission

Zhenzi Weng, Zhijin Qin|arXiv (Cornell University)|Feb 24, 2021
Speech and Audio Processing参考文献 38被引用 6
一句话总结

本文提出 DeepSC-S,一种基于深度学习的语义通信系统,用于语音传输,其重点在于最小化语义级误差,而非比特或符号级误差。通过将挤压-激励注意力机制整合到神经网络架构中,DeepSC-S 提升了语音信号恢复的准确性,并在低信噪比(SNR)和动态信道条件下表现出更优的鲁棒性,相较于传统系统和基于卷积神经网络(CNN)的系统,在电话通信和多媒体通信场景中均表现更优。

ABSTRACT

Semantic communications could improve the transmission efficiency significantly by exploring the semantic information. In this paper, we make an effort to recover the transmitted speech signals in the semantic communication systems, which minimizes the error at the semantic level rather than the bit or symbol level. Particularly, we design a deep learning (DL)-enabled semantic communication system for speech signals, named DeepSC-S. In order to improve the recovery accuracy of speech signals, especially for the essential information, DeepSC-S is developed based on an attention mechanism by utilizing a squeeze-and-excitation (SE) network. The motivation behind the attention mechanism is to identify the essential speech information by providing higher weights to them when training the neural network. Moreover, in order to facilitate the proposed DeepSC-S for dynamic channel environments, we find a general model to cope with various channel conditions without retraining. Furthermore, we investigate DeepSC-S in telephone systems as well as multimedia transmission systems to verify the model adaptation in practice. The simulation results demonstrate that our proposed DeepSC-S outperforms the traditional communications in both cases in terms of the speech signals metrics, such as signal-to-distortion ration and perceptual evaluation of speech distortion. Besides, DeepSC-S is more robust to channel variations, especially in the low signal-to-noise (SNR) regime.

研究动机与目标

  • 解决传统通信系统仅关注比特或符号级准确性而非语义相关性所导致的效率低下问题。
  • 开发一种面向语音信号的基于深度学习的语义通信系统,以最小化语义误差而非误比特率。
  • 通过利用优先关注关键语音特征的注意力机制,提升语音信号恢复的准确性。
  • 设计一种无需重新训练即可适应不同信道条件的鲁棒模型,尤其在低信噪比环境下的适应能力。
  • 在电话系统和多媒体传输等实际应用场景中验证系统性能。

提出的方法

  • 所提出的 DeepSC-S 系统采用端到端深度神经网络架构,联合优化语义编码/解码与信道编码/解码。
  • 集成基于挤压-激励(SE)网络的注意力机制,在训练过程中动态提升关键语音特征的权重。
  • SE 模块通过重新校准通道特征响应,增强特征表示,从而提高信号恢复的精度。
  • 在 8 dB 信噪比的瑞利衰落信道下训练单一鲁棒模型,以实现对多种信道条件(包括加性白高斯噪声(AWGN)和莱斯衰落)的泛化能力。
  • 采用语音专用指标(如 SDR(信噪比失真比)和 PESQ(语音质量感知评价))对系统进行评估。
  • 在两种实际场景中对模型进行测试:基于电话的通信和多媒体传输系统。

实验结果

研究问题

  • RQ1专为语音信号设计的语义通信系统是否能在低信噪比条件下,于感知语音质量和鲁棒性方面优于传统系统?
  • RQ2基于挤压-激励网络的注意力机制如何提升语义通信中语音信号恢复的准确性?
  • RQ3单一的 DeepSC-S 模型是否能在无需重新训练的情况下泛化至多种信道条件(AWGN、Rayleigh、Rician)?
  • RQ4DeepSC-S 在实际通信场景(如电话系统和多媒体传输)中的表现如何?
  • RQ5在不同信噪比和衰落条件下,DeepSC-S 相较于传统系统和基于 CNN 的基线系统,在 SDR 和 PESQ 指标上的性能提升如何?

主要发现

  • 在所有测试信道条件下,DeepSC-S 相较于基于 CNN 的系统,PESQ 评分平均提升 7.34%。
  • 在低信噪比环境下,DeepSC-S 显著优于传统系统,后者在相同条件下表现出较差的 PESQ 评分。
  • DeepSC-S 在所有信噪比水平和衰落信道下均保持稳定的高 SDR 和 PESQ 值,展现出强大的鲁棒性。
  • 该系统在电话通信和多媒体传输两种场景中,均优于传统和半传统通信系统。
  • SE-ResNet 模块的使用促进了更优的特征学习,并有效提取关键语音成分,从而提升信号恢复性能。
  • 在 8 dB 信噪比的瑞利衰落信道下训练的鲁棒模型,能有效泛化至 AWGN 和莱斯衰落信道,证实其对动态环境的适应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。