[论文解读] Generative AI-driven Semantic Communication Framework for NextG Wireless Network
本文提出了一种面向下一代无线网络的生成式人工智能驱动的语义通信框架,通过使用轻量级移动分割一切模型(MSAM)进行特定领域语义提取,并结合生成对抗网络(GAN)进行重建,将数据传输量降低了93.45%。该系统仅传输有意义的语义特征和背景上下文信息,实现在不同信噪比(SNR)条件下的高质量图像重建,同时保持低时延和高带宽效率,适用于智能交通系统(ITS)等应用。
This work designs a novel semantic communication (SemCom) framework for the next-generation wireless network to tackle the challenges of unnecessary transmission of vast amounts that cause high bandwidth consumption, more latency, and experience with bad quality of services (QoS). In particular, these challenges hinder applications like intelligent transportation systems (ITS), metaverse, mixed reality, and the Internet of Everything, where real-time and efficient data transmission is paramount. Therefore, to reduce communication overhead and maintain the QoS of emerging applications such as metaverse, ITS, and digital twin creation, this work proposes a novel semantic communication framework. First, an intelligent semantic transmitter is designed to capture the meaningful information (e.g., the rode-side image in ITS) by designing a domain-specific Mobile Segment Anything Model (MSAM)-based mechanism to reduce the potential communication traffic while QoS remains intact. Second, the concept of generative AI is introduced for building the SemCom to reconstruct and denoise the received semantic data frame at the receiver end. In particular, the Generative Adversarial Network (GAN) mechanism is designed to maintain a superior quality reconstruction under different signal-to-noise (SNR) channel conditions. Finally, we have tested and evaluated the proposed semantic communication (SemCom) framework with the real-world 6G scenario of ITS; in particular, the base station equipped with an RGB camera and a mmWave phased array. Experimental results demonstrate the efficacy of the proposed SemCom framework by achieving high-quality reconstruction across various SNR channel conditions, resulting in 93.45% data reduction in communication.
研究动机与目标
- 解决下一代无线网络中因边缘设备大量传输原始视频和图像数据而导致的高带宽消耗和高时延问题。
- 克服现有语义通信方法依赖复杂分割、专家标注或高参数量模型的局限性,这些方法不适合边缘设备部署。
- 在智能交通系统(ITS)中实现对动态物体(如车辆、行人)的准确识别,同时保留静态背景上下文信息,以实现高效传输。
- 利用生成式人工智能,在不同信噪比(SNR)条件下实现鲁棒的图像重建与去噪。
- 设计一种轻量化、高效且可扩展的语义通信架构,适用于元宇宙、数字孪生和自动驾驶等实时应用。
提出的方法
- 设计一种特定领域的轻量化移动分割一切模型(MSAM),在发送端从监控图像中提取感兴趣区域(ROI)特征,降低传输开销。
- 仅传输动态物体的语义嵌入,并定期发送背景上下文信息,最大限度减少冗余数据传输。
- 在接收端实现一种像素到像素的生成对抗网络(GAN),利用语义嵌入和背景上下文信息对接收的语义数据进行重建与去噪。
- 使用跨多个SNR水平(0 dB、5 dB、10 dB)的联合数据集对GAN进行训练,以提升其在不同信道条件下的鲁棒性与泛化能力。
- 利用MSAM的零样本学习能力以及GD模型的开放集目标检测能力,实现在多样化、未见数据集上的语义提取。
- 将基于GAN的重建与多尺度损失函数相结合,以保持重建图像的结构和感知质量。

实验结果
研究问题
- RQ1如何设计一种轻量级语义发送端,以在最小化计算与通信开销的前提下,从ITS监控图像中提取任务相关的信息?
- RQ2生成式人工智能(特别是GAN)在不同SNR条件下,能在多大程度上提升语义通信中的图像重建质量与抗噪能力?
- RQ3在多个SNR水平上采用联合训练策略,是否能增强基于GAN的重建模型的鲁棒性与泛化能力?
- RQ4所提出的框架在降低数据传输量的同时,能否有效保持关键物体(如车辆、行人)的语义保真度?
- RQ5该框架在真实世界6G毫米波与太赫兹(THz)通信的ITS场景中,能否维持高质量的重建效果与低时延?
主要发现
- 与传统JPEG压缩图像相比,所提出的框架实现了93.45%的数据传输量降低,显著减少了带宽消耗。
- 在联合SNR数据集(0 dB、5 dB、10 dB)上训练的基于GAN的重建模型,优于在单一SNR水平上训练的模型,表现出更强的鲁棒性与泛化能力。
- 当在0 dB SNR下进行训练与测试时,重建图像的PSNR达到36.54 dB,且在所有SNR水平下均保持一致的高性能表现。
- MS-SSIM与VIF评分表明,基于GAN的重建方法即使在噪声条件下也能有效保持图像的结构与视觉保真度。
- 重建图像表现出极小的感知质量下降,车辆、行人与交通标志等关键元素可被清晰识别,验证了语义准确性。
- 系统保持了低时延与高效率,适用于智能交通系统(ITS)、元宇宙与数字孪生构建等实时应用。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。