[论文解读] Generative AI-aided Joint Training-free Secure Semantic Communications via Multi-modal Prompts
本文提出了一种无需训练的、基于生成式人工智能的语义通信系统,采用多模态提示实现准确的图像重建,且无需联合编码器-解码器训练。通过利用扩散模型和友好干扰波束实现隐蔽通信,该框架优化了功率、干扰和扩散步骤,在安全传输条件下实现了高达0.92的SSIM和低于10⁻⁵的BEP。
Semantic communication (SemCom) holds promise for reducing network resource consumption while achieving the communications goal. However, the computational overheads in jointly training semantic encoders and decoders-and the subsequent deployment in network devices-are overlooked. Recent advances in Generative artificial intelligence (GAI) offer a potential solution. The robust learning abilities of GAI models indicate that semantic decoders can reconstruct source messages using a limited amount of semantic information, e.g., prompts, without joint training with the semantic encoder. A notable challenge, however, is the instability introduced by GAI's diverse generation ability. This instability, evident in outputs like text-generated images, limits the direct application of GAI in scenarios demanding accurate message recovery, such as face image transmission. To solve the above problems, this paper proposes a GAI-aided SemCom system with multi-model prompts for accurate content decoding. Moreover, in response to security concerns, we introduce the application of covert communications aided by a friendly jammer. The system jointly optimizes the diffusion step, jamming, and transmitting power with the aid of the generative diffusion models, enabling successful and secure transmission of the source messages.
研究动机与目标
- 解决语义通信系统中联合训练带来的高计算与高能耗问题。
- 在无需编码器与解码器联合训练的前提下,实现语义通信中的精确消息重建。
- 通过将隐蔽通信技术与友好干扰相结合,提升提示传输的安全性。
- 设计结合文本与视觉组件的多模态提示,以保持结构保真度的同时最小化信息泄露。
- 利用生成式扩散模型,通过优化发射功率、干扰功率和扩散步骤,实现可靠且隐蔽的传输。
提出的方法
- 系统采用多模态提示:文本提示用于语义内容,视觉提示用于结构保真度,以引导基于GAI的图像生成。
- 采用生成式扩散模型(GDM)从提示中重建图像,通过从高斯噪声逐步去噪,使用条件向量c进行控制。
- 资源分配方案由策略网络ηθ生成,该网络根据信道条件预测最优发射功率、干扰功率和扩散步数。
- 评论网络Qυ使用SSIM作为奖励信号评估生成图像的质量,通过深度强化学习指导策略优化。
- 训练使用损失函数,最小化预测SSIM值与实际SSIM值之间的差异,同时Qυ网络被训练以预测真实Q值。
- 通过联合优化干扰功率与传输功率,实现隐蔽通信,确保在守卫检测概率较低的同时,接收端仍能可靠解码。

实验结果
研究问题
- RQ1生成式人工智能能否在不进行编码器与解码器联合训练的情况下实现精确的语义通信?
- RQ2多模态提示如何提升语义通信系统中图像重建的保真度?
- RQ3生成模型中提示的不稳定性对语义通信可靠性有何影响?
- RQ4如何有效将隐蔽通信集成到基于GAI的语义通信中以防止窃听?
- RQ5何种资源分配策略可在存在守卫的情况下最大化图像重建质量并保持低检测概率?
主要发现
- 基于GDM的资源分配方案在测试奖励上优于基于DRL的方法,表明其对传输参数的优化更优。
- 当BEP为10⁻⁵时,约50次扩散步骤足以实现SSIM高于0.92的高质量图像重建。
- 当BEP增加至10⁻³时,重建图像变得嘈杂,SSIM分数显著下降,凸显了低误码率传输的重要性。
- 干扰功率超过24 dBW时,检测概率超过阈值,满足在给定环境下的隐蔽通信要求。
- 隐蔽速率随干扰功率增加而降低,实现了安全与数据速率之间的平衡。
- 所提方法实现了无需联合训练的高保真度图像重建,显著降低了语义通信中的计算与能耗成本。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。