[论文解读] WITT: A Wireless Image Transmission Transformer for Semantic Communications
本文提出WITT,一种基于视觉Transformer的无线图像传输联合源信道编码框架,利用Swin Transformer捕捉长距离依赖关系,并通过信道调制网络(Channel ModNet)将潜在表征自适应地适配不同信道状态。WITT在AWGN和瑞利衰落信道下,相较于基于CNN的方法,在高分辨率和低信噪比(SNR)条件下均表现出更优性能,PSNR、MS-SSIM和频谱效率均有显著提升。
In this paper, we aim to redesign the vision Transformer (ViT) as a new backbone to realize semantic image transmission, termed wireless image transmission transformer (WITT). Previous works build upon convolutional neural networks (CNNs), which are inefficient in capturing global dependencies, resulting in degraded end-to-end transmission performance especially for high-resolution images. To tackle this, the proposed WITT employs Swin Transformers as a more capable backbone to extract long-range information. Different from ViTs in image classification tasks, WITT is highly optimized for image transmission while considering the effect of the wireless channel. Specifically, we propose a spatial modulation module to scale the latent representations according to channel state information, which enhances the ability of a single model to deal with various channel conditions. As a result, extensive experiments verify that our WITT attains better performance for different image resolutions, distortion metrics, and channel conditions. The code is available at https://github.com/KeYang8/WITT.
研究动机与目标
- 为克服基于CNN的联合源信道编码(JSCC)在高分辨率图像传输中性能下降的问题。
- 通过用视觉Transformer替代CNN,提升无线图像传输中的表征能力。
- 使单一深度学习模型无需微调即可适应多种无线信道条件。
- 在PSNR、MS-SSIM和频谱效率方面实现更优的端到端传输性能。
- 将全局注意力机制与实际无线约束(如功率和衰落)相结合。
提出的方法
- WITT采用分层Swin Transformer编码器,通过多阶段的滑动窗口机制与特征图合并,提取多尺度、长距离依赖特征。
- 在最终编码器层后插入信道调制网络(Channel ModNet),根据实时信道状态信息(CSI)对潜在表征进行重标定。
- 信道调制网络采用可学习的缩放机制,可在不重新训练的情况下适应不同SNR水平。
- 潜在特征通过全连接层投影至固定维度,并在模拟衰落信道传输前进行归一化以满足功率约束。
- 对称解码器通过上采样、图像块划分及与编码器相同的Swin Transformer模块重建图像,同时使用相同的信道调制网络实现自适应。
- 系统采用端到端训练,损失函数为在功率约束下最小化像素级误差的重建损失。
实验结果
研究问题
- RQ1与CNN相比,视觉Transformer主干网络是否能显著提升高分辨率图像传输的端到端性能?
- RQ2如何使单一深度学习模型在无需微调的情况下有效适应多变的无线信道条件?
- RQ3通过Swin Transformer引入全局注意力机制,在衰落信道下能在多大程度上提升传输鲁棒性与质量?
- RQ4在PSNR、MS-SSIM和频谱效率方面,WITT与经典分离式方案(如BPG + LDPC)相比表现如何?
- RQ5信道调制网络是否能使统一模型覆盖宽动态SNR范围(如1–13 dB)并保持高性能?
主要发现
- WITT在所有图像分辨率下均显著优于基于CNN的JSCC,且在高分辨率下性能差距进一步扩大,PSNR与MS-SSIM均更高。
- 在CIFAR10数据集上,WITT在AWGN信道下13 dB SNR时比基于CNN的ADJSCC高出1.2 dB的PSNR,且在MS-SSIM上高出1.8 dB。
- 对于高分辨率图像(DIV2K),WITT在低SNR(如1 dB)下仍保持优异性能,而基于CNN的JSCC性能迅速下降,甚至落后于分离式方案。
- 在所有编码比特率(CBR)下,WITT性能与BPG + LDPC相当或更优,在瑞利衰落信道下,低CBR(1/16)时比基于CNN的JSCC具有1.5 dB的编码增益。
- 尽管模型参数量更大,WITT的FLOPs较ADJSCC降低2.5倍(198 G vs. 511 G),且推理速度更快(116 ms vs. 155 ms)。
- WITT的视觉重建结果表现出更少的块效应和更高的纹理保真度,尤其在低带宽条件下,验证了其在感知质量上的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。