本文提出一种基于条件扩散模型的感知图像压缩方法,旨在解决现有生成式压缩方法性能提升有限和模型复杂度高的问题。方法采用扩散Transformer作为解码器,并利用Swin Transformer实现高效架构,以增强生成能力;同时引入多尺度特征融合模块,为解码器提供更丰富的信息特征。实验结果表明该方法在感知图像压缩任务上取得了优越的性能。
本文针对学习型图像压缩中的解耦框架,该框架将样本重建与熵解码分离,实现极快解码,并成为JPEG AI验证模型的核心。然而其分析/合成变换仅由堆叠卷积构成,缺乏数据相关性建模能力。作者引入非局部注意力机制增强变换网络,使模型兼具解耦架构的快速解码优势与非局部注意力的强变换能力,提升了压缩性能。