JCM IEEE TCOM 2024;VAE 概率式 joint coding-modulation...
Criado em: 8 de setembro de 2026
Respondido usando GPT-5.6 Thinking por Chat01
Criado em: 8 de setembro de 2026
Respondido usando GPT-5.6 Thinking por Chat01
256
N=256 或
1024
1024 个 channel symbols;PSNR、SSIM。(Seoul National University)
DiffJSCC IEEE TMLCN 2025;Stable Diffusion 辅助的感知 JSCC DeepJSCC、DeepJSCC-adv、BPG+LDPC、BPG-capacity、InverseJSCC 等 generative 方法 CPP
1
/
128
,
1
/
64
,
1
/
32
,
1
/
16
1/128,1/64,1/32,1/16;SNR 常用
1
,
4
,
7
,
10
,
13
1,4,7,10,13 dB;PSNR、MS-SSIM、LPIPS、FID、mIoU。(Directory of Open Access Journals)
PJSCC 2024–2025 channel-prompt adaptive JSCC DeepJSCC、ADJSCC、WITT、BPG+LDPC Kodak/CLIC 常用 CBR
1
/
16
1/16,CIFAR-10 用
1
/
3
1/3;同时报告 PSNR 和 LPIPS。(arXiv)
CAVQ/VQJSCC 2025 直接相关稿件;channel-aware codebook + multi-codebook Analog、vanilla VQ、JCM、Turbo-BPG 同 symbol rate 比较,主要为 PSNR;重点比较 16/64/256-QAM。(Channel-Aware Vector Quantization for Robust Semantic Communication on Discrete Channels.pdf)
ESC-MVQ 2025 多码本 VQ、自适应 modulation 与 power allocation 多种 digital semantic communication 方法 重点是多个 VQ codebook、bit-flip probability、调制与功率联合选择。(arXiv)
虽然 DeepJSCC-Q 是 2022 年的工作,不在严格的“两年”窗口内,但对你们而言属于不可省略的关键 baseline,因为它已经覆盖 finite alphabet、learned constellation 和 raw noisy observation reconstruction。(arXiv)联合信源信道编码领域的最近几年论文,有没有有开源代码的
有。你这个方向里其实已经有一批官方开源、可以直接拿来做 baseline 的 JSCC / digital semantic communication 工作了。按你现在关注的“离散信道、VQ、数字调制、rate adaptation、图像重建”来看,我建议优先看下面这些。
| 工作 | 年份/Venue | 与你方向的关系 | 开源情况 |
|---|---|---|---|
| JCM – Joint Coding-Modulation via VAE | IEEE TCOM 2024 | 非常相关:VAE + 概率式离散化 + BPSK/4QAM/16QAM/64QAM | ✅ 官方代码 + models。仓库明确写了 original code/models,并支持 4 种 modulation。(GitHub) JCM GitHub |
| MDJCM – From Analog to Digital: Multi-Order Digital JCM | IEEE TCOM 2024 | 非常相关:多阶数字调制、digital semantic communication,比 JCM 更适合做你们的数字 baseline | ✅ 官方 PyTorch + pretrained model,提供 train/test script。(GitHub) MDJCM GitHub |
| HJSCC – Learned Image Transmission with Hierarchical VAE | AAAI 2025 | 高分辨率、HVAE、动态带宽、feedback | ✅ 官方 PyTorch + pretrained models,同时有 HJSCC 和 HJSCC-feedback。(GitHub) HJSCC GitHub |
| DiffJSCC – Diffusion-Aided JSCC | IEEE TMLCN 2025 | 感知质量 / generative JSCC,适合 LPIPS/FID/极低 CBR 对比 | ✅ 官方代码 + pretrained checkpoints,权重已经放 Hugging Face,Kodak 等 inference 脚本也给了。(GitHub) DiffJSCC GitHub |
| SwinJSCC | IEEE TCCN 2024 | 很好的 analog DeepJSCC 强 baseline;支持 SNR/rate adaptive | ✅ 官方 PyTorch + pretrained models,Kodak/CLIC/CIFAR-10,AWGN/Rayleigh 都覆盖。(GitHub) SwinJSCC GitHub |
| SQ-GAN – Semantic Image Communication Using Masked VQ | arXiv 2025 | VQ 路线高度相关:masked vector quantization + generative reconstruction | ✅ 官方代码 + pretrained Cityscapes model。(GitHub) SQ-GAN GitHub |
| Robust Semantic Communications with Masked VQ-VAE Enabled Codebook | IEEE TWC 2023 | VQ/VQ-VAE 很相关,重点是 semantic noise robustness | ✅ 官方 demo code,包含 VQ、channel,甚至有 MIMO communication 实现。(GitHub) RobustSemanComm GitHub |
| DHF-JSCC – Content Adaptive Distributed JSCC with Hyperprior | IEEE TCCN 2025 | Hyperprior/content-adaptive、distributed image transmission | ✅ 官方代码。(GitHub) DHF-JSCC GitHub |
JCM:有,而且很值得直接复现。
这篇基本就是你们“finite alphabet / digital modulation / learned mapping”最直接的开源 baseline 之一。官方 repo 不仅有 JCM,还给了 analog network 初始化代码;README 明确说支持 BPSK、4QAM、16QAM 和 64QAM。(GitHub)
HJSCC:有。
代码质量相对不错,目录里直接分 HJSCC、HJSCC_feedback,而且有预训练模型。你如果要复现 Kodak/CLIC 高分辨率 PSNR-SNR 曲线,这个很合适。(GitHub)
DiffJSCC:有,而且复现资源比较完整。
代码包含普通 CNN/Swin JSCC、conditional diffusion training、Stable Diffusion 权重合并以及 inference;官方还提供多个不同 CBR 的 checkpoint。(GitHub)
uJSCC:目前没有找到官方公开实现。
论文确实是 IEEE JSAC 2025,核心是 single encoder-decoder + VQ codebooks 支持 BPSK 到 256QAM;但目前 Papers With Code 显示 “no code implementations”,我也没有查到作者官方 GitHub。(Seoul National University)
D²-JSCC:目前没有找到官方代码。
IEEE JSAC 2025 论文和 arXiv 都在,但公开页面目前主要只有论文;CatalyzeX 也是 “Request Code”。论文实验里实际用到了 AFF3CT 做 Polar coding,因此部分传统通信链可以自己复现,但 D²-JSCC 的完整训练代码没有找到。(arXiv)
PJSCC:目前没有找到代码。
这篇是 GLOBECOM Workshops 2024 / arXiv 2411.10178;Papers With Code 目前也是 “no code implementations”。(arXiv)
CAVQ / VQJSCC:目前没有看到官方 repo。
这篇 Channel-Aware Vector Quantization for Robust Semantic Communication on Discrete Channels 是 2025 年 10 月的较新稿件,和你们现在的离散信道/VQ方向确实非常接近,但目前 arXiv 正文没有给出公开 code repository。(arXiv)
ESC-MVQ:目前也没有找到官方代码。
这篇已经发表在 IEEE TWC,核心是 multiple VQ codebooks + trainable bit-flip probabilities + modulation/power allocation,但 Papers With Code 对该作者组目前标的是 no code implementations。(DOI)
如果你的核心创新也是 “VQ / finite alphabet / QAM / discrete channel”,最值得先跑的是:
JCM → MDJCM → Robust VQ-VAE → SwinJSCC → DiffJSCC。
其中:
然后论文表里可以再放 uJSCC、D²-JSCC、CAVQ/VQJSCC、ESC-MVQ 的 paper-reported numbers,即使它们现在没有公开实现。
另外有一个很实用的汇总仓库 OpenSemanticComm,目前已经整理了很多 2023–2025 年 semantic communication/JSCC 的官方代码,包括 JCM、SwinJSCC、DiffJSCC、CDDM、DeepJSCC-1++、NTSCC 等。(GitHub)
OpenSemanticComm 开源代码汇总
如果你愿意,我下一步可以直接给你整理一张 “2023–2026 图像 JSCC 开源论文表”,大约 20–30 篇,列成:
Paper|Venue|Year|Analog/Digital|VQ?|QAM?|Dataset|CBR/CPP|SNR|Metric|GitHub|是否有 pretrained weights|适不适合做你们 baseline
这样基本可以直接放到你们 related work / 实验计划里。
你整理一张 “2023–2026 图像 JSCC 开源论文表”,大约 20–30 篇,列成:
Paper|Venue|Year|Analog/Digital|VQ?|QAM?|Dataset|CBR/CPP|SNR|Metric|GitHub|是否有 pretrained weights|适不适合做你们 baseline
可以。我按截至 2026 年 9 月公开可找到的官方/作者代码重新筛了一遍,尽量只保留“图像传输 + JSCC/semantic communication + 有可用代码”的工作。像 uJSCC、D²-JSCC、CAVQ/ESC-MVQ 这类与你们很相关但目前没有可靠官方代码的,我不塞进主表。
先说明表里的口径:A = analog/连续 channel symbols,D = digital/离散符号或显式数字调制,H = hybrid;“QAM”指方法本身是否显式使用 QAM,不是论文拿来比较的 BPG+LDPC+QAM baseline;“△”表示部分相关或并非严格 VQ-JSCC。CBR/CPP 只写论文/repo 中最常用、最方便复现的一组,并不表示论文只有这一组设置。OpenSemanticComm 目前也收录了其中相当多的官方实现。(GitHub)
| # | Paper | Venue | Year | A/D | VQ? | QAM? | Dataset | CBR / CPP 常用设置 | SNR | Metric | GitHub | Pretrained | 适合你们 baseline? |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | WITT | ICASSP | 2023 | A | ✗ | ✗* | CIFAR-10;DIV2K→Kodak/CLIC21 | CBR 0.0625 常用 | 1,4,7,10,13 dB | PSNR / MS-SSIM | GitHub (GitHub) | ✅ | 强:analog Transformer baseline |
| 2 | DeepJSCC-L++ | GLOBECOM | 2023 | A | ✗ | ✗ | 图像;Swin backbone | 多 bandwidth ratios | 多 SNR 单模型 | PSNR | GitHub (GitHub) | △ 需训练/本地 models | 可:rate+SNR adaptive |
| 3 | ISEC-DeepJSCC | AISTATS | 2023 | A | ✗ | ✗ | CIFAR-10、OpenImages、Kodak | CIFAR 1/6,1/12;OpenImages 1/6,1/16 | CIFAR 0/5/10;OI 1/7/13 dB | PSNR / perceptual | GitHub (GitHub) | ✅ | 强:CNN analog baseline |
| 4 | PADC / Predictive & Adaptive Deep Coding | IEEE TWC | 2023 | A | ✗ | ✗ | CIFAR-10、ImageNet、Kodak | variable rate | 多 SNR | PSNR / SSIM | GitHub (GitHub) | ❌/未见统一权重 | 可:adaptive baseline |
| 5 | Robust Semantic Communications with Masked VQ-VAE Codebook | IEEE TWC | 2023 | D | ✅ | ✗ | 图像 + downstream semantic tasks | VQ index / codebook rate | semantic noise / wireless channel | reconstruction + task accuracy | GitHub (GitHub) | ⚠️ README仍写“soon” | 非常强:VQ/discrete 对照 |
| 6 | Distributed DeepJSCC over MAC | ICC | 2023 | A | ✗ | ✗ | correlated/distributed images | 示例 1/3 bandwidth ratio | MAC 多 SNR | PSNR | GitHub (GitHub) | ❌ | 条件:只在多用户/NOMA有意义 |
| 7 | Space-Time JSCC over MIMO | SPAWC | 2023 | A | ✗ | ✗* | 图像 / MIMO | MIMO-specific | 2×2 MIMO 等 | PSNR | GitHub (GitHub) | ❌ | 条件:MIMO 才需要 |
| 8 | CDDM | IEEE TWC 2024;前身 GLOBECOM'23 | 2024 | A | ✗ | ✗ | 图像 | 跟随 underlying JSCC | repo 示例 10 dB AWGN | PSNR / denoising quality | GitHub (GitHub) | ✅ | 可:channel denoiser baseline |
| 9 | JCM — Joint Coding-Modulation via VAE | IEEE TCOM | 2024 | D | △ 概率离散化 | ✅ BPSK / 4 / 16 / 64QAM | CIFAR-10 | 常用 1/24;可扫 1/48–1/3 | repo 给 −18…18 dB | PSNR + classification acc. | GitHub (GitHub) | ✅ | ★★★★★ 必跑 |
| 10 | MDJCM — Multi-Order Digital JCM | IEEE TCOM | 2024 | D | ✗/quantization | ✅ 多阶数字 modulation | NTSCC / 高分辨率图像设置 | adaptive digital rate | 多 SNR | distortion quality | GitHub (GitHub) | ✅ MDJCM-A | ★★★★★ 必跑 |
| 11 | SwinJSCC | IEEE TCCN | 2024 | A | ✗ | ✗* | CIFAR-10;DIV2K→Kodak/CLIC21 | 0.0208, .0416, .0625, .0833, .125 | 1,4,7,10,13 dB | PSNR / MS-SSIM | GitHub (GitHub) | ✅ | ★★★★★ analog 强基线 |
| 12 | Hyper-AJSCC | arXiv / adaptive JSCC | 2024 | A | ✗ | ✗ | CIFAR-10 | architecture-dependent | 多 SNR/channel conditions | reconstruction / task | GitHub (GitHub) | ❌ | 可:single-model adaptive |
| 13 | DeepJSCC-WZ | ICMLCN | 2024 | A | ✗ | ✗ | KITTI Stereo、Cityscapes | ρ≈1/16,1/32 | 多 SNR | PSNR/MS-SSIM/LPIPS | GitHub (GitHub) | ✅ checkpoints | 条件:decoder side information |
| 14 | DeepJSCC + Diffusion / High Perceptual Quality Wireless Image Delivery | INFOCOM Workshops | 2024 | A | ✗ | ✗ | ImageNet / 512×512 | low-res JSCC | 多 noise setting | distortion + perceptual | GitHub (GitHub) | △ diffusion 权重 | 可:生成式参考 |
| 15 | DeepJSCC over Cooperative Relay Networks | ICMLCN | 2024 | A | ✗ | ✗ | 图像 | relay-specific | 例:SR=12, SD=6, RD=6 dB | PSNR | GitHub (GitHub) | ❌ | 不建议:除非你们做 relay |
| 16 | CDM-JSCC — Rate-Adaptive Generative Semantic Communication | arXiv | 2024 | A | ✗ | ✗ | natural images / NTSCC setup | variable entropy/rate | 多 channel setting | distortion + perceptual | GitHub (GitHub) | ⚠️ repo仍不完整 | 可:rate-adaptive generative |
| 17 | HJSCC — Hierarchical VAE JSCC | AAAI | 2025 | A | ✗ | ✗* | ImageNet→Kodak/CLIC2022 | dynamic CBR;常比较约 0.0625 | SNR sweep;rate curve 常 10 dB | PSNR | GitHub (AAAI Publications) | ✅ 两组模型 | ★★★★ 高分辨率强基线 |
| 18 | DiffJSCC | IEEE TMLCN | 2025 | A | ✗ | ✗ | OpenImages、CelebAHQ512、Kodak | OpenImages 1/384,1/96;CelebA 1/768,1/192 | repo 示例 Kodak 1 dB、CelebA −5 dB | PSNR/SSIM + LPIPS/FID 等 | GitHub (GitHub) | ✅ HuggingFace | ★★★ 感知质量 baseline |
| 19 | DHF-JSCC — Content Adaptive Distributed JSCC with Hyperprior | IEEE TCCN | 2025 | A | ✗ | ✗ | KITTI、InStereo2K | content-adaptive variable rate | 多 channel setting | PSNR / MS-SSIM | GitHub (GitHub) | ❌ | 条件:distributed stereo |
| 20 | h-DJSCC | IEEE JSAC | 2025 | H | ✗ | ✗ | CIFAR-10、CelebA | variable compression rate | AWGN 1–9 dB;fading 5–15 dB | PSNR | GitHub (GitHub) | ✅ | 可:analog→digital hybrid 参考 |
| 21 | Shared Semantic-Aware Codebook JSCC | IEEE TCOM | 2025 | A + codebook | △ | ✗ | STL-10 | C=4/8/12/16/20;SNR sweep 时 r=7.40% | 2,4,6,8,10 dB | MSE/MS-SSIM + task | GitHub (GitHub) | △ 训练式初始化 | ★★★★ codebook 思路很相关 |
| 22 | SQ-GAN — Semantic Image Communication Using Masked VQ | IEEE TCCN | 2025 | D/source coding | ✅ | PHY外置 | Cityscapes | bpp / extreme-low-rate | 不直接建模 wireless SNR | perceptual + segmentation accuracy | GitHub (GitHub) | ✅ | ★★★ VQ reference;不是严格 JSCC |
| 23 | SGDJSCC — Semantics-Guided Diffusion | arXiv | 2025 | A | ✗ | ✗ | 高分辨率自然图像 | paper settings | AWGN;with/without SNR info | distortion + perceptual/semantic | GitHub (GitHub) | ✅ | 可:generative 参考 |
| 24 | RDJSCC — Robust Distributed JSCC w/ Imperfect CSI | IEEE TWC | 2025 | A | ✗ | ✗ | distributed/multi-view image | 多 rate | fading + imperfect CSI | PSNR / SSIM | GitHub (GitHub) | ❌/未见 | 条件:CSI / multi-view |
| 25 | Variable-Length End-to-End JSCC for Semantic Communication | ICC 2026 submitted / preprint | 2026 | D option | △ Gumbel discrete | ✗ | MNIST | variable length | configurable | rate–distortion | GitHub (GitHub) | ❌ | 方法参考;不建议当自然图像主 baseline |
* WITT、SwinJSCC、HJSCC 等方法自身是连续/analog JSCC,不过论文通常会拿 BPG + LDPC + QAM 或 capacity-achieving separation scheme 作数字 baseline。例如 WITT 明确使用 5G LDPC 和 QAM 作为传统对照;SwinJSCC 也与 BPG+5G-LDPC 比较。(GitHub)
SQ-GAN 需要特别区分:它已经正式发表于 IEEE TCCN,代码和 Cityscapes pretrained model 都公开,但论文明说它只作用于 source coding,兼容传统协议栈,因此不能把它和端到端 noisy-channel JSCC 的 PSNR–SNR 曲线直接等价比较。(IEEE Xplore)
看你上传的曲线,你们现在明显是在做固定离散表示规模/符号预算下的 SNR→PSNR 曲线,而且有 x4 / x8 以及 MLP quantizer-like variant。这样的话,没有必要把上表 25 个都跑。
第一优先级:JCM + MDJCM。 这是最重要的两个,因为它们和你们一样真正进入了 digital modulation / finite alphabet 域。JCM 官方代码直接支持 BPSK、4QAM、16QAM、64QAM,而且仓库带原始模型;它就是你们最容易做 apples-to-apples 的数字 baseline。(GitHub) MDJCM进一步做 multi-order digital coding-modulation,并提供 MDJCM-A pretrained checkpoint。(GitHub)
第二优先级:Robust Masked VQ-VAE + Shared Semantic-Aware Codebook。 前者可以回答“普通 VQ/codebook 在噪声/离散传输下能做到什么”;后者虽然不是你们意义上的 channel-aware VQ,但能回答“共享 semantic codebook 本身能带来多少收益”。(GitHub)
第三优先级:SwinJSCC + WITT。 它们作为很成熟的 analog JSCC reference 非常有价值。特别是 SwinJSCC 官方 repo 已经把 CBR 0.0208–0.125 和 SNR 1/4/7/10/13 dB 的 adaptive setting 写得非常清楚,并提供 pretrained models。(GitHub)
最后加 HJSCC 作为高分辨率/强模型 reference;如果你们以后除了 PSNR 还要打 LPIPS/FID,则再加 DiffJSCC。HJSCC 的 latent 是直接映射为 channel symbols,本质仍是 analog,所以它适合作“性能参考线”,不适合拿来证明“数字化机制本身更优”。(AAAI Publications)
| 类别 | 建议方法 | 是否必须 |
|---|---|---|
| Digital / QAM | JCM | 必须 |
| Digital / multi-order | MDJCM | 必须 |
| VQ / discrete codebook | Robust Masked VQ-VAE | 必须 |
| Codebook semantic | Shared Semantic-Aware Codebook | 推荐 |
| Analog CNN/迭代 | ISEC-DeepJSCC | 推荐 |
| Analog Transformer | SwinJSCC | 必须 |
| 经典 Transformer JSCC | WITT | 推荐,可与 SwinJSCC 二选一 |
| 高分辨率 adaptive | HJSCC | 高分辨率实验推荐 |
| Generative/perceptual | DiffJSCC | 只有报 LPIPS/FID 时需要 |
| 传统 separation | BPG/JPEG(+LDPC/Polar)+QAM | 必须 |
| 理论上界 | BPG/learned codec + capacity-achieving channel | 推荐 |
这样主表实际上只需要 6–9 个算法,审稿人不会觉得你在拿大量不相关的 relay / distributed / generative 方法堆数字。
还有一个对你当前图非常重要的点:不要直接按横轴都叫 “SNR” 就比较。你们后面复现 JCM/MDJCM/SwinJSCC 时,至少需要统一 (1) channel use / CBR/CPP 的定义,(2) real/complex symbol 的计数方式,(3) 每个 QAM symbol 携带的 bits 是否计入 bandwidth ratio,(4) power normalization,(5) SNR 是 、 还是 latent signal power/noise power。例如 ISEC 对 CPP 的定义明确含有 0.5 × codeword length / image length,而 SwinJSCC 又使用自己的 CBR 定义;如果不重新换算,曲线即使横轴同为 dB、纵轴同为 PSNR,也不是真正公平比较。(GitHub)
另外,2026 年已经有新的 peer-reviewed image DeepJSCC,例如 Lightweight and Channel-Adaptive Deep Joint Source-Channel Coding for Wireless Image Transmission 已发表于 IEEE WCL 2026,但我目前没定位到可信的作者官方代码,所以没有硬塞进这张“开源论文表”。(DBLP)
如果按照你现在这张 n256-x4 / x8 图来做,我下一步最有价值的是直接帮你做一张**“JCM / MDJCM / VQ / 你们方法之间的统一 rate 换算表”**:把 N=256、x4/x8、codebook size、bits/index、QAM order、channel symbols、CBR/CPP 全部换到同一个口径,这样你就能知道论文里横向比较到底该固定哪个量。