JCM IEEE TCOM 2024;VAE 概率式 joint coding-modulation...

作成日: 2026年9月8日

使用モデル GPT-5.6 Thinking by Chat01

質問

JCM IEEE TCOM 2024;VAE 概率式 joint coding-modulation Analog、DeepJSCC-Q、uniform quantizer、NN quantizer CIFAR-10 默认
1
/
24
1/24,扫描
1
/
48
1/48–
1
/
3
1/3;PSNR、classification accuracy。(Channel-Aware Vector Quantization for Robust Semantic Communication on Discrete Channels.pdf) (arXiv)
D²-JSCC IEEE JSAC 2025;数字 source coding + channel coding 联合 rate allocation DJSCC、NTSCC、BPG+Polar、capacity-achieving bound Kodak/CLIC 的 SNR 曲线常固定平均 bandwidth ratio 0.0625;PSNR、MS-SSIM。(SciXplorer)
HJSCC AAAI 2025;hierarchical VAE、动态带宽与反馈 DeepJSCC、SwinJSCC、NTSCC、BPG/JPEG/JPEG2000+LDPC、learned codecs+LDPC、JSCCformer-f 高分辨率 SNR sweep 固定 CBR 0.0625;主体以 PSNR 为主。(AAAI Publications)
uJSCC IEEE JSAC 2025;单模型支持多 modulation order 的 VQ-JSCC 专用模型 TE、model-efficient variants、DeepJSCC-Q、SSCC BPSK 到 256QAM;固定
N

256
N=256 或
1024
1024 个 channel symbols;PSNR、SSIM。(Seoul National University)
DiffJSCC IEEE TMLCN 2025;Stable Diffusion 辅助的感知 JSCC DeepJSCC、DeepJSCC-adv、BPG+LDPC、BPG-capacity、InverseJSCC 等 generative 方法 CPP
1
/
128
,
1
/
64
,
1
/
32
,
1
/
16
1/128,1/64,1/32,1/16;SNR 常用
1
,
4
,
7
,
10
,
13
1,4,7,10,13 dB;PSNR、MS-SSIM、LPIPS、FID、mIoU。(Directory of Open Access Journals)
PJSCC 2024–2025 channel-prompt adaptive JSCC DeepJSCC、ADJSCC、WITT、BPG+LDPC Kodak/CLIC 常用 CBR
1
/
16
1/16,CIFAR-10 用
1
/
3
1/3;同时报告 PSNR 和 LPIPS。(arXiv)
CAVQ/VQJSCC 2025 直接相关稿件;channel-aware codebook + multi-codebook Analog、vanilla VQ、JCM、Turbo-BPG 同 symbol rate 比较,主要为 PSNR;重点比较 16/64/256-QAM。(Channel-Aware Vector Quantization for Robust Semantic Communication on Discrete Channels.pdf)
ESC-MVQ 2025 多码本 VQ、自适应 modulation 与 power allocation 多种 digital semantic communication 方法 重点是多个 VQ codebook、bit-flip probability、调制与功率联合选择。(arXiv)
虽然 DeepJSCC-Q 是 2022 年的工作,不在严格的“两年”窗口内,但对你们而言属于不可省略的关键 baseline,因为它已经覆盖 finite alphabet、learned constellation 和 raw noisy observation reconstruction。(arXiv)联合信源信道编码领域的最近几年论文,有没有有开源代码的

思考

Searched 1 website

Worked for 46s

回答

有。你这个方向里其实已经有一批官方开源、可以直接拿来做 baseline 的 JSCC / digital semantic communication 工作了。按你现在关注的“离散信道、VQ、数字调制、rate adaptation、图像重建”来看,我建议优先看下面这些。

工作年份/Venue与你方向的关系开源情况
JCM – Joint Coding-Modulation via VAEIEEE TCOM 2024非常相关:VAE + 概率式离散化 + BPSK/4QAM/16QAM/64QAM官方代码 + models。仓库明确写了 original code/models,并支持 4 种 modulation。(GitHub) JCM GitHub
MDJCM – From Analog to Digital: Multi-Order Digital JCMIEEE TCOM 2024非常相关:多阶数字调制、digital semantic communication,比 JCM 更适合做你们的数字 baseline官方 PyTorch + pretrained model,提供 train/test script。(GitHub) MDJCM GitHub
HJSCC – Learned Image Transmission with Hierarchical VAEAAAI 2025高分辨率、HVAE、动态带宽、feedback官方 PyTorch + pretrained models,同时有 HJSCC 和 HJSCC-feedback。(GitHub) HJSCC GitHub
DiffJSCC – Diffusion-Aided JSCCIEEE TMLCN 2025感知质量 / generative JSCC,适合 LPIPS/FID/极低 CBR 对比官方代码 + pretrained checkpoints,权重已经放 Hugging Face,Kodak 等 inference 脚本也给了。(GitHub) DiffJSCC GitHub
SwinJSCCIEEE TCCN 2024很好的 analog DeepJSCC 强 baseline;支持 SNR/rate adaptive官方 PyTorch + pretrained models,Kodak/CLIC/CIFAR-10,AWGN/Rayleigh 都覆盖。(GitHub) SwinJSCC GitHub
SQ-GAN – Semantic Image Communication Using Masked VQarXiv 2025VQ 路线高度相关:masked vector quantization + generative reconstruction官方代码 + pretrained Cityscapes model。(GitHub) SQ-GAN GitHub
Robust Semantic Communications with Masked VQ-VAE Enabled CodebookIEEE TWC 2023VQ/VQ-VAE 很相关,重点是 semantic noise robustness✅ 官方 demo code,包含 VQ、channel,甚至有 MIMO communication 实现。(GitHub) RobustSemanComm GitHub
DHF-JSCC – Content Adaptive Distributed JSCC with HyperpriorIEEE TCCN 2025Hyperprior/content-adaptive、distributed image transmission✅ 官方代码。(GitHub) DHF-JSCC GitHub

你列出的那些论文,代码状态大致是这样

JCM:有,而且很值得直接复现。
这篇基本就是你们“finite alphabet / digital modulation / learned mapping”最直接的开源 baseline 之一。官方 repo 不仅有 JCM,还给了 analog network 初始化代码;README 明确说支持 BPSK、4QAM、16QAM 和 64QAM。(GitHub)

HJSCC:有。
代码质量相对不错,目录里直接分 HJSCCHJSCC_feedback,而且有预训练模型。你如果要复现 Kodak/CLIC 高分辨率 PSNR-SNR 曲线,这个很合适。(GitHub)

DiffJSCC:有,而且复现资源比较完整。
代码包含普通 CNN/Swin JSCC、conditional diffusion training、Stable Diffusion 权重合并以及 inference;官方还提供多个不同 CBR 的 checkpoint。(GitHub)

uJSCC:目前没有找到官方公开实现。
论文确实是 IEEE JSAC 2025,核心是 single encoder-decoder + VQ codebooks 支持 BPSK 到 256QAM;但目前 Papers With Code 显示 “no code implementations”,我也没有查到作者官方 GitHub。(Seoul National University)

D²-JSCC:目前没有找到官方代码。
IEEE JSAC 2025 论文和 arXiv 都在,但公开页面目前主要只有论文;CatalyzeX 也是 “Request Code”。论文实验里实际用到了 AFF3CT 做 Polar coding,因此部分传统通信链可以自己复现,但 D²-JSCC 的完整训练代码没有找到。(arXiv)

PJSCC:目前没有找到代码。
这篇是 GLOBECOM Workshops 2024 / arXiv 2411.10178;Papers With Code 目前也是 “no code implementations”。(arXiv)

CAVQ / VQJSCC:目前没有看到官方 repo。
这篇 Channel-Aware Vector Quantization for Robust Semantic Communication on Discrete Channels 是 2025 年 10 月的较新稿件,和你们现在的离散信道/VQ方向确实非常接近,但目前 arXiv 正文没有给出公开 code repository。(arXiv)

ESC-MVQ:目前也没有找到官方代码。
这篇已经发表在 IEEE TWC,核心是 multiple VQ codebooks + trainable bit-flip probabilities + modulation/power allocation,但 Papers With Code 对该作者组目前标的是 no code implementations。(DOI)

如果你们现在要搭实验,我会这样选 baseline

如果你的核心创新也是 “VQ / finite alphabet / QAM / discrete channel”,最值得先跑的是:

JCM → MDJCM → Robust VQ-VAE → SwinJSCC → DiffJSCC

其中:

  • JCM:最接近“概率式 joint coding-modulation”;
  • MDJCM:最接近“多 modulation order 数字 JSCC”;
  • Robust VQ-VAE:适合比较 learned codebook / VQ;
  • SwinJSCC:提供一个很强的 analog JSCC upper/alternative baseline;
  • DiffJSCC:提供 perceptual/generative baseline。

然后论文表里可以再放 uJSCC、D²-JSCC、CAVQ/VQJSCC、ESC-MVQ 的 paper-reported numbers,即使它们现在没有公开实现。

另外有一个很实用的汇总仓库 OpenSemanticComm,目前已经整理了很多 2023–2025 年 semantic communication/JSCC 的官方代码,包括 JCM、SwinJSCC、DiffJSCC、CDDM、DeepJSCC-1++、NTSCC 等。(GitHub)
OpenSemanticComm 开源代码汇总

如果你愿意,我下一步可以直接给你整理一张 “2023–2026 图像 JSCC 开源论文表”,大约 20–30 篇,列成:

Paper|Venue|Year|Analog/Digital|VQ?|QAM?|Dataset|CBR/CPP|SNR|Metric|GitHub|是否有 pretrained weights|适不适合做你们 baseline

这样基本可以直接放到你们 related work / 实验计划里。

質問

image.png

你整理一张 “2023–2026 图像 JSCC 开源论文表”,大约 20–30 篇,列成:

Paper|Venue|Year|Analog/Digital|VQ?|QAM?|Dataset|CBR/CPP|SNR|Metric|GitHub|是否有 pretrained weights|适不适合做你们 baseline

思考

Searched 9 websites

Worked for 6m 2s

回答

可以。我按截至 2026 年 9 月公开可找到的官方/作者代码重新筛了一遍,尽量只保留“图像传输 + JSCC/semantic communication + 有可用代码”的工作。像 uJSCC、D²-JSCC、CAVQ/ESC-MVQ 这类与你们很相关但目前没有可靠官方代码的,我不塞进主表。

先说明表里的口径:A = analog/连续 channel symbols,D = digital/离散符号或显式数字调制,H = hybrid;“QAM”指方法本身是否显式使用 QAM,不是论文拿来比较的 BPG+LDPC+QAM baseline;“△”表示部分相关或并非严格 VQ-JSCC。CBR/CPP 只写论文/repo 中最常用、最方便复现的一组,并不表示论文只有这一组设置。OpenSemanticComm 目前也收录了其中相当多的官方实现。(GitHub)

2023–2026 图像 JSCC 开源论文表

#PaperVenueYearA/DVQ?QAM?DatasetCBR / CPP 常用设置SNRMetricGitHubPretrained适合你们 baseline?
1WITTICASSP2023A✗*CIFAR-10;DIV2K→Kodak/CLIC21CBR 0.0625 常用1,4,7,10,13 dBPSNR / MS-SSIMGitHub (GitHub)强:analog Transformer baseline
2DeepJSCC-L++GLOBECOM2023A图像;Swin backbone多 bandwidth ratios多 SNR 单模型PSNRGitHub (GitHub)△ 需训练/本地 models可:rate+SNR adaptive
3ISEC-DeepJSCCAISTATS2023ACIFAR-10、OpenImages、KodakCIFAR 1/6,1/12;OpenImages 1/6,1/16CIFAR 0/5/10;OI 1/7/13 dBPSNR / perceptualGitHub (GitHub)强:CNN analog baseline
4PADC / Predictive & Adaptive Deep CodingIEEE TWC2023ACIFAR-10、ImageNet、Kodakvariable rate多 SNRPSNR / SSIMGitHub (GitHub)❌/未见统一权重可:adaptive baseline
5Robust Semantic Communications with Masked VQ-VAE CodebookIEEE TWC2023D图像 + downstream semantic tasksVQ index / codebook ratesemantic noise / wireless channelreconstruction + task accuracyGitHub (GitHub)⚠️ README仍写“soon”非常强:VQ/discrete 对照
6Distributed DeepJSCC over MACICC2023Acorrelated/distributed images示例 1/3 bandwidth ratioMAC 多 SNRPSNRGitHub (GitHub)条件:只在多用户/NOMA有意义
7Space-Time JSCC over MIMOSPAWC2023A✗*图像 / MIMOMIMO-specific2×2 MIMO 等PSNRGitHub (GitHub)条件:MIMO 才需要
8CDDMIEEE TWC 2024;前身 GLOBECOM'232024A图像跟随 underlying JSCCrepo 示例 10 dB AWGNPSNR / denoising qualityGitHub (GitHub)可:channel denoiser baseline
9JCM — Joint Coding-Modulation via VAEIEEE TCOM2024D△ 概率离散化✅ BPSK / 4 / 16 / 64QAMCIFAR-10常用 1/24;可扫 1/48–1/3repo 给 −18…18 dBPSNR + classification acc.GitHub (GitHub)★★★★★ 必跑
10MDJCM — Multi-Order Digital JCMIEEE TCOM2024D✗/quantization✅ 多阶数字 modulationNTSCC / 高分辨率图像设置adaptive digital rate多 SNRdistortion qualityGitHub (GitHub)✅ MDJCM-A★★★★★ 必跑
11SwinJSCCIEEE TCCN2024A✗*CIFAR-10;DIV2K→Kodak/CLIC210.0208, .0416, .0625, .0833, .1251,4,7,10,13 dBPSNR / MS-SSIMGitHub (GitHub)★★★★★ analog 强基线
12Hyper-AJSCCarXiv / adaptive JSCC2024ACIFAR-10architecture-dependent多 SNR/channel conditionsreconstruction / taskGitHub (GitHub)可:single-model adaptive
13DeepJSCC-WZICMLCN2024AKITTI Stereo、Cityscapesρ≈1/16,1/32多 SNRPSNR/MS-SSIM/LPIPSGitHub (GitHub)✅ checkpoints条件:decoder side information
14DeepJSCC + Diffusion / High Perceptual Quality Wireless Image DeliveryINFOCOM Workshops2024AImageNet / 512×512low-res JSCC多 noise settingdistortion + perceptualGitHub (GitHub)△ diffusion 权重可:生成式参考
15DeepJSCC over Cooperative Relay NetworksICMLCN2024A图像relay-specific例:SR=12, SD=6, RD=6 dBPSNRGitHub (GitHub)不建议:除非你们做 relay
16CDM-JSCC — Rate-Adaptive Generative Semantic CommunicationarXiv2024Anatural images / NTSCC setupvariable entropy/rate多 channel settingdistortion + perceptualGitHub (GitHub)⚠️ repo仍不完整可:rate-adaptive generative
17HJSCC — Hierarchical VAE JSCCAAAI2025A✗*ImageNet→Kodak/CLIC2022dynamic CBR;常比较约 0.0625SNR sweep;rate curve 常 10 dBPSNRGitHub (AAAI Publications)✅ 两组模型★★★★ 高分辨率强基线
18DiffJSCCIEEE TMLCN2025AOpenImages、CelebAHQ512、KodakOpenImages 1/384,1/96;CelebA 1/768,1/192repo 示例 Kodak 1 dB、CelebA −5 dBPSNR/SSIM + LPIPS/FID 等GitHub (GitHub)✅ HuggingFace★★★ 感知质量 baseline
19DHF-JSCC — Content Adaptive Distributed JSCC with HyperpriorIEEE TCCN2025AKITTI、InStereo2Kcontent-adaptive variable rate多 channel settingPSNR / MS-SSIMGitHub (GitHub)条件:distributed stereo
20h-DJSCCIEEE JSAC2025HCIFAR-10、CelebAvariable compression rateAWGN 1–9 dB;fading 5–15 dBPSNRGitHub (GitHub)可:analog→digital hybrid 参考
21Shared Semantic-Aware Codebook JSCCIEEE TCOM2025A + codebookSTL-10C=4/8/12/16/20;SNR sweep 时 r=7.40%2,4,6,8,10 dBMSE/MS-SSIM + taskGitHub (GitHub)△ 训练式初始化★★★★ codebook 思路很相关
22SQ-GAN — Semantic Image Communication Using Masked VQIEEE TCCN2025D/source codingPHY外置Cityscapesbpp / extreme-low-rate不直接建模 wireless SNRperceptual + segmentation accuracyGitHub (GitHub)★★★ VQ reference;不是严格 JSCC
23SGDJSCC — Semantics-Guided DiffusionarXiv2025A高分辨率自然图像paper settingsAWGN;with/without SNR infodistortion + perceptual/semanticGitHub (GitHub)可:generative 参考
24RDJSCC — Robust Distributed JSCC w/ Imperfect CSIIEEE TWC2025Adistributed/multi-view image多 ratefading + imperfect CSIPSNR / SSIMGitHub (GitHub)❌/未见条件:CSI / multi-view
25Variable-Length End-to-End JSCC for Semantic CommunicationICC 2026 submitted / preprint2026D option△ Gumbel discreteMNISTvariable lengthconfigurablerate–distortionGitHub (GitHub)方法参考;不建议当自然图像主 baseline

* WITT、SwinJSCC、HJSCC 等方法自身是连续/analog JSCC,不过论文通常会拿 BPG + LDPC + QAM 或 capacity-achieving separation scheme 作数字 baseline。例如 WITT 明确使用 5G LDPC 和 QAM 作为传统对照;SwinJSCC 也与 BPG+5G-LDPC 比较。(GitHub)

SQ-GAN 需要特别区分:它已经正式发表于 IEEE TCCN,代码和 Cityscapes pretrained model 都公开,但论文明说它只作用于 source coding,兼容传统协议栈,因此不能把它和端到端 noisy-channel JSCC 的 PSNR–SNR 曲线直接等价比较。(IEEE Xplore)

对你们这张图,我会把 baseline 缩成 7 个

看你上传的曲线,你们现在明显是在做固定离散表示规模/符号预算下的 SNR→PSNR 曲线,而且有 x4 / x8 以及 MLP quantizer-like variant。这样的话,没有必要把上表 25 个都跑。

第一优先级:JCM + MDJCM。 这是最重要的两个,因为它们和你们一样真正进入了 digital modulation / finite alphabet 域。JCM 官方代码直接支持 BPSK、4QAM、16QAM、64QAM,而且仓库带原始模型;它就是你们最容易做 apples-to-apples 的数字 baseline。(GitHub) MDJCM进一步做 multi-order digital coding-modulation,并提供 MDJCM-A pretrained checkpoint。(GitHub)

第二优先级:Robust Masked VQ-VAE + Shared Semantic-Aware Codebook。 前者可以回答“普通 VQ/codebook 在噪声/离散传输下能做到什么”;后者虽然不是你们意义上的 channel-aware VQ,但能回答“共享 semantic codebook 本身能带来多少收益”。(GitHub)

第三优先级:SwinJSCC + WITT。 它们作为很成熟的 analog JSCC reference 非常有价值。特别是 SwinJSCC 官方 repo 已经把 CBR 0.0208–0.125 和 SNR 1/4/7/10/13 dB 的 adaptive setting 写得非常清楚,并提供 pretrained models。(GitHub)

最后加 HJSCC 作为高分辨率/强模型 reference;如果你们以后除了 PSNR 还要打 LPIPS/FID,则再加 DiffJSCC。HJSCC 的 latent 是直接映射为 channel symbols,本质仍是 analog,所以它适合作“性能参考线”,不适合拿来证明“数字化机制本身更优”。(AAAI Publications)

你们论文里我建议最终做成这样的 baseline hierarchy

类别建议方法是否必须
Digital / QAMJCM必须
Digital / multi-orderMDJCM必须
VQ / discrete codebookRobust Masked VQ-VAE必须
Codebook semanticShared Semantic-Aware Codebook推荐
Analog CNN/迭代ISEC-DeepJSCC推荐
Analog TransformerSwinJSCC必须
经典 Transformer JSCCWITT推荐,可与 SwinJSCC 二选一
高分辨率 adaptiveHJSCC高分辨率实验推荐
Generative/perceptualDiffJSCC只有报 LPIPS/FID 时需要
传统 separationBPG/JPEG(+LDPC/Polar)+QAM必须
理论上界BPG/learned codec + capacity-achieving channel推荐

这样主表实际上只需要 6–9 个算法,审稿人不会觉得你在拿大量不相关的 relay / distributed / generative 方法堆数字。

还有一个对你当前图非常重要的点:不要直接按横轴都叫 “SNR” 就比较。你们后面复现 JCM/MDJCM/SwinJSCC 时,至少需要统一 (1) channel use / CBR/CPP 的定义,(2) real/complex symbol 的计数方式,(3) 每个 QAM symbol 携带的 bits 是否计入 bandwidth ratio,(4) power normalization,(5) SNR 是 Es/N0E_s/N_0Eb/N0E_b/N_0 还是 latent signal power/noise power。例如 ISEC 对 CPP 的定义明确含有 0.5 × codeword length / image length,而 SwinJSCC 又使用自己的 CBR 定义;如果不重新换算,曲线即使横轴同为 dB、纵轴同为 PSNR,也不是真正公平比较。(GitHub)

另外,2026 年已经有新的 peer-reviewed image DeepJSCC,例如 Lightweight and Channel-Adaptive Deep Joint Source-Channel Coding for Wireless Image Transmission 已发表于 IEEE WCL 2026,但我目前没定位到可信的作者官方代码,所以没有硬塞进这张“开源论文表”。(DBLP)

如果按照你现在这张 n256-x4 / x8 图来做,我下一步最有价值的是直接帮你做一张**“JCM / MDJCM / VQ / 你们方法之间的统一 rate 换算表”**:把 N=256、x4/x8、codebook size、bits/index、QAM order、channel symbols、CBR/CPP 全部换到同一个口径,这样你就能知道论文里横向比较到底该固定哪个量。

このQ&Aを共有