请你找出多模态情绪分析,在IEMOCAP数据集上进行6分类的sota方法,截至2026年9月,要求文...
Tạo vào: 7 tháng 9, 2026
Trả lời bằng GPT-5.6 Thinking bởi Chat01
Tạo vào: 7 tháng 9, 2026
Trả lời bằng GPT-5.6 Thinking bởi Chat01
请你找出多模态情绪分析,在IEMOCAP数据集上进行6分类的sota方法,截至2026年9月,要求文献真实存在
截至 2026 年 9 月 7 日,我核对了 2025–2026 年 IEMOCAP 多模态情绪识别相关论文、出版社页面、会议官方页面以及可获得的实验表格。这里有一个非常重要的结论:
如果要求“真实发表 + IEMOCAP 标准 6 分类 + 实验协议写得清楚 + 指标可以较可靠地横向比较”,目前我更建议把 HJCAG 视为截至 2026 年 9 月的 SOTA 候选:Accuracy = 75.47%,Weighted-F1 = 76.84%。
但如果只按“论文中报告的最高数字”排序,有一篇 FAME-Graph 报告了 WA = 87.27%、WF1 = 86.59%。这个结果高得异常,而且其正式卷期是 2027 年 1 月,实验协议及其基线数值与主流 IEMOCAP-6 文献存在明显不可比问题。因此我不建议直接把 86.59% 写成公认的 IEMOCAP-6 SOTA。
下面是详细核查结果。
论文:
Shuqiu Tan, Chunsheng Tan, Yahui Liu.
“Hierarchical Joint Cross-Modal Attention and Gating Mechanism for Multimodal Sentiment Analysis.”
Computers, Materials & Continua, Vol. 88, No. 1, 2026.
DOI:10.32604/cmc.2026.077982
出版社记录显示论文于 2026 年 5 月 8 日正式发表,不是预印本,也不是我从二手博客中找到的虚假条目。(TechScience)
论文明确使用 IEMOCAP 中常用的 7433 条 utterances、6 个情绪类别:
也就是说,这是你问的 6 分类,而不是大量论文采用的 4 分类,也没有把 Happy 和 Excited 合并。(TechScience)
它同时明确写明:
所有报告结果均为 five-fold cross-validation 的平均结果。
评估指标为 overall Accuracy 和 Weighted-F1。(TechScience)
| 方法 | Accuracy | Weighted-F1 |
|---|---|---|
| DialogueRNN | 63.33 | 62.83 |
| HAUCL | 70.30 | 70.27 |
| AdaIGN | — | 70.74 |
| MMTr | 72.27 | 71.91 |
| EmoCaps | 73.67 | 73.01 |
| SMFNM | 70.82 | 70.94 |
| MultiEMO | — | 71.98 |
| CFN-ESA | 70.78 | 71.04 |
| SDT | 73.95 | 74.08 |
| HJCAG | 75.47 ± 0.22 | 76.84 ± 0.45 |
这些数字可以直接在出版社论文的实验表中核实。(ScienceDirect)
它的六类 F1 为:
| Emotion | F1 |
|---|---|
| Happy | 67.24 |
| Sad | 86.15 |
| Neutral | 70.43 |
| Angry | 71.89 |
| Excited | 81.54 |
| Frustrated | 71.67 |
| Weighted-F1 | 76.84 |
这是一个标准的 Text + Audio + Visual 三模态融合模型。
核心结构可以概括成:
单模态预训练特征 → 双模态 Joint Cross-Attention → 三模态 Joint Cross-Attention → Multimodal Gating → 分类器
其中:
论文的消融实验也比较明显:去掉 bimodal joint、trimodal joint 或 multimodal gate 都会降低 IEMOCAP W-F1。(TechScience)
所以,如果你需要在论文里写一句比较稳妥的话,我会写成:
As of September 2026, among published multimodal emotion-recognition studies explicitly reporting six-class IEMOCAP results under five-fold cross-validation, HJCAG reports one of the strongest results, achieving 75.47% accuracy and 76.84% weighted F1.
我会用 “one of the strongest / SOTA-level”,而不是绝对声称“全球唯一 SOTA”,原因就是下面这个 FAME-Graph。
我检索到了另一篇真实存在的论文:
Axel Gedeon Mengara et al.
“A graph neural network-based framework for fidelity-aware multimodal emotion recognition with modality-specific transformers.”
Expert Systems with Applications.
DOI:
10.1016/j.eswa.2026.133743
模型名字为:
FAME-Graph — Fidelity-Aware Multimodal Emotion Recognition with Graph Networks
论文页面确实存在于 Elsevier/ScienceDirect,不是杜撰文献。(ScienceDirect)
它也明确使用 IEMOCAP 六类:
Neutral / Happy / Sad / Angry / Excited / Frustrated。(ScienceDirect)
其三模态 T+V+A 结果为:
| Metric | FAME-Graph |
|---|---|
| WA | 87.27% |
| WF1 | 86.59% |
六类 F1:
| Emotion | F1 |
|---|---|
| Neutral | 90.61 |
| Happy | 93.67 |
| Sad | 77.01 |
| Angry | 88.50 |
| Excited | 86.24 |
| Frustrated | 82.15 |
| WF1 | 86.59 |
如果只看论文中声称的数字,那么:
FAME-Graph 86.59 > HJCAG 76.84
而且差距达到接近 10 个百分点。
但我认为这里必须打一个很大的星号。
有三个原因。
ScienceDirect 当前给出的正式 bibliographic 信息是:
Expert Systems with Applications
Volume 332, Part D
1 January 2027
尽管 DOI 中是 2026,相关记录在 2026 年已经上线,但正式卷期被分配到了 2027 年 1 月 1 日。(ScienceDirect)
因此:
这也是为什么我把 HJCAG 放在主答案里。
FAME-Graph 在自己的实验框架里报告:
但在主流 IEMOCAP 六分类文献中,MulT 类方法通常根本不是 84–85% 这个量级。
例如 HJCAG 的同类 IEMOCAP-6 benchmark 大致位于:
70–77% W-F1
而 ICASSP 2026 的 APKD、ICLR 2026 的 DecAlign 也都在 73–74% 左右,而不是 85%。这意味着 FAME-Graph 很可能采用了不同:
因此 86.59 和 76.84 不能简单认为是在完全相同 benchmark protocol 下的直接竞争结果。
尤其值得警惕的是:FAME-Graph 自己的 Table 4 称此前最佳约为 72.3%,但另一个 fusion-comparison 表又把其框架下的 MulT 做到了 84.6%。这进一步表明后者更像是在作者统一网络/特征框架中替换 fusion module 的实验,而不是直接引用标准 MulT benchmark。(ScienceDirect)
FAME-Graph 表示使用:
“standard speaker-independent evaluation protocol”
并确保测试时是 unseen speakers。(ScienceDirect)
这是积极信号。
但从当前公开实验描述中,我没有找到像:
Session 1–4 train,Session 5 test,然后五个 session 轮换并平均
这样足够明确的 session-level protocol 描述。
所以在严格做 SOTA 表时,我不会把这篇直接和 HJCAG / GraphSmile / APKD 混在一个“绝对可比”的排名里。
如果你要做论文 related work / benchmark table,我建议至少包含下面这些。
| 方法 | 年份/Venue | IEMOCAP | ACC/WAcc | WF1/WAF1 | 我的判断 |
|---|---|---|---|---|---|
| HJCAG | CMC 2026 | 6-class, 7433, 5-fold CV | 75.47 | 76.84 | 最稳妥的 SOTA 候选 |
| APKD | ICASSP 2026 | 6-class multimodal | 73.96 | 74.15 | 正式顶会论文 |
| DecAlign | ICLR 2026 | IEMOCAP 6-class | ≈73.35 | ≈73.43 | 正式 ICLR + 开源代码 |
| GraphSmile | TPAMI 2025 | IEMOCAP multimodal | 72.77 | 72.81 | 很重要的强基线 |
| SDT | HJCAG 中统一实验 | 6-class | 73.95 | 74.08 | HJCAG 的 strongest baseline |
| FAME-Graph* | ESWA, formal issue 2027 | 6-class | 87.27 | 86.59 | 最高 reported 数字,但协议/年份需单列 |
APKD 是真实的 ICASSP 2026 论文,官方 ICASSP 日程中可以查到 Paper #2580,2026 年 5 月 6 日 oral presentation;DOI 为 10.1109/ICASSP55912.2026.11463901。(ResearchGate)
它报告的 IEMOCAP:
相对于 GraphSmile 的 72.77 / 72.81 有提升。(Nanless)
DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
Chengxuan Qian, Shuo Xing, Shawn Li, Yue Zhao, Zhengzhong Tu.
ICLR 2026
这篇也是真的,ICLR 官方论文列表和作者代码都可以核实;代码库明确设置:
textdataset = IEMOCAP num_classes = 6 selection_metric = WAF1
(GitHub)
其方法重点不只是普通 attention fusion,而是:
modality-common + modality-unique representation disentanglement
然后:
来处理不同模态的异质性。
它属于 2026 年比较有参考价值的 representation-alignment 路线,而不是简单堆 cross-attention。(GitHub)
我还专门检查了截至你要求日期最近的文献。
Biao Zhang et al.
“Bidirectional mamba enhanced multimodal fusion framework for emotion recognition in conversations.”
Engineering Applications of Artificial Intelligence
Volume 179, Part 2, 1 September 2026, 115133.
DOI:
10.1016/j.engappai.2026.115133
它使用:
IEMOCAP 明确是 7433 utterances、6 类。论文称相较此前方法 IEMOCAP weighted-F1 提升 0.70 个百分点。(ScienceDirect)
但是目前 ScienceDirect 可检索文本没有完整暴露结果表中的最终 WF1,所以我没有用“0.70 improvement”去反推出一个数字——这样才能保证不给你编造实验结果。
Ping Liu, Yuan Zheng, Huadong Zhang, Shufeng Hao, Hui Song, Li Tang.
“Cross-modal dynamic fusion and grouped wavelet feature aggregation for multimodal emotion recognition in conversation.”
Applied Soft Computing
Volume 201, Part C, September 2026, 115725.
DOI:
10.1016/j.asoc.2026.115725
它也明确是 IEMOCAP 六类:
Happy / Sad / Neutral / Angry / Excited / Frustrated。(ScienceDirect)
主要结构为:
Text-guided Bidirectional Mamba + Cross-modal Dynamic Fusion + Grouped Wavelet Feature Aggregation (GWFA)。
出版社明确说它的 Accuracy 和 Weighted-F1 超过比较基线,但当前公开页面同样没有展示足够完整的 Table 1 数值,因此我也没有把它强行排在 HJCAG 前后。(ScienceDirect)
如果你的用途是写论文、开题报告、毕业论文或构建自己的 baseline,我建议采用以下定义:
HJCAG
Tan, S., Tan, C., & Liu, Y. (2026).
Hierarchical Joint Cross-Modal Attention and Gating Mechanism for Multimodal Sentiment Analysis.
Computers, Materials & Continua, 88(1).
DOI: 10.32604/cmc.2026.077982
IEMOCAP-6:
论文及结果均可由出版社直接核实。(SciOpen)
回答:
FAME-Graph 报告 WF1 = 86.59%,但应单独列为“highest reported result”,不能无条件称为与主流 IEMOCAP-6 benchmark 可比的 SOTA。
因为:
| Category | Method | ACC/WA | WF1 | Status as of 2026-09 |
|---|---|---|---|---|
| Comparable published IEMOCAP-6 | HJCAG | 75.47 | 76.84 | Recommended SOTA reference |
| Strong conference model | APKD | 73.96 | 74.15 | ICASSP 2026 |
| Strong representation model | DecAlign | 73.35 | 73.43 | ICLR 2026 |
| Previous strong baseline | GraphSmile | 72.77 | 72.81 | TPAMI 2025 |
| Highest reported, protocol caveat | FAME-Graph | 87.27 | 86.59 | Online 2026 / formal issue 2027; not directly comparable |
所以,如果你现在准备复现一个 IEMOCAP 六分类模型,我建议把 76.84% W-F1 当作需要超越的“可信 SOTA 水平”,同时在论文中单独讨论 FAME-Graph 的 86.59%,不要直接把二者放在完全相同实验协议下比较。
如果你愿意,我还可以继续帮你做两件比较有价值的工作之一:① 整理一份 2020–2026 IEMOCAP 六分类多模态方法完整 SOTA 演进表(约 20–30 篇,含 DOI、模态、特征、split、ACC/WF1、代码地址);② 专门筛选“有公开代码、可以真正复现”的 IEMOCAP-6 SOTA 方法,并告诉你哪个最适合作为你的毕业论文 baseline。
如果你希望,我也可以每月检查一次 IEMOCAP-6 是否出现超过 HJCAG 的新论文并提醒你。
请你找出多模态情绪分析,在IEMOCAP数据集上进行4分类的sota方法,截至2026年6月,要求文献真实存在
可以。这个问题比 IEMOCAP 6 分类更容易出现“伪 SOTA”,因为所谓 IEMOCAP 4-class 至少存在三套不同评估口径。我重新核对了论文原文、出版社/会议官方页面和实验设置后,结论是:
如果你要求的是最常见、最适合论文横向比较的 IEMOCAP 4 分类协议:5531 条 utterances,Angry / Sad / Neutral / Happy+Excited,speaker-independent,并以 5-fold leave-one-session-out 的平均 WA/UA 为指标,那么截至 2026 年 6 月,我最推荐把 CFIA-Net 作为可信的 SOTA/强 SOTA 基准:5-fold WA = 80.67%,UA = 81.01%。
如果只看截至 2026-06 正式发表论文中的最高“数值”,LPGNet 报告 ACC = 87.99%、F1 = 87.96%,但它计算的是 one-vs-all 的平均二分类 Accuracy/F1,不是标准四分类 WA/WF1,因此不能直接说“标准 IEMOCAP-4 SOTA = 87.96%”。
另外,SMIN 报告过 4-class WF1 = 87.47%,但它是半监督方法并利用额外无标签数据,因此也应该和纯 IEMOCAP 监督学习结果分开比较。(DOI)
论文真实存在:
Ying Hu, Huamin Yang, Hao Huang, Liang He.
“Cross-modal Features Interaction-and-Aggregation Network with Self-consistency Training for Speech Emotion Recognition.”
Interspeech 2024, pp. 2335–2339.
DOI:10.21437/Interspeech.2024-1733
这是正式的 INTERSPEECH 2024 论文,ISCA Archive 可以直接查到论文、作者、页码和 DOI。(ISCA Archive)
CFIA-Net 使用:
论文明确说明同时进行了 5-fold LOSO 和 10-fold LOSpeaker CV。(ResearchGate)
关键结果:
| 方法 / 协议 | WA | UA | WF1 |
|---|---|---|---|
| CFIA-Net,5-fold LOSO | 80.67% | 81.01% | — |
| CFIA-Net,10-fold LOSpeaker | 83.37% | 83.67% | ≈83.43% |
论文官方摘要把 10-fold 设置下的 WA 83.37%、UA 83.67% 称为 SOTA。(ISCA Archive)
但如果你是在写论文,我更建议引用 5-fold 的 80.67 / 81.01,因为 session-level LOSO 能保证整个测试 session 的两名说话人都没在训练中出现,协议更严格,也更适合作为 speaker-independent benchmark。
CFIA-Net 的主要贡献是两部分:
Cross-modal Feature Interaction and Aggregation (CFIA)
让音频和文本在多个层次之间交互,而不是简单 concatenation,也不是只做一次 cross-attention。
再加:
Self-consistency Training
让深层特征监督浅层特征,在不额外训练一个 teacher network 的情况下实现类似自蒸馏的效果。官方论文明确把这两点作为核心贡献。(ISCA Archive)
所以如果你要找一个真实、实验协议比较干净、结果可靠、适合真正复现的 4 分类强基线,我目前最推荐 CFIA-Net。
这篇尤其值得注意,因为它是 2026 年 3 月正式发表的。
论文:
Zhining He, Yang Xiao.
“LPGNet: A Lightweight Network with Parallel Attention and Gated Fusion for Multimodal Emotion Recognition.”
Circuits, Systems, and Signal Processing, 2026.
DOI:
10.1007/s00034-026-03547-w
Springer 显示:
因此肯定属于你要求的“截至 2026 年 6 月”范围,而且不是预印本。(DOI)
它明确采用:
5531 utterances
四类:
Angry / Happy / Sad / Neutral
其中:
Excited → 合并进 Happy
模态为:
Audio + Text
Audio 使用 emotion2vec,Text 使用 BERT-base-uncased。(DOI)
结果非常高:
| Model | ACC | F1 |
|---|---|---|
| Linear baseline | 81.68 | 80.75 |
| CFIA | 83.37 | — |
| LPGNet-Frame | 83.87 ± 0.23 | 83.68 ± 0.34 |
| LPGNet-Utterance | 87.99 ± 1.29 | 87.96 ± 1.63 |
Springer 正文确实就是这个结果,不是二手网站杜撰。(ResearchGate)
这是整个检索中最重要的坑。
LPGNet 原文明确写道,其主要评价指标是:
average binary accuracy and F1-score
它对每一种情绪做:
one-vs-all classification
然后将四个二分类结果取平均。(DOI)
也就是说,它计算的更接近:
然后取四者平均。
这和常见四分类模型一次输出:
所得的 WA / UA / multiclass weighted-F1 不是同一个指标。
所以:
LPGNet 87.96% F1 ≠ CFIA-Net 的标准 multiclass 83.x% WF1。
不能因为 87.96 > 83.43 就说 LPGNet 在完全相同 benchmark 下提升了 4.5 个百分点。
我建议你在论文里把它列为:
Highest reported result under one-vs-all evaluation
而不是:
“IEMOCAP 4-class standard WF1 SOTA”。
论文也真实存在:
Zheng Lian, Bin Liu, Jianhua Tao.
“SMIN: Semi-Supervised Multi-Modal Interaction Network for Conversational Emotion Recognition.”
IEEE Transactions on Affective Computing, 14(3), 2415–2429.
DOI:
10.1109/TAFFC.2022.3141237
正式发表在 IEEE T-AFFC,DBLP 也能核实卷、期、页码和 DOI。(DBLP)
它不是普通监督学习,而是:
Semi-Supervised Multi-modal Interaction Network
核心有:
这也是论文摘要明确说明的。(ResearchGate)
ICASSP 2025 的正式论文 MERITS-L 在它的 SOTA comparison table 中明确列出:
| Method | IEMOCAP 4-class WF1 |
|---|---|
| LMFN | 82.54 |
| M3ER | 82.40 |
| SMIN | 87.47 |
| MERITS-L | 86.48 |
而且该表明确注明:
All numbers are weighted F1-scores.
(arXiv)
所以 SMIN = 87.47% WF1 这个数并不是我猜出来的,后续 ICASSP 2025 论文确实这样引用。
但是存在一个关键条件:
它通过额外未标注数据进行 semi-supervised learning。
因此如果你自己的实验是:
“只允许 IEMOCAP train set,不允许额外 emotional data”
那么拿自己的结果和 SMIN 的 87.47% 直接比,不公平。
所以我会把 SMIN 定义为:
external-data / semi-supervised SOTA branch
而不是 standard supervised SOTA。
这篇也完全真实,而且很适合你的 related work。
Soumya Dutta, Sriram Ganapathy.
“LLM Supervised Pre-training for Multimodal Emotion Recognition in Conversations.”
ICASSP 2025.
DOI:
10.1109/ICASSP49660.2025.10889998
DBLP 明确记录它是 ICASSP 2025 正式会议论文。(DBLP)
它采用标准的四类:
共 5531 utterances。
划分是:
所以它不是 5-fold LOSO,而是固定 Session-5 test split。(ResearchGate)
模型为 Audio + Text:
最终:
IEMOCAP 4-class WF1 = 86.48%
(arXiv)
有意思的是,该论文自己也没有声称 IEMOCAP 第一,因为它明确写道:
SMIN 的 87.47% 比 MERITS-L 的 86.48% 高约 1 个百分点。
(arXiv)
这反过来也进一步验证了 SMIN 的 87.47 不是随意转载的数字。
核心原因不是单纯“模型差了 7%”,而是 evaluation protocol 不一样。
最典型的几种:
| 方法 | 四类设置 | 测试协议 | 指标 | 结果 | 是否可直接比较 |
|---|---|---|---|---|---|
| CFIA-Net | Happy+Excited,5531 | 5-fold LOSession | multiclass WA/UA | 80.67 / 81.01 | 推荐基准 |
| CFIA-Net | 同上 | 10-fold LOSpeaker | WA/UA | 83.37 / 83.67 | 与5-fold不同 |
| SMIN | 4-class | semi-supervised + external unlabeled data | WF1 | 87.47 | 需注明额外数据 |
| MERITS-L | Happy+Excited,5531 | fixed Session-5 test | WF1 | 86.48 | 与5-fold不同 |
| LPGNet | Happy+Excited,5531 | speaker-independent setting | one-vs-all avg binary ACC/F1 | 87.99 / 87.96 | 指标不同 |
| GS³-ICL | 4-class | 自身数据处理 | WA/UA | 78.92 / 79.88 | 数据有额外 curation |
所以 IEMOCAP-4 没有一个脱离协议就可以说的单一 SOTA 数字。
为了确保“截至 2026 年 6 月”没有漏掉截止日期前刚发表的论文,我还核查了:
Yufan Zhou et al.
“GS³-ICL: Graph-Structured Sparse Selection with Invariance-Consistent Learning for multimodal SER.”
ICMR 2026
正式发表于:
2026-06-15
DOI:
10.1145/3805622.3810766
ACM 官方页面可核实。(DOI)
它是 Audio + Text + Visual 三模态,在 IEMOCAP 4-class 上:
(DOI)
它是真实的 2026 新方法,但性能没有超过上面的 CFIA-Net,而且论文还进行了少量 data curation,所以也不应该拿来宣布新的 IEMOCAP-4 SOTA。
论文真实存在:
Wu, Y., Zhang, S., Li, P.
“Improvement of Multimodal Emotion Recognition Based on Temporal-Aware Bi-Direction Multi-Scale Network and Multi-Head Attention Mechanisms.”
Applied Sciences, 2024, 14(8), 3276.
DOI:
10.3390/app14083276
(MDPI)
它报告:
表面看 83.85% 比 CFIA-Net 5-fold 的 80.67% 高。(MDPI)
但论文正文描述的是:
“best WAR reaching 83.9%”
“best UAR reaching 82.0%”
也就是强调 best testing accuracy,而不是清晰报告五个 session 的平均值。(MDPI)
因此,如果你需要一个严谨可复现的 “mean 5-fold LOSO SOTA”,我不会优先选择它作为标准答案。
如果你是为了论文、毕业设计、博士/硕士开题或者复现 benchmark,我建议你按照下面的口径写。
标准、speaker-independent、可公平横向比较的 IEMOCAP 4-class:
CFIA-Net — Hu et al., Interspeech 2024
Audio + Text
4 classes: Angry / Sad / Neutral / Happy+Excited
5-fold leave-one-session-out:
WA = 80.67%
UA = 81.01%
DOI: 10.21437/Interspeech.2024-1733 (ISCA Archive)
如果采用作者同时测试的 10-fold leave-one-speaker-out:
WA = 83.37%, UA = 83.67%。(ISCA Archive)
SMIN — IEEE T-AFFC
WF1 = 87.47%
但属于 semi-supervised / external-data 分支。(DBLP)
LPGNet — Springer, 2026-03-07
ACC = 87.99 ± 1.29%
F1 = 87.96 ± 1.63%
但指标为 one-vs-all average binary ACC/F1,不能直接等同标准四分类 WF1。(DOI)
因此,如果你接下来需要自己做 IEMOCAP 四分类实验,我建议目标至少设为:标准 5-fold LOSO 下 WA > 80.67%、UA > 81.01%;如果你的协议是固定 Session 5 test,则应该另外跟 MERITS-L/SMIN 比,而不要把这两套结果混在一起。
如果你需要,我下一步可以直接给你整理一张 “2019–2026 年 IEMOCAP 四分类多模态 SOTA 演进表”,把约 20 篇真实论文的 论文名、年份、Venue、DOI、A/T/V 模态、是否合并 Happy+Excited、5531 样本、数据划分、WA、UA、WF1、是否用外部数据、是否有代码 全部核对后放在一张表里。