请你找出多模态情绪分析,在IEMOCAP数据集上进行6分类的sota方法,截至2026年9月,要求文...

Tạo vào: 7 tháng 9, 2026

Trả lời bằng GPT-5.6 Thinking bởi Chat01

Câu hỏi

请你找出多模态情绪分析,在IEMOCAP数据集上进行6分类的sota方法,截至2026年9月,要求文献真实存在

Suy nghĩ

Searched 7 websites

Worked for 2m 8s

Trả lời

截至 2026 年 9 月 7 日,我核对了 2025–2026 年 IEMOCAP 多模态情绪识别相关论文、出版社页面、会议官方页面以及可获得的实验表格。这里有一个非常重要的结论:

如果要求“真实发表 + IEMOCAP 标准 6 分类 + 实验协议写得清楚 + 指标可以较可靠地横向比较”,目前我更建议把 HJCAG 视为截至 2026 年 9 月的 SOTA 候选:Accuracy = 75.47%,Weighted-F1 = 76.84%。

但如果只按“论文中报告的最高数字”排序,有一篇 FAME-Graph 报告了 WA = 87.27%、WF1 = 86.59%。这个结果高得异常,而且其正式卷期是 2027 年 1 月,实验协议及其基线数值与主流 IEMOCAP-6 文献存在明显不可比问题。因此我不建议直接把 86.59% 写成公认的 IEMOCAP-6 SOTA

下面是详细核查结果。


1. 我认为截至 2026-09 最稳妥的 SOTA:HJCAG

论文:

Shuqiu Tan, Chunsheng Tan, Yahui Liu.
“Hierarchical Joint Cross-Modal Attention and Gating Mechanism for Multimodal Sentiment Analysis.”
Computers, Materials & Continua, Vol. 88, No. 1, 2026.

DOI:10.32604/cmc.2026.077982

出版社记录显示论文于 2026 年 5 月 8 日正式发表,不是预印本,也不是我从二手博客中找到的虚假条目。(TechScience)

IEMOCAP 设置

论文明确使用 IEMOCAP 中常用的 7433 条 utterances、6 个情绪类别

  • Happy
  • Sad
  • Neutral
  • Angry
  • Excited
  • Frustrated

也就是说,这是你问的 6 分类,而不是大量论文采用的 4 分类,也没有把 Happy 和 Excited 合并。(TechScience)

它同时明确写明:

所有报告结果均为 five-fold cross-validation 的平均结果

评估指标为 overall Accuracy 和 Weighted-F1。(TechScience)

结果

方法AccuracyWeighted-F1
DialogueRNN63.3362.83
HAUCL70.3070.27
AdaIGN70.74
MMTr72.2771.91
EmoCaps73.6773.01
SMFNM70.8270.94
MultiEMO71.98
CFN-ESA70.7871.04
SDT73.9574.08
HJCAG75.47 ± 0.2276.84 ± 0.45

这些数字可以直接在出版社论文的实验表中核实。(ScienceDirect)

它的六类 F1 为:

EmotionF1
Happy67.24
Sad86.15
Neutral70.43
Angry71.89
Excited81.54
Frustrated71.67
Weighted-F176.84

(ScienceDirect)

HJCAG 做了什么?

这是一个标准的 Text + Audio + Visual 三模态融合模型。

核心结构可以概括成:

单模态预训练特征 → 双模态 Joint Cross-Attention → 三模态 Joint Cross-Attention → Multimodal Gating → 分类器

其中:

  1. 文本、音频、视觉分别提取高层特征;
  2. 先在两两模态之间学习交互关系;
  3. 再进行三模态联合交互;
  4. 最后利用 gating mechanism 动态决定 T/A/V 各自贡献。

论文的消融实验也比较明显:去掉 bimodal joint、trimodal joint 或 multimodal gate 都会降低 IEMOCAP W-F1。(TechScience)

所以,如果你需要在论文里写一句比较稳妥的话,我会写成:

As of September 2026, among published multimodal emotion-recognition studies explicitly reporting six-class IEMOCAP results under five-fold cross-validation, HJCAG reports one of the strongest results, achieving 75.47% accuracy and 76.84% weighted F1.

我会用 “one of the strongest / SOTA-level”,而不是绝对声称“全球唯一 SOTA”,原因就是下面这个 FAME-Graph。


2. 为什么不能简单说最高是 76.84%:FAME-Graph 报告了 86.59%

我检索到了另一篇真实存在的论文:

Axel Gedeon Mengara et al.
“A graph neural network-based framework for fidelity-aware multimodal emotion recognition with modality-specific transformers.”
Expert Systems with Applications.

DOI:

10.1016/j.eswa.2026.133743

模型名字为:

FAME-Graph — Fidelity-Aware Multimodal Emotion Recognition with Graph Networks

论文页面确实存在于 Elsevier/ScienceDirect,不是杜撰文献。(ScienceDirect)

它也明确使用 IEMOCAP 六类:

Neutral / Happy / Sad / Angry / Excited / Frustrated。(ScienceDirect)

其三模态 T+V+A 结果为:

MetricFAME-Graph
WA87.27%
WF186.59%

六类 F1:

EmotionF1
Neutral90.61
Happy93.67
Sad77.01
Angry88.50
Excited86.24
Frustrated82.15
WF186.59

(ScienceDirect)

如果只看论文中声称的数字,那么:

FAME-Graph 86.59 > HJCAG 76.84

而且差距达到接近 10 个百分点

但我认为这里必须打一个很大的星号。


3. 为什么我不建议直接宣布“FAME-Graph = IEMOCAP-6 SOTA”

有三个原因。

第一,正式出版时间实际上是 2027

ScienceDirect 当前给出的正式 bibliographic 信息是:

Expert Systems with Applications
Volume 332, Part D
1 January 2027

尽管 DOI 中是 2026,相关记录在 2026 年已经上线,但正式卷期被分配到了 2027 年 1 月 1 日。(ScienceDirect)

因此:

  • 若“截至 2026 年 9 月”包含 online-first / article in press:可以讨论它;
  • 若严格要求“截至 2026 年 9 月已经正式卷期发表”:不能算进去

这也是为什么我把 HJCAG 放在主答案里。


第二,更严重的问题是实验数值和传统 benchmark 明显不在一个尺度上

FAME-Graph 在自己的实验框架里报告:

  • MulT:WF1 84.6%
  • MMTM:83.9%
  • FAME-Graph:86.59%

(ScienceDirect)

但在主流 IEMOCAP 六分类文献中,MulT 类方法通常根本不是 84–85% 这个量级。

例如 HJCAG 的同类 IEMOCAP-6 benchmark 大致位于:

70–77% W-F1

而 ICASSP 2026 的 APKD、ICLR 2026 的 DecAlign 也都在 73–74% 左右,而不是 85%。这意味着 FAME-Graph 很可能采用了不同:

  • train/test split;
  • 特征预处理;
  • speaker partition;
  • 上下文构造;
  • 或重实现方式。

因此 86.59 和 76.84 不能简单认为是在完全相同 benchmark protocol 下的直接竞争结果

尤其值得警惕的是:FAME-Graph 自己的 Table 4 称此前最佳约为 72.3%,但另一个 fusion-comparison 表又把其框架下的 MulT 做到了 84.6%。这进一步表明后者更像是在作者统一网络/特征框架中替换 fusion module 的实验,而不是直接引用标准 MulT benchmark。(ScienceDirect)


第三,论文虽然写了 speaker-independent,但没有像 HJCAG 那样清晰给出标准 5-fold 平均协议

FAME-Graph 表示使用:

“standard speaker-independent evaluation protocol”

并确保测试时是 unseen speakers。(ScienceDirect)

这是积极信号。

但从当前公开实验描述中,我没有找到像:

Session 1–4 train,Session 5 test,然后五个 session 轮换并平均

这样足够明确的 session-level protocol 描述。

所以在严格做 SOTA 表时,我不会把这篇直接和 HJCAG / GraphSmile / APKD 混在一个“绝对可比”的排名里。


4. 几个真实且值得作为基线的 2025–2026 方法

如果你要做论文 related work / benchmark table,我建议至少包含下面这些。

方法年份/VenueIEMOCAPACC/WAccWF1/WAF1我的判断
HJCAGCMC 20266-class, 7433, 5-fold CV75.4776.84最稳妥的 SOTA 候选
APKDICASSP 20266-class multimodal73.9674.15正式顶会论文
DecAlignICLR 2026IEMOCAP 6-class≈73.35≈73.43正式 ICLR + 开源代码
GraphSmileTPAMI 2025IEMOCAP multimodal72.7772.81很重要的强基线
SDTHJCAG 中统一实验6-class73.9574.08HJCAG 的 strongest baseline
FAME-Graph*ESWA, formal issue 20276-class87.2786.59最高 reported 数字,但协议/年份需单列

APKD 是真实的 ICASSP 2026 论文,官方 ICASSP 日程中可以查到 Paper #2580,2026 年 5 月 6 日 oral presentation;DOI 为 10.1109/ICASSP55912.2026.11463901。(ResearchGate)

它报告的 IEMOCAP:

  • ACC = 73.96%
  • WF1 = 74.15%
  • 仅约 2.73M 参数

相对于 GraphSmile 的 72.77 / 72.81 有提升。(Nanless)


5. DecAlign 也值得特别注意

DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning

Chengxuan Qian, Shuo Xing, Shawn Li, Yue Zhao, Zhengzhong Tu.

ICLR 2026

这篇也是真的,ICLR 官方论文列表和作者代码都可以核实;代码库明确设置:

text
dataset = IEMOCAP num_classes = 6 selection_metric = WAF1

(GitHub)

其方法重点不只是普通 attention fusion,而是:

modality-common + modality-unique representation disentanglement

然后:

  • prototype-guided optimal transport;
  • multi-marginal transport;
  • MMD latent distribution matching;

来处理不同模态的异质性。

它属于 2026 年比较有参考价值的 representation-alignment 路线,而不是简单堆 cross-attention。(GitHub)


6. 2026 年 9 月刚发表的两篇论文,也确实存在

我还专门检查了截至你要求日期最近的文献。

BiM-Multi

Biao Zhang et al.
“Bidirectional mamba enhanced multimodal fusion framework for emotion recognition in conversations.”

Engineering Applications of Artificial Intelligence
Volume 179, Part 2, 1 September 2026, 115133.

DOI:

10.1016/j.engappai.2026.115133

(ScienceDirect)

它使用:

  • Visual:YOLOv5 + ResNet-101 / ViYorNet
  • Text:EmoBERTa / RoBERTa
  • Audio:WavLM
  • Fusion:BiM-CrossAttn
  • Temporal modeling:Bidirectional Mamba
  • Loss:SWFC/Focal contrastive type loss

IEMOCAP 明确是 7433 utterances、6 类。论文称相较此前方法 IEMOCAP weighted-F1 提升 0.70 个百分点。(ScienceDirect)

但是目前 ScienceDirect 可检索文本没有完整暴露结果表中的最终 WF1,所以我没有用“0.70 improvement”去反推出一个数字——这样才能保证不给你编造实验结果。


BiT-MERC

Ping Liu, Yuan Zheng, Huadong Zhang, Shufeng Hao, Hui Song, Li Tang.
“Cross-modal dynamic fusion and grouped wavelet feature aggregation for multimodal emotion recognition in conversation.”

Applied Soft Computing
Volume 201, Part C, September 2026, 115725.

DOI:

10.1016/j.asoc.2026.115725

(ScienceDirect)

它也明确是 IEMOCAP 六类:

Happy / Sad / Neutral / Angry / Excited / Frustrated。(ScienceDirect)

主要结构为:

Text-guided Bidirectional Mamba + Cross-modal Dynamic Fusion + Grouped Wavelet Feature Aggregation (GWFA)

出版社明确说它的 Accuracy 和 Weighted-F1 超过比较基线,但当前公开页面同样没有展示足够完整的 Table 1 数值,因此我也没有把它强行排在 HJCAG 前后。(ScienceDirect)


7. 因此,我给你的最终 SOTA 判断

如果你的用途是写论文、开题报告、毕业论文或构建自己的 baseline,我建议采用以下定义:

严格意义下、截至 2026-09 最适合作为 IEMOCAP 6-class SOTA 引用

HJCAG

Tan, S., Tan, C., & Liu, Y. (2026).
Hierarchical Joint Cross-Modal Attention and Gating Mechanism for Multimodal Sentiment Analysis.
Computers, Materials & Continua, 88(1).
DOI: 10.32604/cmc.2026.077982

IEMOCAP-6:

  • Accuracy: 75.47 ± 0.22%
  • Weighted-F1: 76.84 ± 0.45%
  • 7433 utterances
  • T + A + V
  • five-fold cross-validation

论文及结果均可由出版社直接核实。(SciOpen)

如果导师问“那为什么网上有 86%?”

回答:

FAME-Graph 报告 WF1 = 86.59%,但应单独列为“highest reported result”,不能无条件称为与主流 IEMOCAP-6 benchmark 可比的 SOTA。

因为:

  1. 正式卷期为 2027-01-01
  2. 其 baseline 在作者框架下的分数尺度与主流 6-class benchmark 差别很大;
  3. 公开实验协议不足以证明它与常用 five-session/five-fold benchmark 完全等价。(ScienceDirect)

我建议你论文里的 SOTA 表最终这样写

CategoryMethodACC/WAWF1Status as of 2026-09
Comparable published IEMOCAP-6HJCAG75.4776.84Recommended SOTA reference
Strong conference modelAPKD73.9674.15ICASSP 2026
Strong representation modelDecAlign73.3573.43ICLR 2026
Previous strong baselineGraphSmile72.7772.81TPAMI 2025
Highest reported, protocol caveatFAME-Graph87.2786.59Online 2026 / formal issue 2027; not directly comparable

所以,如果你现在准备复现一个 IEMOCAP 六分类模型,我建议把 76.84% W-F1 当作需要超越的“可信 SOTA 水平”,同时在论文中单独讨论 FAME-Graph 的 86.59%,不要直接把二者放在完全相同实验协议下比较。

如果你愿意,我还可以继续帮你做两件比较有价值的工作之一:① 整理一份 2020–2026 IEMOCAP 六分类多模态方法完整 SOTA 演进表(约 20–30 篇,含 DOI、模态、特征、split、ACC/WF1、代码地址);② 专门筛选“有公开代码、可以真正复现”的 IEMOCAP-6 SOTA 方法,并告诉你哪个最适合作为你的毕业论文 baseline。

如果你希望,我也可以每月检查一次 IEMOCAP-6 是否出现超过 HJCAG 的新论文并提醒你。

Câu hỏi

请你找出多模态情绪分析,在IEMOCAP数据集上进行4分类的sota方法,截至2026年6月,要求文献真实存在

Suy nghĩ

Searched 8 websites

Worked for 5m 23s

Trả lời

可以。这个问题比 IEMOCAP 6 分类更容易出现“伪 SOTA”,因为所谓 IEMOCAP 4-class 至少存在三套不同评估口径。我重新核对了论文原文、出版社/会议官方页面和实验设置后,结论是:

如果你要求的是最常见、最适合论文横向比较的 IEMOCAP 4 分类协议:5531 条 utterances,Angry / Sad / Neutral / Happy+Excited,speaker-independent,并以 5-fold leave-one-session-out 的平均 WA/UA 为指标,那么截至 2026 年 6 月,我最推荐把 CFIA-Net 作为可信的 SOTA/强 SOTA 基准:5-fold WA = 80.67%,UA = 81.01%。

如果只看截至 2026-06 正式发表论文中的最高“数值”,LPGNet 报告 ACC = 87.99%、F1 = 87.96%,但它计算的是 one-vs-all 的平均二分类 Accuracy/F1,不是标准四分类 WA/WF1,因此不能直接说“标准 IEMOCAP-4 SOTA = 87.96%”。

另外,SMIN 报告过 4-class WF1 = 87.47%,但它是半监督方法并利用额外无标签数据,因此也应该和纯 IEMOCAP 监督学习结果分开比较。(DOI)


1. 最推荐作为标准 IEMOCAP-4 SOTA 基准:CFIA-Net

论文真实存在:

Ying Hu, Huamin Yang, Hao Huang, Liang He.
“Cross-modal Features Interaction-and-Aggregation Network with Self-consistency Training for Speech Emotion Recognition.”
Interspeech 2024, pp. 2335–2339.

DOI:10.21437/Interspeech.2024-1733

这是正式的 INTERSPEECH 2024 论文,ISCA Archive 可以直接查到论文、作者、页码和 DOI。(ISCA Archive)

CFIA-Net 官方 ISCA Archive 页面

实验协议

CFIA-Net 使用:

  • Audio + Text
  • Audio:emotion2vec
  • Text:BERT
  • speaker-independent
  • 同时测试 5-fold leave-one-session-out
  • 10-fold leave-one-speaker-out
  • 指标:WA、UA、WF1

论文明确说明同时进行了 5-fold LOSO 和 10-fold LOSpeaker CV。(ResearchGate)

关键结果:

方法 / 协议WAUAWF1
CFIA-Net,5-fold LOSO80.67%81.01%
CFIA-Net,10-fold LOSpeaker83.37%83.67%≈83.43%

论文官方摘要把 10-fold 设置下的 WA 83.37%、UA 83.67% 称为 SOTA。(ISCA Archive)

但如果你是在写论文,我更建议引用 5-fold 的 80.67 / 81.01,因为 session-level LOSO 能保证整个测试 session 的两名说话人都没在训练中出现,协议更严格,也更适合作为 speaker-independent benchmark。

模型核心

CFIA-Net 的主要贡献是两部分:

Cross-modal Feature Interaction and Aggregation (CFIA)

让音频和文本在多个层次之间交互,而不是简单 concatenation,也不是只做一次 cross-attention。

再加:

Self-consistency Training

让深层特征监督浅层特征,在不额外训练一个 teacher network 的情况下实现类似自蒸馏的效果。官方论文明确把这两点作为核心贡献。(ISCA Archive)

所以如果你要找一个真实、实验协议比较干净、结果可靠、适合真正复现的 4 分类强基线,我目前最推荐 CFIA-Net


2. 截至 2026-06 数字最高的新论文之一:LPGNet

这篇尤其值得注意,因为它是 2026 年 3 月正式发表的。

论文:

Zhining He, Yang Xiao.
“LPGNet: A Lightweight Network with Parallel Attention and Gated Fusion for Multimodal Emotion Recognition.”
Circuits, Systems, and Signal Processing, 2026.

DOI:

10.1007/s00034-026-03547-w

Springer 显示:

  • Accepted:2026-02-14
  • Published:2026-03-07
  • Version of Record:2026-03-07

因此肯定属于你要求的“截至 2026 年 6 月”范围,而且不是预印本。(DOI)

LPGNet Springer 官方论文页面

IEMOCAP 设置

它明确采用:

5531 utterances

四类:

Angry / Happy / Sad / Neutral

其中:

Excited → 合并进 Happy

模态为:

Audio + Text

Audio 使用 emotion2vec,Text 使用 BERT-base-uncased。(DOI)

结果非常高:

ModelACCF1
Linear baseline81.6880.75
CFIA83.37
LPGNet-Frame83.87 ± 0.2383.68 ± 0.34
LPGNet-Utterance87.99 ± 1.2987.96 ± 1.63

Springer 正文确实就是这个结果,不是二手网站杜撰。(ResearchGate)


3. 但我不建议把“87.96%”直接写成标准四分类 WF1 SOTA

这是整个检索中最重要的坑。

LPGNet 原文明确写道,其主要评价指标是:

average binary accuracy and F1-score

它对每一种情绪做:

one-vs-all classification

然后将四个二分类结果取平均。(DOI)

也就是说,它计算的更接近:

Angry vs. OthersAngry \ vs.\ Others Happy vs. OthersHappy \ vs.\ Others Sad vs. OthersSad \ vs.\ Others Neutral vs. OthersNeutral \ vs.\ Others

然后取四者平均。

这和常见四分类模型一次输出:

y{Angry,Happy,Sad,Neutral}y\in\{Angry,Happy,Sad,Neutral\}

所得的 WA / UA / multiclass weighted-F1 不是同一个指标。

所以:

LPGNet 87.96% F1 ≠ CFIA-Net 的标准 multiclass 83.x% WF1。

不能因为 87.96 > 83.43 就说 LPGNet 在完全相同 benchmark 下提升了 4.5 个百分点。

我建议你在论文里把它列为:

Highest reported result under one-vs-all evaluation

而不是:

“IEMOCAP 4-class standard WF1 SOTA”。


4. 还有一个非常高的真实方法:SMIN,WF1 = 87.47%

论文也真实存在:

Zheng Lian, Bin Liu, Jianhua Tao.
“SMIN: Semi-Supervised Multi-Modal Interaction Network for Conversational Emotion Recognition.”
IEEE Transactions on Affective Computing, 14(3), 2415–2429.

DOI:

10.1109/TAFFC.2022.3141237

正式发表在 IEEE T-AFFC,DBLP 也能核实卷、期、页码和 DOI。(DBLP)

它不是普通监督学习,而是:

Semi-Supervised Multi-modal Interaction Network

核心有:

  • Intra-modal Interactive Module,IIM
  • Cross-modal Interactive Module,CIM
  • hierarchical recurrent contextual modeling
  • hybrid multimodal fusion
  • 额外 unlabeled data

这也是论文摘要明确说明的。(ResearchGate)

4-class 结果

ICASSP 2025 的正式论文 MERITS-L 在它的 SOTA comparison table 中明确列出:

MethodIEMOCAP 4-class WF1
LMFN82.54
M3ER82.40
SMIN87.47
MERITS-L86.48

而且该表明确注明:

All numbers are weighted F1-scores.

(arXiv)

所以 SMIN = 87.47% WF1 这个数并不是我猜出来的,后续 ICASSP 2025 论文确实这样引用。

但是存在一个关键条件:

SMIN 是半监督方法

它通过额外未标注数据进行 semi-supervised learning。

因此如果你自己的实验是:

“只允许 IEMOCAP train set,不允许额外 emotional data”

那么拿自己的结果和 SMIN 的 87.47% 直接比,不公平。

所以我会把 SMIN 定义为:

external-data / semi-supervised SOTA branch

而不是 standard supervised SOTA。


5. ICASSP 2025 的 MERITS-L:86.48% WF1

这篇也完全真实,而且很适合你的 related work。

Soumya Dutta, Sriram Ganapathy.
“LLM Supervised Pre-training for Multimodal Emotion Recognition in Conversations.”
ICASSP 2025.

DOI:

10.1109/ICASSP49660.2025.10889998

DBLP 明确记录它是 ICASSP 2025 正式会议论文。(DBLP)

它采用标准的四类:

  • Angry
  • Happy + Excited
  • Sad
  • Neutral

5531 utterances

划分是:

  • Session 2–4 → train
  • Session 1 → validation
  • Session 5 → test

所以它不是 5-fold LOSO,而是固定 Session-5 test split。(ResearchGate)

模型为 Audio + Text:

  • Speech representation
  • RoBERTa text representation
  • GPT-3.5 提供预训练阶段的伪情感监督
  • conversation-level contextual modeling
  • co-attention multimodal fusion

最终:

IEMOCAP 4-class WF1 = 86.48%

(arXiv)

有意思的是,该论文自己也没有声称 IEMOCAP 第一,因为它明确写道:

SMIN 的 87.47% 比 MERITS-L 的 86.48% 高约 1 个百分点。

(arXiv)

这反过来也进一步验证了 SMIN 的 87.47 不是随意转载的数字。


6. CFIA-Net 为什么只有 80.67%,其他论文却动不动 87%?

核心原因不是单纯“模型差了 7%”,而是 evaluation protocol 不一样

最典型的几种:

方法四类设置测试协议指标结果是否可直接比较
CFIA-NetHappy+Excited,55315-fold LOSessionmulticlass WA/UA80.67 / 81.01推荐基准
CFIA-Net同上10-fold LOSpeakerWA/UA83.37 / 83.67与5-fold不同
SMIN4-classsemi-supervised + external unlabeled dataWF187.47需注明额外数据
MERITS-LHappy+Excited,5531fixed Session-5 testWF186.48与5-fold不同
LPGNetHappy+Excited,5531speaker-independent settingone-vs-all avg binary ACC/F187.99 / 87.96指标不同
GS³-ICL4-class自身数据处理WA/UA78.92 / 79.88数据有额外 curation

所以 IEMOCAP-4 没有一个脱离协议就可以说的单一 SOTA 数字


7. 2026 年 6 月 15 日还有一篇最新的 GS³-ICL

为了确保“截至 2026 年 6 月”没有漏掉截止日期前刚发表的论文,我还核查了:

Yufan Zhou et al.
“GS³-ICL: Graph-Structured Sparse Selection with Invariance-Consistent Learning for multimodal SER.”

ICMR 2026

正式发表于:

2026-06-15

DOI:

10.1145/3805622.3810766

ACM 官方页面可核实。(DOI)

GS³-ICL ACM 官方页面

它是 Audio + Text + Visual 三模态,在 IEMOCAP 4-class 上:

  • WA = 78.92%
  • UA = 79.88%

(DOI)

它是真实的 2026 新方法,但性能没有超过上面的 CFIA-Net,而且论文还进行了少量 data curation,所以也不应该拿来宣布新的 IEMOCAP-4 SOTA。


8. 一个容易误认为 SOTA 的论文:Mul-TAB

论文真实存在:

Wu, Y., Zhang, S., Li, P.
“Improvement of Multimodal Emotion Recognition Based on Temporal-Aware Bi-Direction Multi-Scale Network and Multi-Head Attention Mechanisms.”
Applied Sciences, 2024, 14(8), 3276.

DOI:

10.3390/app14083276

(MDPI)

它报告:

  • UAR = 81.92%
  • WAR = 83.85%
  • 5-fold

表面看 83.85% 比 CFIA-Net 5-fold 的 80.67% 高。(MDPI)

但论文正文描述的是:

best WAR reaching 83.9%
“best UAR reaching 82.0%”

也就是强调 best testing accuracy,而不是清晰报告五个 session 的平均值。(MDPI)

因此,如果你需要一个严谨可复现的 “mean 5-fold LOSO SOTA”,我不会优先选择它作为标准答案。


9. 我的最终结论

如果你是为了论文、毕业设计、博士/硕士开题或者复现 benchmark,我建议你按照下面的口径写。

推荐结论

标准、speaker-independent、可公平横向比较的 IEMOCAP 4-class:

CFIA-Net — Hu et al., Interspeech 2024
Audio + Text
4 classes: Angry / Sad / Neutral / Happy+Excited
5-fold leave-one-session-out:
WA = 80.67%
UA = 81.01%
DOI: 10.21437/Interspeech.2024-1733 (ISCA Archive)

如果采用作者同时测试的 10-fold leave-one-speaker-out

WA = 83.37%, UA = 83.67%。(ISCA Archive)

若允许额外无标签数据

SMIN — IEEE T-AFFC
WF1 = 87.47%
但属于 semi-supervised / external-data 分支。(DBLP)

截至 2026-06 最高的“论文报告数字”

LPGNet — Springer, 2026-03-07
ACC = 87.99 ± 1.29%
F1 = 87.96 ± 1.63%
但指标为 one-vs-all average binary ACC/F1,不能直接等同标准四分类 WF1。(DOI)

因此,如果你接下来需要自己做 IEMOCAP 四分类实验,我建议目标至少设为:标准 5-fold LOSO 下 WA > 80.67%、UA > 81.01%;如果你的协议是固定 Session 5 test,则应该另外跟 MERITS-L/SMIN 比,而不要把这两套结果混在一起。

如果你需要,我下一步可以直接给你整理一张 “2019–2026 年 IEMOCAP 四分类多模态 SOTA 演进表”,把约 20 篇真实论文的 论文名、年份、Venue、DOI、A/T/V 模态、是否合并 Happy+Excited、5531 样本、数据划分、WA、UA、WF1、是否用外部数据、是否有代码 全部核对后放在一张表里。

Chia sẻ Q&A này