1、模块名称: SeRIn
研究思路:普通跨模态注意力让音频、视觉和文本很早就开始互相影响。这样虽然能快速完成融合,但也容易产生一个问题:还没有充分提炼好的单模态信息,已经被其他模态污染或覆盖。这在文本主导的数据集上尤其明显。文本信息较强时,音频和视觉一旦过早与文本混合,很容易失去自己的独立表达;最后模型虽然名义上使用了三种模态,实际仍然主要依赖文本。
SeRIn 的核心判断是:单模态提炼和跨模态融合不应该同时发生,而应该在结构上分阶段完成。
因此,论文提出了三个连续过程:Segregate、Refine、Integrate,即隔离、提炼、整合。
2、研究方法:先让音频和视觉在各自独立的通道中成长,再让一个专门的 AV 通道旁观并汇总二者,最后只在预测阶段允许所有信息自由交互。
右图把中间的 MMLM 放大成两个部分:
左边蓝框:LM Block;
右边红框:MM Block。
LM Block 主要负责语言上下文建模,MM Block 则负责把音频和视觉信息注入 Fusion Token。
LLMBlock
文本 Token 按照 GPT-2 原有的因果注意力方式进行处理,即每个文本 Token 只能读取自己和前面的文本。
但是,附加在后面的 Fusion Token 可以读取完整的文本序列。这样,Audio、Visual 和 AV Fusion Token 都会获得当前话语的语言语境。
GPT-2它是一个固定的语言语境加工器:文本 Token按照因果顺序理解前文,Fusion Tokens 则读取完整文本,从而获得语言背景;真正的音频和视觉注入主要由后面的可训练 MM Block 完成。
MMBlock
1)MM Block 底部有三个并行的 IGCA:
Audio Fusion Token 通过 IGCA 读取 Za
Visual Fusion Token 通过 IGCA 读取 Zv
AV Fusion Token 通过 IGCA 读取 Zav
2)IGCA 是 Internally Gated Cross-Attention,内部门控跨注意力。
例如,Audio Fusion Token 作为 Query,音频编码器输出 Za 作为 Key 和 Value。
这样,Audio Token 会主动从音频序列中寻找与当前语言语境相关的信息。
3)MM Block 的 IGCA 和 IGSA 只对三组 Fusion Tokens 进行跨模态注入与通道整理;文本 Token 不参加这些注意力操作。
MM Block 最后的可训练 FFN会处理包括文本在内的完整序列,但由于 FFN 是逐 Token 操作,文本仍不会直接接收 A/V 信息。
| 论文表述 | 对应模块 | 实际发生的操作 |
|---|---|---|
| 音频和视觉先分别提炼 | Audio/Visual Encoder | 分别生成Za,Zv |
| 建立独立通道 | Audio/Visual Fusion Tokens | Xfa,Xfv分组 |
| 保持通道独立 | LM Block 的 (M^{mc}_{LM}) | A、V Tokens 不能互相读取 |
| 注入各自模态信息 | MM Block 的 IGCA | Xav<---Zv |
| 在通道内部整理 | MM Block 的 IGSA | A、V 分别进行组内自注意力 |
| AV 通道旁观并汇总 | AV Fusion Tokens | (X_{fav}) 读取 A、V Tokens |
| AV 获取底层联合信息 | AV IGCA | Xav <-Zav |
| 不反向干扰 A/V | LM/MM Mask | A、V 不能读取 AV Tokens |
| 最后完全融合 | Integration Head | 七种表示进行无约束自注意力 |
| 输出情感结果 | Prediction Head | 根据[CLS]预测情感分数 |
数据集表现:
消融实验
这篇论文的消融做得比较有价值,因为作者不是简单地逐个删除模块,而是重点验证“交互结构是否真的重要”。
1)最关键的结果是:删除 LM 层中的模态约束 Mask 后,SIMS 的 Acc-2 从 84.30 降到 82.08,MOSEI 从 87.79 降到 85.98。
而且,这个版本仍然保留了大部分新增参数,却比 DeepMLF 还差。因此,作者据此说明:
性能提升不是因为增加了更多 IGCA 或参数,而是因为这些模块被组织在正确的交互拓扑中。
2)还有一个很有意思的现象:当 MM 层的约束 Mask 被删除后,IGSA 变成不受限制的自注意力,此时再删除 IGSA,性能反而有所恢复。
这说明 IGSA 本身不是天然有效的。只有在正确 Mask 约束下,它才是“单模态内部整理”;没有 Mask 时,它就会造成过早混合和模态干扰。
这也是论文最值得学习的实验观点:模块的价值不能脱离它所在的信息流结构来评价。
创新点
创新一:把交互拓扑作为独立设计变量
过去通常研究融合深度、注意力形式、Token 数量或损失函数。SeRIn 强调,模态之间“谁能读取谁”本身也是一个可以系统设计的变量。
这一立意比较完整,不只是简单换了一个注意力公式。
创新二:单模态通道与联合通道结构性分离
它不是通过解耦损失,让音频和视觉“尽量不同”,而是直接从计算图上阻止它们过早相互影响。
这种结构约束比辅助损失更直接,也更容易解释。
创新三:AV 只读通道
AV Token 能读取音频和视觉,但音频和视觉不能读取 AV Token。这种非对称关系使联合通道能够积累跨模态信息,又不反向污染单模态表示。
这是 SeRIn 最有辨识度的设计。
创新四:门控位于注意力内部
门控不是一个模态级标量,而是逐 Token、逐维度控制注意力结果。这使模型能够进行更细粒度的信息筛选。
交叉拓扑:这里的“拓扑”不是指网络有多少层、多少参数,而是指:模型中的不同表示,谁可以读取谁;信息能够往哪个方向流动;哪些通道之间禁止直接交互。
可以把 Text、Audio、Visual、AV 四组 Token 看成四个节点。SeRIn 为它们规定了固定的连接关系。换成自然语言就是:
Audio Token 可以读取文本和自己的 Audio Token;
Visual Token 可以读取文本和自己的 Visual Token;
AV Token 可以读取文本、Audio Token、Visual Token 和自身;
Audio 与 Visual 不能直接互读;
AV 可以读取 A/V,但不能反向把融合信息写回 A/V;
文本不能读取任何 Fusion Token。
这个“谁连谁、谁不连谁”的结构,就是interaction topology,交互拓扑。
其他
论文题目是 《Segregate, Refine, Integrate: Decomposing Multimodal Fusion for Sentiment Analysis》,简称 SeRIn。作者主要来自雅典国立技术大学、Athena Research Center、伯尔尼大学等机构,论文发表于 Interspeech 2026,同时公开在 arXiv,并提供了官方代码。