尧图网站建设 尧图网络
  • 首页
  • 关于我们
  • 服务项目
  • 案例展示
  • 建站流程
  • 资讯中心
  • 联系我们
首页/资讯中心/详情

SeRIn

SeRIn
📅 发布时间:2026/7/29 20:51:52

1、模块名称: SeRIn

研究思路:普通跨模态注意力让音频、视觉和文本很早就开始互相影响。这样虽然能快速完成融合,但也容易产生一个问题:还没有充分提炼好的单模态信息,已经被其他模态污染或覆盖。这在文本主导的数据集上尤其明显。文本信息较强时,音频和视觉一旦过早与文本混合,很容易失去自己的独立表达;最后模型虽然名义上使用了三种模态,实际仍然主要依赖文本。
SeRIn 的核心判断是:单模态提炼和跨模态融合不应该同时发生,而应该在结构上分阶段完成。
因此,论文提出了三个连续过程:Segregate、Refine、Integrate,即隔离、提炼、整合。

2、研究方法:先让音频和视觉在各自独立的通道中成长,再让一个专门的 AV 通道旁观并汇总二者,最后只在预测阶段允许所有信息自由交互。

右图把中间的 MMLM 放大成两个部分:
左边蓝框:LM Block;
右边红框:MM Block。
LM Block 主要负责语言上下文建模,MM Block 则负责把音频和视觉信息注入 Fusion Token。

LLMBlock

文本 Token 按照 GPT-2 原有的因果注意力方式进行处理,即每个文本 Token 只能读取自己和前面的文本。
但是,附加在后面的 Fusion Token 可以读取完整的文本序列。这样,Audio、Visual 和 AV Fusion Token 都会获得当前话语的语言语境。

GPT-2它是一个固定的语言语境加工器:文本 Token按照因果顺序理解前文,Fusion Tokens 则读取完整文本,从而获得语言背景;真正的音频和视觉注入主要由后面的可训练 MM Block 完成。

MMBlock

1)MM Block 底部有三个并行的 IGCA:

Audio Fusion Token 通过 IGCA 读取 Za
Visual Fusion Token 通过 IGCA 读取 Zv
AV Fusion Token 通过 IGCA 读取 Zav

2)IGCA 是 Internally Gated Cross-Attention,内部门控跨注意力。
例如,Audio Fusion Token 作为 Query,音频编码器输出 Za 作为 Key 和 Value。
这样,Audio Token 会主动从音频序列中寻找与当前语言语境相关的信息。

3)MM Block 的 IGCA 和 IGSA 只对三组 Fusion Tokens 进行跨模态注入与通道整理;文本 Token 不参加这些注意力操作。
MM Block 最后的可训练 FFN会处理包括文本在内的完整序列,但由于 FFN 是逐 Token 操作,文本仍不会直接接收 A/V 信息。

论文表述对应模块实际发生的操作
音频和视觉先分别提炼Audio/Visual Encoder分别生成Za,Zv
建立独立通道Audio/Visual Fusion TokensXfa,Xfv分组
保持通道独立LM Block 的 (M^{mc}_{LM})A、V Tokens 不能互相读取
注入各自模态信息MM Block 的 IGCAXav<---Zv
在通道内部整理MM Block 的 IGSAA、V 分别进行组内自注意力
AV 通道旁观并汇总AV Fusion Tokens(X_{fav}) 读取 A、V Tokens
AV 获取底层联合信息AV IGCAXav <-Zav
不反向干扰 A/VLM/MM MaskA、V 不能读取 AV Tokens
最后完全融合Integration Head七种表示进行无约束自注意力
输出情感结果Prediction Head根据[CLS]预测情感分数
数据集表现:

消融实验

这篇论文的消融做得比较有价值,因为作者不是简单地逐个删除模块,而是重点验证“交互结构是否真的重要”。
1)最关键的结果是:删除 LM 层中的模态约束 Mask 后,SIMS 的 Acc-2 从 84.30 降到 82.08,MOSEI 从 87.79 降到 85.98。
而且,这个版本仍然保留了大部分新增参数,却比 DeepMLF 还差。因此,作者据此说明:
性能提升不是因为增加了更多 IGCA 或参数,而是因为这些模块被组织在正确的交互拓扑中。
2)还有一个很有意思的现象:当 MM 层的约束 Mask 被删除后,IGSA 变成不受限制的自注意力,此时再删除 IGSA,性能反而有所恢复。
这说明 IGSA 本身不是天然有效的。只有在正确 Mask 约束下,它才是“单模态内部整理”;没有 Mask 时,它就会造成过早混合和模态干扰。
这也是论文最值得学习的实验观点:模块的价值不能脱离它所在的信息流结构来评价。

创新点

创新一:把交互拓扑作为独立设计变量

过去通常研究融合深度、注意力形式、Token 数量或损失函数。SeRIn 强调,模态之间“谁能读取谁”本身也是一个可以系统设计的变量。

这一立意比较完整,不只是简单换了一个注意力公式。

创新二:单模态通道与联合通道结构性分离

它不是通过解耦损失,让音频和视觉“尽量不同”,而是直接从计算图上阻止它们过早相互影响。

这种结构约束比辅助损失更直接,也更容易解释。

创新三:AV 只读通道

AV Token 能读取音频和视觉,但音频和视觉不能读取 AV Token。这种非对称关系使联合通道能够积累跨模态信息,又不反向污染单模态表示。

这是 SeRIn 最有辨识度的设计。

创新四:门控位于注意力内部

门控不是一个模态级标量,而是逐 Token、逐维度控制注意力结果。这使模型能够进行更细粒度的信息筛选。

交叉拓扑:这里的“拓扑”不是指网络有多少层、多少参数,而是指:模型中的不同表示,谁可以读取谁;信息能够往哪个方向流动;哪些通道之间禁止直接交互。

可以把 Text、Audio、Visual、AV 四组 Token 看成四个节点。SeRIn 为它们规定了固定的连接关系。换成自然语言就是:

  • Audio Token 可以读取文本和自己的 Audio Token;

  • Visual Token 可以读取文本和自己的 Visual Token;

  • AV Token 可以读取文本、Audio Token、Visual Token 和自身;

  • Audio 与 Visual 不能直接互读;

  • AV 可以读取 A/V,但不能反向把融合信息写回 A/V;

  • 文本不能读取任何 Fusion Token。

这个“谁连谁、谁不连谁”的结构,就是interaction topology,交互拓扑。

其他

论文题目是 《Segregate, Refine, Integrate: Decomposing Multimodal Fusion for Sentiment Analysis》,简称 SeRIn。作者主要来自雅典国立技术大学、Athena Research Center、伯尔尼大学等机构,论文发表于 Interspeech 2026,同时公开在 arXiv,并提供了官方代码。

相关新闻

  • Tinke:NDS游戏资源编辑器的终极指南
  • 深入AMD Ryzen硬件底层:SMUDebugTool专业调试工具完全指南
  • 构建企业级日期时间选择解决方案:高性能云原生JavaScript架构完整指南

最新新闻

  • CPPS培训一般学什么? - 众智商学院职业教育
  • 2026上海日本留学机构排名 优选服务全解析 - 谁都没有我好看
  • 从CLB到GTP收发器:XC7A75T-2CSG324I的内部资源架构与应用优化指南
  • Obsidian + Claude Code 搭自动化发布客户端:Playwright × 掘金/知乎/CSDN 的全链路踩坑实录
  • 5个必学ShaderGraph节点:unity-shadergraph-sandbox项目常用节点实战案例
  • Chocola均衡器终极教程:3步调出专业级音质体验

日新闻

  • 金融舆情监测系统:多语言情感分析与实时可视化技术解析
  • QT C++调用Python异常处理:PyBind11实战与跨语言编程指南
  • A-47双麦回音消除模块:主次麦空间分布与差分连接对ENC性能的影响

周新闻

  • 大连理工大学与东京大学联手打造的“主动型AI助手“
  • 170.2026年国家级科研瓶颈:超精密单点金刚石切削(SPDT)光学表面生成
  • SongBloom:革命性歌曲生成框架深度解析——如何通过交织自回归与扩散模型创作完整音乐

月新闻

  • 2026年6月公司网站搭建最新热门渠道测评:四大低成本/零代码平台对比+避坑
  • 【Linux】Linux arm 编译QT程序,出现expected “}“报错
  • 【MATLAB例程】四基站二维AOA定位与距离辅助增强对比仿真。基于角度观测和测距修正的固定目标平面定位精度分析

关于尧图

  • 公司简介
  • 团队介绍
  • 企业文化
  • 荣誉资质

服务项目

  • 定制开发
  • 电商建站
  • UI 设计
  • 运维服务

快速链接

  • 案例展示
  • 建站流程
  • 常见问题
  • 资讯中心

联系方式

  • 📍北京市朝阳区互联网产业园 A 座 10 层
  • 📞400-888-8888
  • ✉️contact@rkmt.cn
  • 🕐周一至周日 9:00-21:00

© 2024 北京尧图网络科技有限公司 版权所有 | 京 ICP 备 XXXXXXXX 号