尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

TEXT-2025

TEXT-2025 1、研究思路1直接融合未经语义校准的音频和视频表示容易让弱模态反过来干扰文本。2音频和视频都是时间序列但传统的拼接、Cross-Attention 或 Mamba 并不一定适合 MOSI、MOSEI 这种较短的视频片段。作者因此提出一个更轻量的音视频时间交互模块。因此TEXT 先利用多模态大模型生成语言解释再用这些解释校准音视频特征最后才进行时间交互和多模态决策。2、研究方法文本主干解释增强后的音频/视频→A/V 时间交互→文本路由专家融合→门控决策3、模型名称TEXT模块1多模态大模型生成解释TEXT 首先使用经过 EMER-fine 数据集微调的 VideoLLaMA 3为每个视频样本生成初步解释。提示词要求模型分别描述音频中的语气和情绪视频中的面部表情和行为原始评论或字幕表达的含义。之后再使用 Qwen 3 对初始解释进行检查和润色得到所谓的 fine explanation。例如原始音频只是连续声学信号解释可能变成“说话者的语气积极而热情。”视频则可能被解释为“说话者嘴角略微上扬可能表达认同或积极情绪。”这些解释随后通过 BERT 编码成为可以与音频、视频特征进行注意力交互的语言表示。借助多模态大模型把难以直接解释的连续信号转写成显式情感语义。模块2:解释对齐模块解释生成以后TEXT 并不直接把解释与原始特征拼接而是使用 Cross-Attention 进行对齐。 对于某一模态特征 F 和对应解释 E作者定义这里有一个非常关键的方向关系 解释表示 E 作为 Query 原始音频或视频特征 F 作为 Key 和 Value。因此这个模块实际在询问“解释中提到的情感含义能够在原始音频或视频的哪些位置找到证据”这比直接拼接更合理因为解释并没有替代原始 A/V 特征而是承担了一个语义筛选器的角色。论文如何处理不同序列长度文本、音频和视频原本长度不同但作者没有直接在 50、375、50050、375、50050、375、500 这种原始长度上进行交互。论文明确表示三种模态都被处理为50 个 token并额外加入一个可学习的聚合 token最终得到长度为 51 的表示Et​,Ea​,Ev​∈R51×d即先将各模态统一到相同长度再执行音视频时间交互。模块3:音视频对齐模块它不是 Cross-Attention也不是严格意义上的时间戳对齐而是一个对称的音视频跨模态门控卷积块。左支路以音频为主体视频经过 SiLU 后形成门控信号控制音频卷积特征的保留程度右支路则以视频为主体让音频控制视频特征。因此其信息处理原则是音频和视频不直接混成一个表示而是先分别保留自己的残差主干再利用另一个模态调节本模态的局部时间特征。这个设计比直接拼接更有结构也比完整的 Cross-Attention 更轻量。Conv1D 负责局部时间建模逐元素乘法负责跨模态调制残差连接保证原始模态信息不会完全丢失文本路由的稀疏专家模型一般的 Sparse MoE 会根据当前输入计算专家概率而 TEXT 强调SMoE(Et,Eav)其中文本负责 Router音视频联合表示进入被选中的专家。 作者的解释是不同专家可能逐渐擅长不同的情感主题。例如文本中出现抱怨、赞同、讽刺或失望等关键词时Router 会选择相应专家处理音视频上下文。文本路由 SMoE 决定的则是应该用哪一组参数处理当前样本的音视频信息。最终门控融合与预测TEXT 最后使用 Gate Fusion 将文本表示和经过专家处理的音视频表示结合再通过 MLP 输出情感分数。最终决策只使用每个序列中额外加入的可学习聚合 token而不是将全部 50 个时间 token 展平。这相当于先在各模块内部完成序列信息汇总再进行样本级预测。Gate Fusion 本身不是这篇论文最有创新性的部分它更像是一个稳定的最终融合器。消融实验中去掉 Gate Fusion 后MOSEI 的 MAE 从 0.528 上升到 0.571说明它确实有贡献但该结构单独拿出来不足以构成主要创新。效果TEXT 在 MOSI、MOSEI、CH-SIMS 和 CH-SIMSv2 四个数据集上与 ALMT、KuDA、DEVA以及 GPT-4o、Qwen2.5-VL、VideoLLaMA3 进行了比较。1)在 MOSI 上TEXT 的主要结果是MAE0.666,Corr0.829其不含零样本的 Acc-2 达到 88.72%F1 达到 88.76%。不过Acc-7 为 45.92%低于 KuDA 的 47.08%。2)在 MOSEI 上TEXT 的结果为 MAE0.528,Corr0.786整体表现较强但 Acc-7 也不是最佳。3)CH-SIMS 上的 MAE 达到 0.353相比 KuDA 的 0.408 下降约 13.5%这是论文最突出的结果之一。消融实验从 MAE 看影响最大的是把时间对齐模块替换为简单拼接误差增加了 0.052。Explanation Alignment 换成 Linear 后也明显下降说明性能并不只是来自额外解释文本解释与原始模态之间的注意力对齐同样重要。同时作者提出的轻量时间模块优于 Mamba 和 TCA。这至少在该模型与该实验协议下支持了一个观点对短视频 MSA 而言局部卷积、双向门控和残差保留可能比完整状态空间模型或复杂跨注意力更合适。其他论文题目A Text-Routed Sparse Mixture-of-Experts Model with Explanation and Temporal Alignment for Multi-Modal Sentiment Analysis模型名称TEXT即Text-routed sparse mixture-of-Experts with eXplanation and Temporal alignment。作者与团队Rao Dongning、Zeng Yunbiao、Jiang Zhihua、Lv Jujian 等来自广东工业大学、广东技术师范大学和暨南大学。发表信息arXiv 版本发布于 2025 年 12 月论文首页标注为AAAI 2026。代码仓库也在论文中公开。感悟1、这篇论文不是随意堆叠模块而是形成了较清楚的链条即便每个组件都不是从零发明整体叙事是成立的。A/V 难理解 → 用解释增加语义A/V 时间关系不清 → 用双向时间交互不同样本需要不同融合方式 → 用文本路由专家最终模态贡献不同 → 使用门控融合。2、时间对齐模块轻量、容易复现相较于复杂的 OT、动态时间规整或大规模 Cross-Attention这个模块只包含 Linear、Conv1D、SiLU、逐元素乘法和残差连接。它比较适合做普通期刊中的工程型结构改造代码量不大消融容易信息流也容易解释。这是一篇典型的性能驱动、工程驱动型 MSA 论文叙事完整、模块可复现最有价值的是“等长后音视频双向门控”的时间交互设计。解释生成和 SMoE 更像性能加码项不宜全部照搬。
返回列表