尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

众包情感多模态演员数据集

众包情感多模态演员数据集 摘要面向语音情感识别、多模态情绪分析与情感计算研究的大规模演员情绪数据集。数据集概述CREMA-DCrowd-sourced Emotional Multimodal Actors Dataset众包情感多模态演员数据集是一个面向语音情感识别、多模态情绪分析与情感计算研究的大规模演员情绪数据集。数据集共包含 7,442 个原始音频片段由 91 位演员录制其中包括48位男性和43位女性年龄范围约为 20–74岁。参与者具有较为多样的人口背景使数据在说话人数量、性别和年龄方面具有较好的覆盖度。与只包含少量说话人的情感语音数据集相比CREMA-D更适合用于评估模型的跨说话人泛化能力并降低因模型记忆特定说话人特征而产生过拟合的风险。数据结构与关键特征CREMA-D中的演员朗读 12个固定句子并以不同情绪和不同情绪强度进行表达。数据覆盖 愤怒、厌恶、恐惧、快乐、中性和悲伤6种情绪类别同时设置低、中、高以及未指定4种情绪强度。由于同一文本可由不同演员、不同情绪和不同强度进行演绎因此能够有效控制语言内容差异并突出音高、能量、语速、节奏和音色等情感相关声学变化。音频可进一步提取MFCC、Mel频谱、基频、频谱质心、过零率、能量以及韵律等特征CREMA-D本身也具有多模态属性可用于结合语音与面部视觉信息开展联合情绪识别。应用价值与研究方向该数据集适用于六类情绪分类、情绪强度识别、跨说话人情感识别和音视频多模态融合等研究。研究人员可以采用CNN、CRNN、LSTM、Transformer、Wav2Vec 2.0、HuBERT等模型分析语音情绪也可结合视觉模型和多模态Transformer研究声音与面部表情之间的互补关系。进一步可开展年龄与性别差异对情绪表达的影响、跨数据集迁移学习、情绪强度估计、说话人无关建模以及面向智能客服、虚拟助手、人机交互和情感计算系统的实时情绪识别研究。数据集来源由张家梁(Bob)整理并于2026年在7zcode平台公开发布。数据集信息免责声明与引用数据仅用于科研与教学用途。若用于商业场景请自行核验数据许可。如需引用请在论文或报告中注明数据集名称与版本号。作者信息作者Bob (张家梁)项目编号Datasets-474文件大小450M原创声明本数据集为整理作品
返回列表