本发明属于人物情绪变化,特别涉及一种基于多模态的审讯对象情绪变化的识别方法。
背景技术:
1、公检部门以及相关司法部门在进行审讯过程中,往往面临审讯对象反馈的信息存在不实的现象,进而会导致审讯以及后续侦察分析工作效率受到严重影响。目前,相关技术中,对于上述问题主要依赖于审讯人员的经验以进行人为的判断,或采用类似于测谎仪等设备对于对象的心理状态进行评估。然而,上述方案中,由审讯人员进行判断过于依赖人为经验,而采用测谎仪进行判则需要与对象产生接触,进而可能对于结果造成一定的影响。针对相关技术中,在审讯过程中对于审讯对象的心理状态无法得到准确判断的问题,相关技术中目前没有有效的解决手段。除此之外,现在运用于情绪识别的方式大多基于音频、文本、视频等多种信息的单模态进行识别,由于情绪表达的复杂性,单一模态的情绪识别,往往会导致识别准确率较低等问题,不能够作为辅助保证审讯的准确判断。
技术实现思路
1、本发明的目的是克服现有技术的缺陷,提供了一种基于多模态的审讯对象情绪变化的识别方法,通过采集到的审讯对象的视频与音频,综合判断审讯对象情绪的变化状况,能够提高情绪识别效率和准确率。
2、本发明提供的技术方案为:
3、一种基于多模态的审讯对象情绪变化的识别方法,包括如下步骤:
4、步骤一、获取审讯对象审讯的原始音频和原始视频;
5、步骤二、将所述原始音频和所述原始视频分别分割为多个等时长的音频片段和视频片段,并将音频片段和与其时刻对齐的视频片段作为一个片段组,得到多个时刻对齐的片段组;
6、步骤三、对每个片段组中的音频片段和视频片段分别进行特征提取,得到各片段组的语音特征向量和视频特征向量;
7、其中,所述语音特征向量包含语音特征时间信息,所述视频特征向量包含人脸图像特征信息;
8、步骤四、采用基于注意力机制的多模态融合方法对同一个片段组的所述语音特征向量和视频特征向量进行融合,得到每个片段组的融合特征向量;
9、步骤五、对每个片段组的融合特征向量进行情绪识别,并对相邻两个片段组的情绪识别结果进行对比,得到审讯对象的情绪变化识别结果。
10、优选的是,在所述步骤三中,从所述片段组中的视频片段中截取出多帧图像,并对所述多帧图像进行特征提取,得到所述视频特征向量。
11、优选的是,在所述步骤三中,对音频片段进行特征提取之前,还包括:
12、通过预加重、分帧、加窗的方法降低音频中的噪声和冗余信息。
13、优选的是,采用resnet18网络进行音频特征提取。
14、优选的是,采用视频特征提取模型进行视频特征提取;
15、所述视频特征提取模型包括依次连接的2维lstm卷积层、2维卷积层、3个2维卷积块和全连接层;
16、其中,每个所述2维卷积块后连接一个池化层。
17、优选的是,在所述步骤四中,得到融合特征向量的方法为:
18、将所述语音特征向量和视频特征向量分别经过layernorm层,得到视频查询向量、音频键向量和音频值向量;
19、将、和输入多头交叉注意力模块,得到输出特征向量;
20、将与相加,并将相加结果正则化,得到正则化向量;
21、正则化向量经过前向传播层,得到前向传播向量;
22、将所述正则化向量与前向传播向量相加得到所述融合特征向量。
23、优选的是,在所述步骤二中,所述音频片段和所述视频片段的时长均为3s。
24、优选的是,在所述步骤三中,从所述片段组中的视频片段中截取出6帧图像,并对所述6帧图像进行特征提取。
25、优选的是,情绪识别结果为高兴、沮丧、惊奇、害怕、愤怒、厌恶或中性表情。
26、本发明的有益效果是:
27、本发明提供的基于多模态的审讯对象情绪变化的识别方法,通过采集到的审讯对象的视频与音频,综合判断审讯对象情绪的变化状况,能够提高情绪识别效率和准确率;快速识别出审讯的对象关键情绪变化,解决在审讯过程中对于审讯对象的心理状态无法得到准确判断的问题;进而达到在审讯过程中辅助审讯人员准确的获知审讯对象的心理状态。
28、本发明采用多模态情感特征进行情感识别,弥补了单个模态上情感特征不充分或者不准确的问题,多模态之间进行相互影响,有助于提取到更加全面有效的情感特征。
29、本发明采用基于transformer的交叉自注意力机制的方式进行多模态之间信息融合,使情感特征做到了真正意义上的融合,能够有效利用模态之间的相关作用和影响,有效提高情绪识别的准确率。
30、本发明提供的基于多模态的审讯对象情绪变化的识别方法,相对于常规的情绪识别方法,添加了针对中间帧的提取以及情绪变化检测,能够快速识别出来审讯过程中嫌疑人情绪心理的变化,更好辅助公检工作人员做出更加准确的审讯决策。
1.一种基于多模态的审讯对象情绪变化的识别方法,其特征在于,包括如下步骤:
2.根据权利要求1所述的基于多模态的审讯对象情绪变化的识别方法,其特征在于,在所述步骤三中,从所述片段组中的视频片段中截取出多帧图像,并对所述多帧图像进行特征提取,得到所述视频特征向量。
3.根据权利要求2所述的基于多模态的审讯对象情绪变化的识别方法,其特征在于,在所述步骤三中,对音频片段进行特征提取之前,还包括:
4.根据权利要求3所述的基于多模态的审讯对象情绪变化的识别方法,其特征在于,采用resnet18网络进行音频特征提取。
5.根据权利要求4所述的基于多模态的审讯对象情绪变化的识别方法,其特征在于,采用视频特征提取模型进行视频特征提取;
6.根据权利要求4或5所述的基于多模态的审讯对象情绪变化的识别方法,其特征在于,在所述步骤四中,得到融合特征向量的方法为:
7.根据权利要求6所述的基于多模态的审讯对象情绪变化的识别方法,其特征在于,在所述步骤二中,所述音频片段和所述视频片段的时长均为3s。
8.根据权利要求7所述的基于多模态的审讯对象情绪变化的识别方法,其特征在于,在所述步骤三中,从所述片段组中的视频片段中截取出6帧图像,并对所述6帧图像进行特征提取。
9.根据权利要求8所述的基于多模态的审讯对象情绪变化的识别方法,其特征在于,情绪识别结果为高兴、沮丧、惊奇、害怕、愤怒、厌恶或中性表情。
