本发明涉及数据处理,尤其涉及一种3d数字人动画展示的方法及装置。
背景技术:
1、在当前的三维(three dimens i ons,3d)数字人系统中,第一步要先进行虚拟人的创建,根据数字人个体的特性,服装,发型等,使用3d建模软件,如b l ender,maya或3dsmax,根据设定的设计概念创建3d模型;建模完成后,还需要进行材质贴图,动力学与布料模拟,人物动画绑定等操作,为模型增加真实感,赋予行为动作;然后渲染过程将所有的元素(模型、贴图、光照等)综合在一起,制作出最终的图像或动画;最终通过3d引擎,比如unity,unrea l engi ne等,不断将生成的数字人动画以视频流的方式对外输出;终端接收到视频流后,在屏幕上进行展示播放。
2、同时3d数字人系统会集成自动语音识别(automat i c speech recogn it i on,asr),来完成用户对话的语音识别,使用自然语言理解(natura llanguage understand ing,nlu),来对识别到的用户交互内容进行语义理解,然后将理解结果送到从文本到语音(text to speech,tts),进行文本转换成语音,再将音素信息和动画信息一起送入3d引擎进行音视频动画合成,最终返回终端进行动画呈现。
3、这套方案中,在3d数字人的建模和美化制作上,会投入大量工作;且3d数字人的动画渲染生成,需要强大的图形处理器(graph i cs process i ng un it,gpu)显卡才能完成,对虚拟人引擎服务器的硬件要求较高,通常一路并发的虚拟人引擎服务需要3080以上的显卡来支撑;引擎在渲染过程和视频流传输到终端的过程,都会有一定的耗时,最终响应用户的虚拟人动画会有不同程度的延时,给用户非实时的感觉。
技术实现思路
1、本发明的目的是提供一种3d数字人动画展示的方法及装置,以解决现有技术中所存在的问题。
2、第一方面,本发明提供了一种3d数字人动画展示的方法,所述方法包括:
3、获取数字人视频信息;
4、对所述视频信息进行处理,得到多个动作子视频;所述多个动作子视频包括嘴型开合动作子视频;
5、根据补帧算法,生成相邻的动作子视频的衔接视频;并存储所述衔接视频;
6、接收用户的第一语音信息;
7、确定所述第一语音信息的响应信息;所述响应信息为第二语音信息;
8、获取当前动作子视频;
9、确定所述当前动作子视频到所述嘴型开合动作子视频的第一衔接视频;以及,所述嘴型开合动作子视频到所述当前动作子视频的第二衔接视频;
10、控制所述第一衔接视频、第二语音信息、嘴型开合动作子视频、第二衔接视频、当前动作子视频的播放顺序。
11、在一种可能的实现方式中,所述当前动作子视频为静息动作子视频时,所述控制所述第一衔接视频、第二语音信息、嘴型开合动作子视频、第二衔接视频、当前动作子视频的播放顺序具体包括:
12、控制所述静息动作子视频停止播放;
13、在播放第一衔接视频后,同时播放第二语音信息和嘴型开合动作子视频;
14、当所述第二语音信息播放完成后,停止播放嘴型开合动作子视频,播放第二衔接视频;
15、在所述第二衔接视频播放完成后,循环播放所述静息动作子视频。
16、在一种可能的实现方式中,所述方法还包括:
17、检测所述第二语音信息中是否包括特定关键字;
18、当包括特定关键字时,确定特定关键字对应的特定动作子视频;
19、确定所述特定动作子视频分别和所述嘴型开合动作子视频、所述当前动作子视频之间的特定衔接视频;
20、控制所述第一衔接视频、第二语音信息、嘴型开合动作子视频、特定衔接视频、第二衔接视频、当前动作子视频的播放顺序。
21、在一种可能的实现方式中,所述确定特定关键字对应的特定动作子视频具体包括:
22、确定特定关键字对应的打招呼动作子视频、介绍动作子视频和再见动作子视频。
23、在一种可能的实现方式中,所述确定所述第一语音信息的响应信息具体包括:
24、通过asr算法,将所述第一语音信息转化为第一文本信息;
25、根据所述第一文本信息和预设的大模型,确定第二文本信息;
26、通过tts算法,将第二文本信息转化为第二语音信息。
27、在一种可能的实现方式中,所述根据所述第一文本信息和预设的大模型,确定第二文本信息具体包括:
28、对知识文档进行处理,得到第一向量数据;其中,多个所述第一向量数据构成向量数据库;
29、对所述第一文本信息进行向量化处理,得到第二向量数据;
30、根据所述第二向量数据,在所述向量数据库中进行检索,得到回答数据集;
31、将所述第一文本信息和所述回答数据集通过预设的大模型进行处理,生成待理解文本;
32、根据所述待理解文本和所述预设的大模型,生成第二文本信息。
33、第二方面,本发明提供了一种3d数字人动画展示的装置,所述装置包括:
34、第一获取单元,所述第一获取单元用于获取数字人视频信息;
35、第一处理单元,所述第一处理单元用于对所述视频信息进行处理,得到多个动作子视频;所述多个动作子视频包括嘴型开合动作子视频;
36、生成单元,所述生成单元用于根据补帧算法,生成相邻的动作子视频的衔接视频;并存储所述衔接视频;
37、接收单元,所述接收单元用于接收用户的第一语音信息;
38、第一确定单元,所述第一确定单元用于确定所述第一语音信息的响应信息;所述响应信息为第二语音信息;
39、第二获取单元,所述第二获取单元用于获取当前动作子视频;
40、第二确定单元,所述第二确定单元用于确定所述当前动作子视频到所述嘴型开合动作子视频的第一衔接视频;以及,所述嘴型开合动作子视频到所述当前动作子视频的第二衔接视频;
41、控制单元,所述控制单元用于控制所述第一衔接视频、第二语音信息、嘴型开合动作子视频、第二衔接视频、当前动作子视频的播放顺序。
42、第三方面,本发明提供了一种芯片系统,包括处理器,所述处理器与存储器的耦合,所述存储器存储有程序指令,当所述存储器存储的程序指令被所述处理器执行时实现第一方面任一项的所述3d数字人动画展示的方法。
43、第四方面,本发明提供了一种计算机可读存储介质,所述计算机可读存储介质上存储有计算机程序,计算机程序被处理器执行第一方面任一项所述的3d数字人动画展示的方法。
44、第五方面,本发明提供了一种计算机服务器,包括:存储器、处理器和收发器;
45、所述处理器用于与所述存储器耦合,读取并执行所述存储器中的指令,以实现第一方面任一项的所述3d数字人动画展示的方法;
46、所述收发器与所述处理器耦合,由所述处理器控制所述收发器进行消息收发。
47、通过应用本发明实施例提供的3d数字人动画展示的方法,通过引入视频裁剪技术,将数字人动画视频展示,变为多个动作子视频,并确定动作子视频之间的衔接视频,从而在后续播放时,在动作子视频之间拼接播放衔接视频,由于是动作子视频和衔接视频的拼接播放,因此不需要unity等3d渲染引擎,减少了对服务端硬件的需求,在有限的硬件下,就可以完成3d数字人的展示。进一步的,动作子视频和衔接视频可以存储在终端本地,无网络传输耗时开销,无3d渲染耗时开销,从而进一步提升了响应实时性。
1.一种3d数字人动画展示的方法,其特征在于,所述方法包括:
2.根据权利要求1所述的方法,其特征在于,所述当前动作子视频为静息动作子视频时,所述控制所述第一衔接视频、第二语音信息、嘴型开合动作子视频、第二衔接视频、当前动作子视频的播放顺序具体包括:
3.根据权利要求1所述的方法,其特征在于,所述方法还包括:
4.根据权利要求3所述的方法,其特征在于,所述确定特定关键字对应的特定动作子视频具体包括:
5.根据权利要求1所述的方法,其特征在于,所述确定所述第一语音信息的响应信息具体包括:
6.根据权利要求5所述的方法,其特征在于,所述根据所述第一文本信息和预设的大模型,确定第二文本信息具体包括:
7.一种3d数字人动画展示的装置,其特征在于,所述装置包括:
8.一种芯片系统,其特征在于,包括处理器,所述处理器与存储器的耦合,所述存储器存储有程序指令,当所述存储器存储的程序指令被所述处理器执行时实现权利要求1-6任一项的所述3d数字人动画展示的方法。
9.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有计算机程序,计算机程序被处理器执行权利要求1-6任一项所述的3d数字人动画展示的方法。
10.一种计算机服务器,包括:存储器、处理器和收发器;
