本发明涉及图像处理,尤其涉及一种基于视线的注视点实时追踪方法、装置、电子设备及计算机可读存储介质。
背景技术:
1、随着眼动追踪广泛的应用,在非接触式场景中通常使用图像分析技术进行注视点估计,比如基于红外图像的角膜反射法和基于rgb图像的眼表特征学习方法。其中,角膜反射法,虽然眼动跟踪精度较高,但是由于需要额外的红外摄像头模组,硬件成本较高,而且受限于太阳光线的干扰,使得该方法的适用范围有限。而基于rgb图像的眼表特征学习方法,虽然可以应用在大部分自带相机的电子设备上,无需额外的设备,就能让用户进行眼动的人机交互,但是,该方法是基于全脸区域的图像特征提取并回归视线值,输入图像尺寸较大,增加了计算量,降低了眼动跟踪的准确度。
2、因此,如何在降低成本的前提下,提高眼动跟踪的准确性,是目前有待解决的技术问题。
技术实现思路
1、本发明提供一种基于视线的注视点实时追踪方法、装置、电子设备及计算机可读存储介质,以至少解决相关技术中眼动追踪需要额外设备,且成本较高,追踪的准确度较低的技术问题。本发明的技术方案如下:眼动追踪需要提取全脸区域的图像特征并进行回归视线值,增加了计算量,降低了眼动追踪的准确度。
2、根据本发明实施例的第一方面,提供一种基于视线的注视点实时追踪方法,包括:
3、获取目标跟踪的眼部区域图像;
4、对所述眼部区域图像进行预测,得到人眼视线值和多种眼部参数值;
5、基于系统的校准系数对所述人眼视线值和所述多种眼部参数值进行屏幕坐标点映射,得到当前图像帧的人眼在屏幕上的注视坐标点,实现实时性的眼动跟踪。
6、可选的,所述对跟踪检测到的所述眼部区域图像进行预测,得到人眼视线值和多种眼部参数值,包括:
7、利用训练好的多任务深度学习回归模型对所述眼部区域图像进行预测,得到人眼视线值和多种眼部参数值。其中,所述多任务深度学习回归模型,是基于轻量化的卷积神经网络的模型。
8、可选的,在获取所述目标跟踪的眼部区域图像之前,所述方法还包括:预先训练多任务深度学习回归模型,具体包括:
9、获取人脸图像视频数据集中每张人脸视频图像的眼部区域图像;
10、基于轻量化卷积神经网络对所有眼部区域图像的特征进行提取,得到眼部图像特征值;
11、对所述眼部图像特征值分别进行不同的回归处理,得到人眼视线值和多种眼部参数值;
12、基于所述人眼视线值和多种眼部参数值,与对应的人眼视线值的标签及多种眼部参数值的标签的差距,计算损失值;
13、基于所述损失值,通过反向传播机制更新所述轻量化卷积神经网络的参数,经过多次迭代,直至所述轻量化卷积神经网络收敛,得到训练好的轻量化卷积神经网络模型,并将训练好的所述轻量化卷积神经网络模型作为训练好的多任务深度学习回归模型。
14、可选的,所述获取目标跟踪的眼部区域图像,包括:
15、获取人脸图像数据流;
16、对所述人脸图像数据流中的眼部区域进行目标跟踪检测,得到目标跟踪的眼部区域图像。
17、可选的,所述对所述人脸图像数据流中的眼部区域目标跟踪检测,得到目标跟踪的眼部区域图像包括:
18、对所述人脸图像数据流中的眼部区域按照检测框进行检测;
19、对检测到眼部区域的所述检测框的图像进行目标跟踪,得到眼部兴趣区域roi检测框图像,并将所述眼部roi检测框图像作为目标跟踪的眼部区域图像。
20、可选的,所述基于系统的校准系数对所述人眼视线值和所述多种眼部参数值进行屏幕坐标点映射,得到当前图像帧的人眼在屏幕上的注视坐标点,包括:
21、基于系统的校准系数对所述人眼视线值和所述多种眼部参数值通过线性映射模型进行屏幕坐标点映射,得到当前图像帧的人眼在屏幕上的注视坐标点。
22、可选的,在所述通过线性映射模型进行屏幕坐标点映射之前,所述方法还包括:
23、利用屏幕上预设的n个校准目标点,对所述线性映射模型的系数进行校准,其中,n为大于或等于3为自然数。
24、可选的,所述利用屏幕上预设的n个校准目标点,对所述线性映射模型的系数进行校准,包括:
25、在预设的每个校准目标点持续时间t内,对所述n个校准目标点进行数据采样;
26、基于采样的数据判断用户在设定时间t内的n次等距抽样的预测结果中,计算视线误差以及瞳孔中心点变化范围;
27、在所述视线误差以及瞳孔中心点变化范围均在对应的预设阈值内时,确定所述校准目标点的数据采样有效;
28、获取有效的采样数据的图像,以及多任务深度学习回归模型预测的样本视线值和样本多种眼部参数值为所述校准目标点的数据;
29、将所述校准目标点的数据输入到所述线性映射模型进行校准,得到校准系数。
30、可选的,采用下述公式对输入到所述线性映射模型进行校准:
31、
32、
33、其中,所述ii表示第i个校准点的眼部图像,所述i表示眼部图像image,公式中未体现,所述i表示眼部图像的id;所述为多任务深度学习回归模型预测的视线值,其中,所述视线值是基于摄像头坐标系下的眼睛视线方向的单位向量值,是垂直方向夹角,是水平方向夹角;所述di为对应的瞳距值;所述是头部的水平旋转角;所述是预设的屏幕目标点的坐标值,所述表示用瞳距乘以系数指代眼睛与屏幕的垂直距离值,αx,βx,dx,αy,βy,和dy分别表示横坐标和纵坐标的校准系数。
34、根据本发明实施例的第二方面,提供一种基于视线的注视点实时追踪装置,包括:
35、获取模块,用于获取目标跟踪的眼部区域图像;
36、预测模块,用于对所述眼部区域图像进行预测,得到人眼视线值和多种眼部参数值;
37、坐标映射模块,用于基于系统校准系数对所述人眼视线值和所述多种眼部参数值进行屏幕坐标点映射,得到当前图像帧的人眼在屏幕上的注视坐标点,实现实时性的眼动跟踪。
38、可选的,所述预测模块,具体用于利用训练好的多任务深度学习回归模型对所述眼部区域图像进行预测,得到人眼视线值和多种眼部参数值。其中,所述多任务深度学习回归模型,是基于轻量化的卷积神经网络的模型。
39、可选的,所述装置还包括:训练模块,用于在所述获取模块获取目标跟踪的眼部区域图像之前,预先训练多任务深度学习回归模型。
40、可选的,所述训练模块,包括:
41、图像获取模块,用于获取人脸图像视频数据集中每张人脸视频图像的眼部区域图像;
42、特征提取模块,用于基于轻量化卷积神经网络对所有眼部区域图像的特征进行提取,得到眼部图像特征值;
43、回归处理模块,用于对所述眼部图像特征值分别进行不同的回归处理,得到人眼视线值和多种眼部参数值;
44、计算模块,用于基于所述人眼视线值和多种眼部参数值与对应的人眼视线值的标签及多种眼部参数值的标签的差距,计算损失值;
45、迭代训练模块,用于基于所述损失值,通过反向传播机制更新所述轻量化卷积神经网络的参数,经过多次迭代,直至所述轻量化卷积神经网络收敛,得到训练好的轻量化卷积神经网络模型,并将训练好的所述轻量化卷积神经网络模型作为训练好的多任务深度学习回归模型。
46、可选的,所述获取目标跟踪的眼部区域图像,包括:
47、数据流获取模块,用于获取人脸图像数据流;
48、跟踪检测模块,用于对所述人脸图像数据流中的眼部区域进行目标跟踪检测,得到目标跟踪的眼部区域图像。
49、可选的,所述跟踪检测模块包括:
50、检测模块,用于对所述人脸图像数据流中的眼部区域按照检测框进行检测;
51、跟踪模块,用于对检测到眼部区域的所述检测框内的图像进行目标跟踪,得到眼部兴趣区域roi检测框图像,并将所述眼部roi检测框图像作为目标跟踪的眼部区域图像。
52、可选的,所述坐标映射模块,具体用于基于系统的校准系数对所述人眼视线值和所述多种眼部参数值通过线性映射模型进行屏幕坐标点映射,得到当前图像帧的人眼在屏幕上的注视坐标点。
53、可选的,所述装置还包括:
54、校准模块,用于在所述坐标映射模块通过线性映射模型进行屏幕坐标点映射之前,利用屏幕上预设的n个校准目标点,对所述线性映射模型的系数进行校准,所述n为大于或等于3为自然数。
55、所述校准模块包括:
56、数据采样,用于在预设的每个校准目标点持续时间t内,对所述n个校准目标点进行数据采样;
57、计算模块,用于基于采样的数据判断用户在设定时间t内的n次等距抽样的预测结果中,计算视线误差以及瞳孔中心点变化范围;
58、数据有效确定模块,用于在所述视线误差以及瞳孔中心点变化范围判断均在对应的预设阈值内时,确定所述校准目标点的数据采样有效;
59、数据获取模块,用于获取有效的采样数据的图像,以及多任务深度学习回归模型预测的样本视线值和样本多种眼部参数值为所述校准目标点的数据;
60、系数校准模块,用于将所述校准目标点的数据输入到所述线性映射模型进行校准,得到校准系数。
61、可选的,所述系数校准模块采用下述公式对输入到所述线性映射模型进行校准:
62、
63、
64、其中,所述ii表示第i个校准点的眼部图像,所述i表示眼部图像image,公式中未体现,所述i表示眼部图像的id;所述为多任务深度学习回归模型预测的视线值,其中,所述视线值是基于摄像头坐标系下的眼睛视线方向的单位向量值,是垂直方向夹角,是水平方向夹角;所述di为对应的瞳距值;所述是头部的水平旋转角;所述是预设的屏幕目标点的坐标值,所述表示用瞳距乘以系数指代眼睛与屏幕的垂直距离值,αx,βx,dx,αy,βy,和dy分别表示横坐标和纵坐标的校准系数。
65、根据本发明实施例的第三方面,提供一种电子设备,包括:
66、处理器;
67、用于存储所述处理器可执行指令的存储器;
68、其中,所述处理器被配置为执行所述指令,以实现如上所述的基于视线的注视点实时追踪方法。
69、根据本发明实施例的第四方面,提供一种计算机可读存储介质,当所述计算机可读存储介质中的指令由电子设备的处理器执行时,使得电子设备能够执行如上所述的基于视线的注视点实时追踪方法。
70、根据本发明实施例的第五方面,提供一种计算机程序产品,包括计算机程序或指令,所述计算机程序或指令被电子设备的处理器执行时实现如上所述的基于视线的注视点实时追踪方法。
71、本发明的实施例提供的技术方案至少带来以下有益效果:
72、本发明实施例中,获取目标跟踪的眼部区域图像;对所述眼部区域图像进行预测,得到人眼视线值和多种眼部参数值;基于系统的校准系数对所述人眼视线值和所述多种眼部参数值进行屏幕坐标点映射,得到当前图像帧的人眼在屏幕上的注视坐标点,实现实时性的眼动跟踪。也就是说,本发明实施例中,通过对获取的目标跟踪眼部区域图像进行预测,得到人眼视线值和多种眼部参数值,并结合系统的校准系数进行屏幕坐标点的映射,实现了实时性的眼动跟踪。采用该技术方案,通过对普通的眼部区域图像进行预测,就能进行屏幕注视点坐标的人机交互应用,不但节省了费用,提高了通用性,还提高了眼动追踪的准确性,丰富了使用场景。
73、应当理解的是,以上的一般描述和后文的细节描述仅是示例性和解释性的,并不能限制本发明。
1.一种基于视线的注视点实时追踪方法,其特征在于,包括:
2.根据权利要求1所述的基于视线的注视点实时追踪方法,其特征在于,所述对所述眼部区域图像进行预测,得到人眼视线值和多种眼部参数值,包括:
3.根据权利要求2所述的基于视线的注视点实时追踪方法,其特征在于,在获取所述目标跟踪的眼部区域图像之前,所述方法还包括:预先训练多任务深度学习回归模型,具体包括:
4.根据权利要求1所述的基于视线的注视点实时追踪方法,其特征在于,所述获取目标跟踪的眼部区域图像,包括:
5.根据权利要求4所述的基于视线的注视点实时追踪方法,其特征在于,对所述人脸图像数据流中的眼部区域进行目标跟踪检测,得到目标跟踪的眼部区域图像包括:
6.根据权利要求1至5任一项所述的基于视线的注视点实时追踪方法,其特征在于,所述基于系统的校准系数对所述人眼视线值和所述多种眼部参数值进行屏幕坐标点映射,得到当前图像帧的人眼在屏幕上的注视坐标点,包括:
7.根据权利要求6所述的基于视线的注视点实时追踪方法,其特征在于,在所述通过线性映射模型进行屏幕坐标点映射之前,所述方法还包括:
8.根据权利要求7所述的基于视线的注视点实时追踪方法,其特征在于,所述利用屏幕上预设的n个校准目标点,对所述线性映射模型的系数进行校准,包括:
9.根据权利要求8所述的基于视线的注视点实时追踪方法,其特征在于,采用下述公式对输入到所述线性映射模型进行校准:
10.一种基于视线的注视点实时追踪装置,其特征在于,包括:
11.一种电子设备,其特征在于,包括:
12.一种计算机可读存储介质,其特征在于,当所述计算机可读存储介质中的指令由电子设备的处理器执行时,使得电子设备能够执行如权利要求1至9中任一项所述的基于视线的注视点实时追踪方法。
