本发明涉及机器视觉三维空间重构,尤其涉及服务于视障人士的机器视觉三维空间重构方法。
背景技术:
1、视觉障碍是指由于各种原因导致视力受损或完全失去的情况,这极大地影响了患者的生活质量。据世界卫生组织估计,全球有数百万人受到各种形式的视力障碍的影响。在这些情况下,视障人士通常依赖于其他感官,如听觉和触觉,以及辅助工具来导航和互动环境。因此,开发有效的辅助技术以帮助视障人士独立生活并提高他们的生活质量至关重要。
2、随着计算机视觉、深度学习和感知技术的迅猛发展,机器视觉在辅助视障人士方面展现出巨大潜力。具体来说,三维空间重构技术可以提供有关周围环境的详细信息,这对于视障人士理解其所处的空间非常有益。这种技术能够捕捉场景的深度信息,从而允许视障人士"感知"前方物体的距离和形状,弥补他们的视觉缺失。
3、目前,市场上已有一些辅助设备,它使用红外传感器和结构光技术来获取环境的深度图像。这些设备能够将物理世界的三维数据转换成电子格式,供进一步的处理和分析。然而,将这些原始数据转化为对视障人士直观有用的信息仍然是一项挑战。
技术实现思路
1、本发明的目的是为了解决现有技术中存在的缺点,而提出的服务于视障人士的机器视觉三维空间重构方法。
2、为了实现上述目的,本发明采用了如下技术方案:
3、服务于视障人士的机器视觉三维空间重构方法,采用3d传感器来获取视障人士视野中的深度图像,表征视障人士视野区域中场景的深度,深度图像中的像素表征深度信息,每个像素具有三维坐标系下的坐标信息;在深度图像中能够得到视野中物体的三维几何特征,从而建立物体的空间模型;具体包括:
4、s1:像素获取,像素延伸区域,物体建模;
5、s2:视障人士视野中的对象检测与识别;
6、s3:潜在危险性的移动物体的多目标多种类跟踪算法设计;
7、s4:文字和图像与语音的映射关系设计。
8、优选的:所述s1中,深度图像的获取,用深度成像感知器kinect获取深度图像;深度图像中深度像素量化大小函数如下:
9、q(z)=2.73z2+0.74z-0.58[mm];
10、kinect几何模型构建;将一个3d点x投影到图像点[u,v]中,具体采用如下公式:
11、
12、
13、优选的:所述s2中,针对具体问题构建数学模型,得到目标函数,在模拟视障人士拍摄的图像进行检测和识别之前,将图像进行局部二值模式(lbp)操作,转化成3d度量空间表示,作为深度神经网络的输入。
14、优选的:所述s2中,使用imagenet图像分类集对于16层的vgg的卷积神经网络进行预处理,通过收集的视障人士感兴趣的三类图像内容进行微调和构建新的视障人士特定对象检测与识别网络。
15、优选的:基于所述深度神经网络模型,从中选取发现涵盖视觉图像重要特点的深度特征所对应的层数,将该种层数对应的每一层的特征直接与最终层进行网络构建,并且最终将其中的addi层的特征与最终层的深度特征进行全链接微调整个深度神经网络模型。
16、优选的:所述深度神经网络模型中,每一层特征对应视障人士服务的一个类型的对象,从而有层次有目的的实现对于不同的目标对象的检测和识别。
17、优选的:所述s2中,对视障人士视野中的显著性物体进行显著性区域检测,显著性检测算法的流程如下:
18、s11:开始;
19、s12:获取原始图像;
20、s13:基于原始图像得到dog滤波;
21、s14:计算图像显著性;
22、s15:可适应阈值分割;
23、s16:得到显著性图像;
24、s17:结束。
25、优选的:所述s3中多目标多种类跟踪算法将一个简單的区域选择网络(rpn)来加速多目标区域的选择,然后使用快速卷积神经网络(f-cnn)完成对于多种类多目标的检测与跟踪,实现对于视障人士前方移动物体的检测与跟踪,并且对视障人士的安全给予实时估计与预警。
26、优选的:所述s4中,视障人士所需物品的主动检索流程,包括如下步骤:
27、s21:盲人语音诉求;
28、s22:对语音内容进行识别;
29、s23:输出文本信息;
30、s24:根据输入的文本信息进行文本图像映射转换;
31、s25:输出诉求图像信息;
32、s26:进行快速图像检索;
33、s27:根据检索的结果输出文本信息;
34、s28:将文本信息进行语音合成输出给盲人。
35、本发明的有益效果为:
36、1.本发明通过对空间物体几何信息的内在关联、物体移动速度和位置信息的深入分析,探索服务于视障人士的机器视觉三维空间重构的新方法和新理论;探索建立“文字和图像”与语音之间的映射关系,为视障人士的主动需求,寻求出一种“图-音”新模式,极大地提供了生活上的方便。
37、2.本发明用计算机视觉技术解析几何空间信息,判别障碍物,识别不同物体,对存在潜在危险的移动物体进行检测和跟踪;提供了视障人士周围环境的三维空间重构方法,实现了移动物体对视障人士的潜在危险性评估与预警。
38、3.本发明使用计算机视觉技术解析场景中的空间几何信息,判别障碍物,识别不同种类物体,能够完成视野范围内视障人士所需物品的主动检索。
1.服务于视障人士的机器视觉三维空间重构方法,其特征在于,采用3d传感器来获取视障人士视野中的深度图像,表征视障人士视野区域中场景的深度,深度图像中的像素表征深度信息,每个像素具有三维坐标系下的坐标信息;在深度图像中能够得到视野中物体的三维几何特征,从而建立物体的空间模型;具体包括:
2.根据权利要求1所述的服务于视障人士的机器视觉三维空间重构方法,其特征在于,所述s1中,深度图像的获取,用深度成像感知器kinect获取深度图像;深度图像中深度像素量化大小函数如下:
3.根据权利要求2所述的服务于视障人士的机器视觉三维空间重构方法,其特征在于,所述s2中,针对具体问题构建数学模型,得到目标函数,在模拟视障人士拍摄的图像进行检测和识别之前,将图像进行局部二值模式(lbp)操作,转化成3d度量空间表示,作为深度神经网络的输入。
4.根据权利要求3所述的服务于视障人士的机器视觉三维空间重构方法,其特征在于,所述s2中,使用imagenet图像分类集对于16层的vgg的卷积神经网络进行预处理,通过收集的视障人士感兴趣的三类图像内容进行微调和构建新的视障人士特定对象检测与识别网络。
5.根据权利要求4所述的服务于视障人士的机器视觉三维空间重构方法,其特征在于,基于所述深度神经网络模型,从中选取发现涵盖视觉图像重要特点的深度特征所对应的层数,将该种层数对应的每一层的特征直接与最终层进行网络构建,并且最终将其中的addi层的特征与最终层的深度特征进行全链接微调整个深度神经网络模型。
6.根据权利要求5所述的服务于视障人士的机器视觉三维空间重构方法,其特征在于,所述深度神经网络模型中,每一层特征对应视障人士服务的一个类型的对象,从而有层次有目的的实现对于不同的目标对象的检测和识别。
7.根据权利要求6所述的服务于视障人士的机器视觉三维空间重构方法,其特征在于,所述s2中,对视障人士视野中的显著性物体进行显著性区域检测,显著性检测算法的流程如下:
8.根据权利要求7所述的服务于视障人士的机器视觉三维空间重构方法,其特征在于,所述s3中多目标多种类跟踪算法将一个简單的区域选择网络(rpn)来加速多目标区域的选择,然后使用快速卷积神经网络(f-cnn)完成对于多种类多目标的检测与跟踪,实现对于视障人士前方移动物体的检测与跟踪,并且对视障人士的安全给予实时估计与预警。
9.根据权利要求1所述的服务于视障人士的机器视觉三维空间重构方法,其特征在于,所述s4中,视障人士所需物品的主动检索流程,包括如下步骤:
