一种基于运动与事件信息解耦的目标检测方法

专利2026-08-23  11


本发明涉及图像数据处理,特别是一种基于运动与事件信息解耦的目标检测方法。


背景技术:

1、事件摄像机是一种新型的仿生视觉传感器,它将视觉信息编码在像素级事件流中。与具有固定帧速率的传统相机不同,事件相机的每个像素对光强度的变化做出异步且独立的响应。事件摄像机的主要优点是其高时间分辨率(微秒)、高动态范围(>120db)、低冗余和低功耗。由于事件仅在光强变化时异步生成,因此事件相机自然适合于对象检测,尤其是在具有挑战性的视觉场景中,如高速和低光场景。

2、事件相机为每个瞬间动作创建一个事件,记录对象在该瞬间的位置。具体来说,一个事件可以描述为四个参数:(x,y,t,p),其中x和y表示空间坐标,t表示时间戳,p为极性,表示该像素处的光强是增加还是减少。事件流是由一系列事件点组成的时空中稀疏而离散的点集。事件流和静态图像之间最关键的区别在于,事件流以连续的方式记录对象上每个像素的轨迹,而静态图像只捕捉对象在特定时刻的外观。事件相机与静态图像区别如图1所示。

3、对于目标检测任务而言,基于静态图像的目标检测器通常依赖于物体的形状、纹理、姿态等外观信息来定位和识别物体种类。对于事件流数据,还可以用事件流中额外的运动信息来增强基于外观信息的对象检测。一方面,运动信息为时间连续性提供了一个重要提示,即目标通常表现出连续的运动,而噪声表现出随机和不规则的变化。另一方面,运动信息为空间一致性提供了重要线索,即具有相似位移的相邻图像块很可能属于相同的前景对象或背景区域。

4、由于事件流的异步性和稀疏性,在使用现有的基于帧的目标检测方法之前,往往需要将事件数据转换为稠密的结构化数据(即,稠密张量)。现有的一些方法在将事件数据映射到稠密张量表示的同时试图保留更多的时间信息。例如:time surface将时间信息编码为像素强度值,event volume将临时信息编码为通道维度。虽然相比于静态图像,事件流中还包含了目标的运动信息给目标检测带来新的信息量,但是由于事件流的运动信息和事件信息耦合在一起,网络很难以端到端的方式学习到对于目标检测任务有效的特征,这反而可能会导致目标检测性能下降。


技术实现思路

1、本发明所要解决的技术问题是,针对现有技术不足,提供一种基于运动与事件信息解耦的目标检测方法,解决现有事件数据运动信息和事件信息耦合导致网络难以学习到有效特征的问题。

2、为解决上述技术问题,本发明所采用的技术方案是:一种基于运动与事件信息解耦的目标检测方法,包括以下步骤:

3、s1、将原始事件输入光流估计网络,得到运动张量,根据所述运动张量将原始事件对齐到同一参考时间,得到外观张量;

4、s2、利用所述运动张量生成运动特征,利用所述外观张量提取外观特征,将所述运动特征和外观特征作为事件运动引导注意力模块的输入,得到三个不同尺度的运动相关外观特征;

5、所述事件运动引导注意力模块包括四个注意力单元,其中第i个注意力单元的输出表示为:ψe和ψc分别是空间注意力系数和通道注意力系数,h(·)和h'(·)均为卷积操作,gap(·)表示空间维度中的全局平均池,⊙表示元素乘法,和分别为第i个注意力单元输入的运动特征和外观特征;

6、第一个注意力单元的输出作为外观分支网络的输入,第二、第三个注意力单元的输出作为外观分支网络和特征金字塔网络的输入,第四个注意力单元的输出作为特征金字塔网络的输入;所述外观分支网络用于提取外观特征;

7、s3、将所述三个不同尺度的运动相关外观特征作为特征金字塔网络的输入,将特征金字塔网络输出的三个尺寸的特征图分别作为三个检测头的输入,得到检测结果;

8、每个所述检测头均包括分类子网络和检测子网络;所述分类子网络包括m个级联的卷积层,所述检测子网络包括n个级联的卷积层。

9、本发明第一个注意力单元的输出作为外观分支网络的输入,即利用运动特征增强外观特征,对事件流的信息解耦,引导网络学习到对于目标检测任务更重要的纹理、轮廓等信息,解决了现有事件数据运动信息和事件信息耦合导致网络难以学习到有效特征的问题,改善了目标检测性能。

10、本发明的事件运动引导注意力模块具有优异的性能,因为其允许网络专注于感兴趣的区域和用于对象检测的重要通道。此外,通过将残差单元与空间注意力、通道注意力相结合,原始特征补充了可能被错误抑制的区域,防止了一些关键区域被遮挡,增强了检测方法的鲁棒性。

11、步骤s1中,所述外观张量的表达式为:

12、

13、其中,每个像素(x,y)的值表示落到该像素内的事件点的数量,δ(·)是狄拉克函数,(x′k,y′k)=(xk,yk)+(tk-tref)v(xk,yk),xk,yk为k时刻的事件点的坐标,v(xk,yk)=(vx,vy)表示像素(xk,yk)处的光流,vx,vy分别表示该像素在x和y方向上的速度,tk为事件对齐前的时间,tref为事件对齐的参考时间,为对齐后的事件数据,e′k为对齐之后的事件点,相对应的原始的事件点为ek=(xk,yk,tk,pk),e′k是ek对齐后的结果,pk为事件点的极性,n为一段时间内的事件点的总数量。

14、本发明对事件进行对齐操作,以得到外观特征,对齐后的时间具有更清晰的轮廓和边缘特征,进一步提高了目标检测准确性。

15、步骤s2中,所述运动特征利用运动分支网络提取,所述运动分支网络包括多个级联的卷积层。

16、所述外观分支网络和运动分支网络的卷积层个数均为4,每个分支网络的四个卷积层均采用3*3卷积,步长为2,激活函数为relu函数,四个级联的卷积层输出通道数依次递增。

17、步骤s2中,所述外观分支网络包括多个级联的卷积层;所述第一个注意力单元的输出作为所述外观分支网络第二个卷积层的输入。

18、所述特征金字塔网络输出的三个特征图通道数相同。

19、所述检测子网络的输出通道为4*k,k为锚框个数。

20、所述三个检测头的权重共享。

21、与现有技术相比,本发明所具有的有益效果为:本发明针对事件流中外观信息和运动信息耦合的问题,提出了一种解耦运动和外观的事件表示方法,基于解耦的输入,本发明设计了双流检测网络和事件运动引导注意力模块,利用运动特征增强外观特征,从而极大地改善了目标检测性能。



技术特征:

1.一种基于运动与事件信息解耦的目标检测方法,其特征在于,包括以下步骤:

2.根据权利要求1所述的基于运动与事件信息解耦的目标检测方法,其特征在于,步骤s1中,所述外观张量的表达式为:

3.根据权利要求1所述的基于运动与事件信息解耦的目标检测方法,其特征在于,步骤s2中,所述运动特征利用运动分支网络提取,所述运动分支网络包括多个级联的卷积层。

4.根据权利要求3所述的基于运动与事件信息解耦的目标检测方法,其特征在于,所述外观分支网络和运动分支网络的卷积层个数均为4,每个分支网络的四个卷积层均采用3*3卷积,步长为2,激活函数为relu函数,四个级联的卷积层输出通道数依次递增。

5.根据权利要求1所述的基于运动与事件信息解耦的目标检测方法,其特征在于,步骤s2中,所述外观分支网络包括多个级联的卷积层;所述第一个注意力单元的输出作为所述外观分支网络第二个卷积层的输入。

6.根据权利要求1所述的基于运动与事件信息解耦的目标检测方法,其特征在于,所述特征金字塔网络输出的三个特征图通道数相同。

7.根据权利要求1所述的基于运动与事件信息解耦的目标检测方法,其特征在于,所述检测子网络的输出通道为4*k,k为锚框个数。

8.根据权利要求1所述的基于运动与事件信息解耦的目标检测方法,其特征在于,所述三个检测头的权重共享。


技术总结
本发明公开了一种基于运动与事件信息解耦的目标检测方法,针对事件流中外观信息和运动信息耦合的问题,提出了一种解耦运动和外观的事件表示方法,基于解耦的输入,本发明设计了双流检测网络和事件运动引导注意力模块,利用运动特征增强外观特征,从而极大地改善了目标检测性能。

技术研发人员:李淼,陈诺,凌强,林再平,盛卫东,安玮
受保护的技术使用者:中国人民解放军国防科技大学
技术研发日:
技术公布日:2024/7/25
转载请注明原文地址: https://bbs.8miu.com/read-444214.html

最新回复(0)