一种基于形变的单图像三维人体重建方法

专利2026-08-20  12


本发明属于计算机图形学和计算机视觉领域,具体涉及一种基于形变的单图像三维人体重建方法。


背景技术:

1、单图像三维人体重建是指利用算法从单张人体图像自动生成由网格表示的三维人体模型。随着元宇宙的兴起,三维人体重建展现出了巨大的应用前景。除此以外,三维人体重建在影视制作、游戏娱乐、智能教育等领域都具备广阔的应用前景。目前获得三维人体模型的方式大致有两种:(1)手工建模或基于高精度三维扫描仪、立体视觉系统重建三维人体模型;(2)基于深度学习技术直接从人体图像中重建三维人体模型。第(1)种方式可以获得高精度的三维人体模型,但使用的设备价格昂贵,可操作性低,难以普及化应用;并且扫描过程中个体容易抖动产生噪声导致扫描的三维人体模型残缺。而第(2)种基于深度学习的方式直接从人体图像中重建三维人体模型,可以最大程度地节省成本并大幅提高操作的便捷性。基于深度学习的方法又可以进一步细分为基于多视角图像和单图像的方法。基于多视角的方法需要对重建对象同时采集多张图像,而基于单图像只需要输入一张人体图像即可,最大程度地降低了应用条件。

2、作为一个典型的非适定(ill-posed)问题,从单张图像中重建三维头部模型是一项具有挑战的任务。为应对这一挑战,研究者们陆续提出了一系列基于深度学习的方法以从数据中学习先验知识。这些方法大多数基于参数化方法进行重建。参数化方法一般采用三维可形变模型(如smpl、star三维等)表示人体,从图像中提取特征并估计出少量模型参数即可从初始统计模型形变出特定的三维人体。总体来讲,参数化方法虽然简便并易于构建轻量化神经网络,但是受限于参数化模型的表达能力,这类方法重建出的三维人体模型容易趋近于原始统计模型,且难以恢复出精确的面部表情。其次,这些方法利用线性空间估计统计模型的参数,捕获中高频细节信息受限,难以恢复出精确的人体表面细节。

3、综上,尽管单图像三维人体重建方法在近年来取得了一定的进展,但仍然存在以下问题:1)重建出的三维模型保真度较低。尽管有些方法能在纹理的掩盖下产生逼真的效果,但其几何结构实际上与真实人体存在较大差异,去除纹理后甚至难以与输入图像中的人物身份相匹配。2)重建的三维模型表面细节较少或局部几何结构的精度不佳。大多数方法只能重建出基本的人体形态,对于细节部分几乎无能为力;虽然有些方法可以恢复出一般姿态的大致形状,但对于极端姿态和微观姿态的表达能力较弱。3)算法的泛化能力较差,难以适应复杂姿势以及宽松衣物的变化。例如,通过训练数据集中仅包含站立姿态的模型,在处理其他姿态时往往会出现残肢或扭曲的结果。


技术实现思路

1、针对现有技术的缺点,本发明提供一种基于形变的单图像三维人体重建方法及系统,其目的在于从单张可见光图像重建出高分辨率、具有完整结构且无伪影的三维人体模型。

2、为实现上述目的,按照本发明的基于形变的单图像三维人体重建方法,包含如下步骤:

3、获取单张人体图像,将所述人体图像输入到参数估计网络模型,生成所述人体图像的参数化模型,并通过渲染所述参数化模型,得到其前视图和后视图的参数化模型法线图;

4、将所述人体图像输入到法线图估计网络模型,生成所述人体图像的前视图和后视图的人体法线图;

5、将所述参数化模型法线图和人体法线图输入到位移场估计网络模型,生成前视图和后视图的人体位移图;

6、利用所述前视图和后视图的人体位移图的信息,将所述参数化模型形变为粗略人体模型;

7、将所述人体图像和所述人体法线图输入到特征编码器,生成人体图像特征;

8、将所述粗略人体模型的几何信息、所述人体法线图与所述人体图像特征,输入到网格表面精细化网络,获得高精度的三维人体模型。

9、进一步地,所述获取单张人体图像包括步骤:将输入图像中的人体区域分割出来得到所述单张的人体图像。

10、进一步地,所述将所述人体图像输入到参数估计网络模型,生成所述人体图像的参数化模型包括步骤:

11、将所述参数估计网络模型输出的形状参数、表情参数、身体姿态参数、手部姿态参数与smpl-x模型对应的向量基相乘得到稀疏参数化模型;将稀疏参数化模型提高分辨率,得到所述参数化模型。

12、进一步地,所述将所述参数化模型形变为粗略人体模型,具体包括步骤:

13、

14、其中,mo表示所述参数化模型,s表示位移场,mc表示粗略人体模型,vo和vc分别代表mo和mc的顶点集合,而是一组从位移场s中衍生出来的位移向量集合;对于vs中的每一个顶点这些位移向量精确地捕捉了从参数化模型mo到粗略人体模型mc变形过程中,每个顶点位置的变化:

15、

16、式中,i=1、2、3......,π(·)代表一个将3d顶点投影到2d位移场平面上的正交变换,<,>表示向量,sf表示前视人体位移图,表示后视人体位移图,表示mo上的每一个点。

17、进一步地,所述生成前视图和后视图的人体位移图包括步骤:

18、通过构建参数化模型法线图r与人体法线图n间的逐像素对应关系来推断人体位移图s,得到人体位移图s后,将参数化模型法线图r调整以匹配人体法线图n:

19、

20、其中,表示推导出的人体法线图,r*表示前视图和后视图的参数化模型法线图,s*表示前视图和后视图的人体位移图,*={f,b}表示前视图f和后视图b,而w(·)指的是密集图像扭曲函数,为了推断人体位移图s,设计一个五层轻量化的卷积神经网络,名为shiftestnet(gs):

21、gs(r,n)→s

22、鉴于参数化模型法线图与人体法线图分属不同的域,它们之间缺乏直接的依据来形成紧密的匹配关系,设计一种名为循环扭曲的策略,基于这一策略,shiftestnet被特别设计为具有逆扭曲的能力:

23、

24、其中,是逆向扭曲过程中推断出的位移场:

25、

26、式中,表示推导出的参数化模型法线图;

27、在一个循环中,将参数化模型法线图变形为人体法线图,然后再将它们变形回参数化模型法线图,反之亦然:

28、

29、其中,表示二次推导出的参数化模型法线图,表示二次推导出的人体法线图。

30、进一步地,shiftestnet以自监督的方式进行优化,目标函数由三个部分组成:

31、

32、式中,λw,λc,λs表示权重,表示反向的人体位移图;

33、lw是变形损失:

34、

35、lc是循环一致性损失:

36、

37、ls是一个平滑性损失,它约束推导出的位移场在局部保持平滑:

38、

39、

40、其中,ng是一个均匀分布的随机法线图,表示二次推导出的人体法线图,表示二次推导出的参数化模型法线图。

41、进一步地,所述shiftestnet包含多个2d卷积层,每个卷积层后面接一个leakyrelu和一个batchnorm;所述shiftestnet使用adam作为优化器。

42、进一步地,所述特征编码器采用pifuhd(pifuhd:multi-level pixel-alignedimplicit function for high-resolution 3d human digitization,2020)提供的编码器ge,从人体图像i及人体法线图{nf,nb}中提取所述人体图像特征:

43、ge(i,nf,nb)→ψ

44、nf和nb表示人体图像的前视图和后视图的人体法线图,ψ表示编码器ge提取的人体图像特征;

45、除了编码器提取的人体图像特征外,还将每个顶点的坐标v和法线nv嵌入到顶点上:

46、ψv=<ψ(π(v)),nv,v>

47、其中,π(v)代表了一个将3d顶点v映射到2d特征平面上的正交投影操作,ψv表示最终提取的嵌入式人体特征,nv表示每个点从人体法线图中提取到到的信息。

48、进一步地,将所述粗略人体模型的几何信息、所述人体法线图与所述人体图像特征,输入到网格表面精细化网络,获得高精度的三维人体模型,包括步骤:

49、在嵌入式人体特征ψv的驱动下,利用名为deformnet(gm)的图形卷积网络gcn,将粗略人体网格mc细化成高精度的人体网格md:

50、gm(mc;ψ)→md

51、网络架构设计方面,deformnet是基于meshcnn(meshcnn:a network with anedge,2019)提出的网格卷积操作设计的。具体来说,对于某一边e0及其四个邻边{e1,e2,e3,e4},卷积的操作方式被定义如下:

52、

53、其中[μ0,…,μ4]是一系列卷积核,是嵌入在边ek上的特征:

54、

55、其中,vi和vj代表边ek的两个顶点,用来表示连接操作。

56、deformnet包含多个meshcnn卷积层,每个层后接一个leakyrelu和一个instancenorm;adam被用作训练所述deformnet的优化器。

57、进一步地,包括:预先对所述deformnet网络进行训练,所述训练包括步骤:

58、对已有的三维人体模型通过光栅渲染得到训练图片样本集合和每张训练图片样本对应的人体法线图;

59、利用所述训练图片样本集合和所述人体法线图训练deformnet网络模型,deformnet网络模型采用如下的损失函数l进行训练:

60、损失函数l包括几何误差项ld、局部细节误差项ln以及正则化项le:

61、l=λdld+λnln+λele

62、式中,λd,λn,λe表示权重;

63、ld通过chamfer距离来描述:

64、

65、p和分别是从预测的和真实的三维网格中各自采样得到的三维点集,和表示在真实的三维网格中采样到的点,p和q表示在预测的三维网格中采样到的点;ln通过法线的余弦距离来描述:

66、

67、和是双向匹配的最近点对,n表示法向量;

68、正则化项le对长边进行惩罚:

69、

70、其中,vi和vj边e的两个顶点,e表示mo中边的集合。

71、总体而言,本发明所构思的以上技术方案与现有技术相比,具有有益效果:

72、(1)在本项发明中,提出了一种基于形变的单图像三维人体重建方法,旨在从单张照片中重建出既高保真又无任何伪影的着衣三维人体模型。在本项发明中,采用了一种“拉伸-细化”双阶段变形策略,巧妙地协调了重建宽松服饰所需的大幅度变形与为恢复细致表面细节所需的精细变形之间的平衡。该策略解决了自由形式的深度隐式函数通常会产生的重建伪影以及参数化模型的强约束导致的宽松衣物重建失败的问题。具体而言,本发明初步通过解析法线图而推断的人体位移图,将smpl-x网格模型拉伸为一个粗略人体模型,随后利用融合了隐函数特征学习的图卷积网络(gcn),进一步将此粗略模型细化成具有丰富细节的精确三维人形模型。在拉伸阶段,本发明精确调整smpl-x网格上每一个顶点的位置,以确保粗略模型与输入图像中的实际人体形象紧密吻合,从而有效处理宽松衣物并纠正smpl-x估计中存在的姿态和形状误差。在细化阶段,gcn在隐函数特征的引导下细腻地调整粗略模型,精准重现着衣人体的细节与复杂表面。此外,通过考虑到人体的先验知识,图模型中每个顶点都被其周围邻域所约束,有效避免了扭曲和非人体形状等伪影的产生。在整个变形过程中,本发明仅对顶点进行位移调整,而不更改边的连接,从而保证了最终产生的三维人体网格模型的完整性,无孔洞、无损坏和无断肢,展现了其出色的重建质量。

73、(2)本发明相比于手工建模或基于三维扫描仪、立体视觉系统重建三维人体模型,只需要将单张人体图像输入到计算机中即可完成重建,可以最大程度地节省成本并大幅提高操作的便捷性,未来具有广阔的应用前景。

74、(3)相较于采用基于深度学习技术直接从多视角图像中重建三维人体模型的方法,本发明只需要输入一张人体图像就可以重建出高保真的三维人体模型,最大程度降低了应用条件。


技术特征:

1.一种基于形变的单图像三维人体重建方法,其特征在于,包含如下步骤:

2.根据权利要求1所述的基于形变的单图像三维人体重建方法,其特征在于,所述获取单张人体图像包括步骤:将输入图像中的人体区域分割出来得到所述单张人体图像。

3.根据权利要求1所述的基于形变的单图像三维人体重建方法,其特征在于,将所述人体图像输入到参数估计网络模型,生成所述人体图像的参数化模型包括步骤:

4.根据权利要求1所述的基于形变的单图像三维人体重建方法,其特征在于,将所述参数化模型形变为粗略人体模型,具体包括步骤:

5.根据权利要求1所述的基于形变的单图像三维人体重建方法,其特征在于,所述生成前视图和后视图的人体位移图包括步骤:

6.根据权利要求5所述的基于形变的单图像三维人体重建方法,其特征在于,shiftestnet以自监督的方式进行优化,目标函数由三个部分组成:

7.根据权利要求6所述的基于形变的单图像三维人体重建方法,其特征在于,所述shiftestnet包含多个2d卷积层,每个卷积层后面接一个leakyrelu和一个batchnorm;所述shiftestnet使用adam作为优化器。

8.根据权利要求4所述的基于形变的单图像三维人体重建方法,其特征在于,采用特征编码器ge,从人体图像i及人体法线图{nf,nb}中提取所述人体图像特征:

9.根据权利要求8所述的基于形变的单图像三维人体重建方法,其特征在于,将所述粗略人体模型的几何信息、所述人体法线图与所述人体图像特征,输入到网格表面精细化网络,获得高精度的三维人体模型,包括步骤:

10.根据权利要求9所述的基于形变的单图像三维人体重建方法,其特征在于,包括:预先对所述deformnet网络进行训练,所述训练包括步骤:


技术总结
本发明提出了一种基于形变的单图像三维人体重建方法,旨在从单张照片中重建出既高保真又无任何伪影的着衣三维人体模型,本发明采用了“拉伸‑细化”双阶段变形策略,巧妙地协调了重建宽松服饰所需的大幅度变形与为恢复细致表面细节所需的精细变形之间的平衡,该策略解决了自由形式的深度隐式函数通常会产生的重建伪影以及参数化模型的强约束导致的宽松衣物重建失败的问题;本发明只需要将单张人体图像输入到计算机中即可完成重建,可以最大程度地节省成本并大幅提高操作的便捷性;相较于采用基于深度学习技术直接从多视角图像中重建三维人体模型的方法,本发明只需输入一张人体图像就可以重建出高保真的三维人体模型,最大程度降低了应用条件。

技术研发人员:刘乐元,李宇翰,高韵琪,陈靓影,刘三女牙,杨宗凯
受保护的技术使用者:华中师范大学
技术研发日:
技术公布日:2024/7/25
转载请注明原文地址: https://bbs.8miu.com/read-444040.html

最新回复(0)