本申请属于图像检索,涉及一种跨域图像检索方法和系统、电子设备及存储介质。
背景技术:
1、受成像载体、成像光谱和成像条件等的影响,跨域图像在不同领域的应用日益增多,跨域图像检索已成为了许多领域研究的热点。然而,图像的跨域检索面临着图像视觉鸿沟的问题,通过传统同域图像检索的方法无法有效地得到结果。
2、根据图像域的不同转换阶段,现有的跨域图像检索方法大致分为两类:基于特征空间迁移的跨域图像检索方法和基于图像域迁移的跨域图像检索方法。这两类跨域图像检索方法都能够在两个特定的视觉域之间获得检索结果,却无法泛化应用到其他两个不同的域之间的检索,并且每次应用到新的视觉域时都需要重新训练模型。随着图像域种类越来越多,为不同视觉域都训练一个模型显然是不现实的。
技术实现思路
1、本申请的目的在于提供一种跨域图像检索方法和系统、电子设备及存储介质,用于解决现有技术由于泛化能力弱,导致无法在不同的视觉域之间进行准确和有效的图像检索的技术问题。
2、第一方面,本申请提供一种跨域图像检索方法,包括:获取源域查询图像,并将所述查询图像转换为图像特征向量;获取目标域待检索图像,并将所述待检索图像转换为文本特征向量;构建所述待检索图像的索引信息;计算所述图像特征向量与所述文本特征向量之间的相似度,得到相似度分数;基于所述相似度分数和所述索引信息,从所述待检索图像中确定与所述查询图像匹配的目标图像。
3、在第一方面的一种实现方式中,将所述查询图像转换为图像特征向量包括:
4、对所述查询图像进行图像编码,得到所述图像特征向量。
5、在第一方面的一种实现方式中,获取目标域待检索图像,并将所述待检索图像转换为文本特征向量包括:
6、从图像数据池中获取图像样本作为所述待检索图像;
7、采用预训练的图生文模型对所述待检索图像进行处理,得到图像标题;所述图像标题为用于描述所述待检索图像的主题的短句;
8、对所述图像标题进行文本编码,得到所述文本特征向量。
9、在第一方面的一种实现方式中,构建所述待检索图像的索引信息包括:
10、为所述图像数据池中的每个所述待检索图像分配一个唯一的数字标号;
11、将每个所述待检索图像的数字标号与对应的所述图像标题和所述文本特征向量进行关联。
12、在第一方面的一种实现方式中,所述图生文模型为基于编码器-解码器架构的多模态大语言模型。
13、在第一方面的一种实现方式中,采用预训练的图生文模型对所述待检索图像进行处理,得到图像标题包括:
14、基于所述编码器,将所述待检索图像转换为固定长度的视觉特征表示;
15、基于所述解码器,对所述视觉特征表示进行处理,以生成与所述待检索图像相匹配的文本描述。
16、在第一方面的一种实现方式中,基于所述相似度分数和所述索引信息,从所述待检索图像中确定与所述查询图像匹配的目标图像包括:
17、将所述相似度分数按照升序或降序排序;
18、获取预设比例的高相似度分数对应的所述文本特征向量;
19、基于所述索引信息,在所述图像数据池中查找与所述文本特征向量具有映射关系的所述待检索图像,作为所述目标图像。
20、第二方面,本申请提供一种跨域图像检索系统,包括:源域图像转换模块,用于获取源域查询图像,并将所述查询图像转换为图像特征向量;目标域图像转换模块,用于获取目标域待检索图像,并将所述待检索图像转换为文本特征向量;索引信息构建模块,用于构建所述待检索图像的索引信息;相似度计算模块,用于计算所述图像特征向量与所述文本特征向量之间的相似度,得到相似度分数;目标图像匹配模块,用于基于所述相似度分数和所述索引信息,从所述待检索图像中确定与所述查询图像匹配的目标图像。
21、第三方面,本申请提供一种电子设备,包括:处理器及存储器;所述存储器用于存储计算机程序;所述处理器用于执行所述存储器存储的计算机程序,以使所述电子设备执行上述任一项所述的跨域图像检索方法。
22、第四方面,本申请提供一种计算机可读存储介质,其上存储有计算机程序,该程序被处理器执行时实现上述任一项所述的跨域图像检索方法。
23、如上所述,本申请所述的跨域图像检索方法和系统、电子设备及存储介质,具有以下有益效果:
24、(1)具备显著的泛化能力,能够适应不同的视觉域,并在不同的视觉域之间进行有效的图像检索;
25、(2)通过引入多模态大语言模型,将跨域图像检索任务转换为图文检索任务,提高了不同视觉域图像之间的特征匹配准确性,进而提高整体的图像检索效率和准确性;
26、(3)无需为新的视觉域重新训练模型,提高了模型的应用效率和灵活性。
1.一种跨域图像检索方法,其特征在于,包括:
2.根据权利要求1所述的方法,其特征在于,将所述查询图像转换为图像特征向量包括:
3.根据权利要求1所述的方法,其特征在于,获取目标域待检索图像,并将所述待检索图像转换为文本特征向量包括:
4.根据权利要求3所述的方法,其特征在于,构建所述待检索图像的索引信息包括:
5.根据权利要求3所述的方法,其特征在于,所述图生文模型为基于编码器-解码器架构的多模态大语言模型。
6.根据权利要求5所述的方法,其特征在于,采用预训练的图生文模型对所述待检索图像进行处理,得到图像标题包括:
7.根据权利要求3所述的方法,其特征在于,基于所述相似度分数和所述索引信息,从所述待检索图像中确定与所述查询图像匹配的目标图像包括:
8.一种跨域图像检索系统,其特征在于,包括:
9.一种电子设备,其特征在于,包括:处理器及存储器;
10.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,该程序被处理器执行时实现权利要求1至7中任一项所述的跨域图像检索方法。
