缺失表格数据公平预测方法及装置、电子设备

专利2026-07-30  4


本申请涉及表格数据预测领域,具体涉及一种缺失表格数据公平预测方法及装置、电子设备。


背景技术:

1、机器学习模型在现实世界中的应用普遍,其能够基于数据做出预测,例如公司会使用机器学习软件来筛选候选人的简历,并确定哪些候选人获得面试机会。然而,机器学习模型的预测结果与其训练数据的性质和模型训练方式密切相关。如果训练数据当中包含偏见或不平等,那么在该训练数据上训练得到的模型的行为可能反映甚至放大了其中的偏见。敏感属性特征使得按照敏感属性特征划分得到的不同群体中存在不同的缺失率或缺失机制,这加剧了模型在下游预测任务中的歧视。因此,探索缺失表格数据的公平预测问题具有吸引力和必要性。

2、现有的表格数据公平预测研究主要集中在完整表格数据上,并不能直接应用于包含缺失值的数据。处理缺失值的常见方法是首先进行插补,用适当的值填补缺失内容,然后将一个现成的表格数据公平预测模型应用到插补后的数据上。然而,即使采用先进的插补技术,它们插补的数据也不能准确反映真实数据,尤其是在存在复杂的缺失机制时,并且缺失数据在不同群体之间的不平衡时会进一步加剧不公平性。此外,插补会丢失数据集缺失模式中的关键信息,影响模型的下游预测。因此,开发一种新的缺失表格数据公平预测方法,是至关重要且紧迫的。

3、在实现本发明的过程中,发明人发现现有技术中至少存在如下问题:

4、首先,现有方法忽略了缺失数据对公平预测的影响,并没有充分利用缺失信息来对模型进行纠偏。此外,现有的研究在处理缺失数据时,大多考虑插补。然而,即使采用最先进的插补技术,插补的数据也不能准确地反映出真实的数据,尤其是在存在复杂的缺失机制时。这可能会引入额外的偏见,影响数据的分布,进而引发不公平性的决策。


技术实现思路

1、为了克服以上技术问题,本申请实施并提供一种缺失表格数据公平预测方法及装置、电子设备,来保证预测的公平性。

2、根据本申请实施例的第一方面,提供一种缺失表格数据公平预测方法,包括:

3、s1:获取缺失表格数据特征矩阵与表格数据标签矩阵,并生成相应的特征缺失掩码矩阵,所述缺失表格数据特征矩阵由敏感属性特征矩阵和非敏感属性特征矩阵组成,两者均存在缺失;

4、s2:根据所述缺失表格数据特征矩阵和特征缺失掩码矩阵构建融合了注意力机制正则化计算的transformer神经网络模型;

5、s3:对所述缺失表格数据特征矩阵及特征缺失掩码矩阵进行掩蔽,将遮掩后的样本输入到所述神经网络模型中计算得到重构误差;

6、s4:对所述敏感属性特征矩阵中敏感属性特征已知的样本进行敏感属性翻转与添加高斯噪声操作,生成正样本与负样本,将敏感属性特征已知的样本,以及正负样本输入所述神经网络模型中计算得到对比学习误差;

7、s5:将所述重构误差和对比学习误差进行加权得到预训练误差,利用预训练误差对所述神经网络模型进行预训练,得到预训练后的神经网络模型;

8、s6:将所述缺失表格数据特征矩阵划分为缺失表格数据分类特征矩阵和缺失表格数据连续特征矩阵,结合其对应的特征缺失掩码矩阵进行标记后,将标记后的缺失表格数据分类特征矩阵和缺失表格数据连续特征矩阵分别通过线形层映射到高维,并将结果进行拼接获得高维表征矩阵;

9、s7:将所述高维表征矩阵输入到所述预训练后的神经网络模型中得到样本标签预测矩阵,基于样本标签预测矩阵与表格数据标签矩阵计算得到预测标签误差,利用最小化预测标签误差对所述预训练后的神经网络模型进行迭代更新,得到缺失表格数据公平预测模型;

10、s8:将缺失表格数据特征矩阵和特征缺失掩码矩阵输入所述缺失表格数据公平预测模型中得到最终预测结果。

11、根据本申请实施例的第二方面,提供缺失表格数据公平预测装置,包括:

12、获取模块,用于获取缺失表格数据特征矩阵与表格数据标签矩阵,并生成相应的特征缺失掩码矩阵,所述表格数据特征矩阵由敏感属性特征矩阵和非敏感属性特征矩阵组成,两者均存在缺失;

13、构建模块,用于根据所述缺失表格数据特征矩阵和特征缺失掩码矩阵构建融合了注意力机制正则化计算的transformer神经网络模型;

14、第一计算模块,用于对所述缺失表格数据特征矩阵及特征缺失掩码矩阵进行掩蔽,将遮掩后的样本输入到所述神经网络模型中计算得到重构误差;

15、第二计算模块,用于对所述敏感属性特征矩阵中敏感属性特征已知的样本进行敏感属性翻转与添加高斯噪声操作,生成正样本与负样本,将敏感属性特征已知的样本,以及正负样本输入所述神经网络模型中计算得到对比学习误差;

16、预训练模块,用于将所述重构误差和对比学习误差进行加权得到预训练误差,利用预训练误差对所述神经网络模型进行预训练,得到预训练后的神经网络模型;

17、拼接模块,用于将所述缺失表格数据特征矩阵划分为缺失表格数据分类特征矩阵和缺失表格数据连续特征矩阵,结合其对应的特征缺失掩码矩阵进行标记后,将标记后的缺失表格数据分类特征矩阵和缺失表格数据连续特征矩阵分别通过线形层映射到高维,并将结果进行拼接获得高维表征矩阵;

18、模型生成模块,将所述高维表征矩阵输入到所述预训练后的神经网络模型中得到样本标签预测矩阵,基于样本标签预测矩阵与表格数据标签矩阵计算得到预测标签误差,利用最小化预测标签误差对所述预训练后的神经网络模型进行迭代更新,得到缺失表格数据公平预测模型;

19、预测模块,用于将缺失表格数据特征矩阵和特征缺失掩码矩阵输入所述缺失表格数据公平预测模型中得到最终预测结果。

20、根据本申请实施例的第三方面,提供一种电子设备,包括:

21、一个或多个传感器;

22、一个或多个处理器;

23、存储器,用于存储一个或多个程序;

24、当所述一个或多个程序被所述一个或多个处理器执行,使得所述一个或多个处理器实现如第一方面所述的方法。

25、本申请的实施例提供的技术方案可以包括以下有益效果:

26、与现有技术相比,本发明的改进之处在于:对transformer中的多头注意力机制进行改进,通过引入针对key和value的正则化处理降低偏差,增强了预测的公平性;通过遮蔽操作,使得神经网络模型能够直接对缺失表格数据特征矩阵进行处理,克服了先填补缺失表格数据特征矩阵后预测表格数据标签引入额外偏差,效率低的问题;通过预训练的方式学习缺失状态分布,构建对比学习损失函数,充分利用已知的敏感属性特征信息缓解数据表征中的不公平性,克服了缺失表格数据预测不公平、不准确的问题;本方法预测精度较目前先补全后公平性预测算法在公平性上提升了20%,并且具有更高的预测精度与效率。

27、应当理解的是,以上的一般描述和后文的细节描述仅是示例性和解释性的,并不能限制本申请。



技术特征:

1.一种缺失表格数据公平预测方法,其特征在于,包括:

2.根据权利要求1所述的方法,其特征在于,s1具体包括:

3.根据权利要求1所述的方法,其特征在于,所述神经网络模型由嵌入层和多个transformer块组成,其中所述嵌入层由可学习的线性映射矩阵和位置编码层组成,而每个transformer块则由多头注意力机制、前馈神经网络、残差连接和层归一化共同构成,其中多头注意力机制中融合了对于key和value的正则化操作。

4.根据权利要求1所述的方法,其特征在于,s3具体包括:

5.根据权利要求1所述的方法,其特征在于,s4具体包括:

6.根据权利要求1所述的方法,其特征在于,s5具体包括:

7.根据权利要求1所述的方法,其特征在于,s6具体包括:

8.根据权利要求1所述的方法,其特征在于,s7具体包括:

9.一种缺失表格数据公平预测装置,其特征在于,包括:

10.一种电子设备,其特征在于,包括:


技术总结
本发明公开了一种缺失表格数据公平预测方法,该方法包括:获取缺失表格数据特征矩阵、表格数据标签矩阵和特征缺失掩码矩阵;构建融合了注意力机制正则化计算的Transformer神经网络模型;对缺失表格数据特征矩阵进行掩蔽,计算重构误差;对缺失表格数据特征矩阵中敏感属性已知的样本生成正负样本,计算对比学习误差;将所述重构误差与对比学习误差进行加权,对神经网络模型进行预训练;将缺失表格数据特征矩阵与特征缺失掩码矩阵通过线形层映射至高维;构建微调模块,利用最小化预测标签误差对预训练后的神经网络模型进行微调,得到缺失表格数据公平预测模型;将缺失表格数据特征矩阵和特征缺失掩码矩阵输入预测模型得到最终预测结果。

技术研发人员:苗晓晔,强蕾,吴洋洋,尹建伟,潘晓华,席萌
受保护的技术使用者:浙江大学
技术研发日:
技术公布日:2024/7/25
转载请注明原文地址: https://bbs.8miu.com/read-443194.html

最新回复(0)