本发明涉及用户匹配,具体是指一种基于数据融合的用户匹配系统。
背景技术:
1、用户匹配是在在线交友应用下发挥作用的关键技术之一,通过用户匹配技术可以帮助用户找到与自己相匹配的潜在伴侣或约会对象,提高匹配成功率和用户满意度。一般的用户数据分析方法存在误差或信息不完整的情况,导致提取的特征不够准确和全面,分析结果的普适性受到限制;一般分析用户关联时存在主观性,难以判断和验证无意义的用户关系,且存在偏差或代表性不足,导致匹配结果的不准确和不公平;一般的用户匹配方法缺乏动态调整,无法根据用户的反馈和行为变化及时调整匹配策略,导致难以满足用户的变化需求和期望。
技术实现思路
1、针对上述情况,为克服现有技术的缺陷,本发明提供了一种基于数据融合的用户匹配系统,针对一般的用户数据分析方法存在误差或信息不完整的情况,导致提取的特征不够准确和全面,分析结果的普适性受到限制的问题,本方案通过收集用户的心理数据和行为数据,提取用户的心理特征和行为特征并进行融合分析,更全面地了解用户的个性和行为习惯;针对一般分析用户关联时存在主观性,难以判断和验证无意义的用户关系,且存在偏差或代表性不足,导致匹配结果的不准确和不公平的问题,本方案通过挖掘关联规则,揭示了用户之间潜在的关联关系和行为模式,针对不同用户群体实现个性化的推荐和匹配;针对一般的用户匹配方法缺乏动态调整,无法根据用户的反馈和行为变化及时调整匹配策略,导致难以满足用户的变化需求和期望的问题,本方案基于迭代更新的关联规则进行匹配,更准确地识别用户之间的匹配程度,将用户后续的成功交往情况反馈到关联规则中,实现了系统不断优化匹配策略和关联规则的生成。
2、本发明提供的一种基于数据融合的用户匹配系统,包括数据采集模块,数据融合模块,关联规则学习模块和用户匹配模块;
3、所述数据采集模块收集用户的用户id、心理数据和行为数据,所述心理数据是指用户完成心理测试得到的心理测试结果,所述行为数据指用户在使用社交平台时产生的数据,将心理数据和行为数据发送至数据融合模块;
4、所述数据融合模块对心理数据和和行为数据进行分析和处理,将心理数据和行为数据进行匹配和合并,提取心理特征和行为特征,将提取出的心理特征和行为特征发送至关联规则学习模块;
5、所述关联规则学习模块分析心理特征和行为特征的关联规则,每位用户的心理特征和行为特征作为项,将所有项转换成垂直数据表示,使用eclat算法生成频繁项集,从频繁项集中生成关联规则,将生成的关联规则发送至用户匹配模块;
6、所述用户匹配模块根据生成的关联规则进行用户匹配,使用关联规则为用户查找满足关联规则的匹配用户,将用户后续的成功交往情况反馈到关联规则中。
7、进一步地,所述数据融合模块,包括数据处理模块、数据匹配模块、特征工程模块;
8、所述数据处理模块对心理数据和行为数据进行清洗,处理缺失值和异常值,将心理数据和行为数据转换为向量,并进行归一化;
9、所述数据匹配模块根据用户id将心理数据和行为数据进行匹配和合并,整合到数据集中;
10、所述特征工程模块对数据集进行特征工程处理,包括特征选择、特征变换、特征构建,提取和加工心理特征和行为特征。
11、进一步地,所述关联规则学习模块,包括集合构建模块、集合转换模块、频繁项集挖掘模块、关联规则生成模块、结果解释模块;
12、所述集合构建模块将一组心理特征和行为特征作为项,构建包含所有项的集合,每个用户的用户id、心理特征和行为特征为一个项集;
13、所述集合转换模块将集合转换成垂直数据表示,每组心理特征和行为特征对应一个字典,其中,字典的键是每组心理特征和行为特征的取值,字典的值是对应的所有用户id的列表,所有字典组成转换后的集合;
14、所述频繁项集挖掘模块使用eclat算法对转换后的集合挖掘频繁项集,所述频繁项集是指在所有特征中频繁出现的特征组合,包括初始化模块、候选项树构建模块、递归挖掘模块、输出模块;
15、所述初始化模块初始化一个空的候选项集和一个空的频繁项集,遍历转换后的集合,统计每个字典中值的个数作为支持度,将每个键作为单独的候选项,加入到候选项集中;
16、所述候选项树构建模块设置支持度阈值,筛选出支持度大于等于支持度阈值的候选项作为频繁项,加入到频繁项集中,选择频繁项集中的第一个频繁项作为eclat树的根节点,依次遍历频繁项,构建完整的eclat树,eclat树的节点之间通过连接建立关系;
17、所述递归挖掘模块从eclat树的根节点开始对每个节点进行递归扩展,生成子节点,在递归过程中,将每个节点与它的子节点组合成候选项,计算新生成的候选项的支持度,并根据支持度阈值筛选出频繁项,当无法生成新的子节点时,停止递归,此时eclat树的所有路径遍历完成,无法再产生新的频繁项;
18、所述输出模块将找到的频繁项集输出;
19、所述关联规则生成模块从挖掘得到的频繁项集中生成关联规则,关联规则采用置信度作为衡量关联规则质量的指标,置信度表示关联规则的后项在前提条件下出现的概率,筛选出高置信度的关联规则;
20、所述结果解释模块对生成的关联规则进行评估和分析,确定其是否具有实际意义和可解释性,观察关联规则的置信度、支持度指标,解释心理特征和行为特征之间的关联关系和规律,根据关联规则的含义和实际情况,提出相应的解释和建议。
21、进一步地,所述关联规则生成模块,包括支持度表示模块、置信度计算模块、关联规则筛选模块;
22、所述支持度表示模块将用户之间的匹配关系作为一个关联规则,关联规则由前项和后项组成,关联规则的前项为一个用户的心理特征和行为特征组合,关联规则的后项为与之匹配的另一个用户的心理特征和行为特征组合,关联规则的支持度表示包含关联规则的前项和后项的用户组合比例,所用公式如下:
23、;
24、式中,表示关联规则的支持度,是关联规则的前项,是关联规则的后项,是包含和的频繁项的支持度,是频繁项集的大小;
25、所述置信度计算模块使用置信度衡量关联规则的可信度,表示在出现关联规则的前项时,同时出现关联规则的后项的概率,所用公式如下:
26、;
27、式中,表示关联规则的置信度,表示在出现的情况下出现的概率;
28、所述关联规则筛选模块设定置信度阈值,筛选高置信度的关联规则并输出,提供具有不同心理特征与行为特征的用户之间的潜在关系。
29、进一步地,所述用户匹配模块,包括关联规则匹配模块、候选用户筛选模块、匹配结果生成模块、结果解释和分析模块;
30、所述关联规则匹配模块遍历生成的关联规则,将每个关联规则应用于用户,查看用户是否符合关联规则的前项条件;
31、所述候选用户筛选模块对于满足关联规则前项条件的用户,进一步查找满足关联规则的后项条件的候选用户;
32、所述匹配结果生成模块将满足关联规则前项和后项条件的两个用户作为匹配成功的用户,加入匹配结果列表中;
33、所述结果解释和分析模块分析匹配结果,探索用户与关联规则的匹配程度,将用户后续的成功交往情况反馈到关联规则中。
34、采用上述方案本发明取得的有益效果如下:
35、(1)针对一般的用户数据分析方法存在误差或信息不完整的情况,导致提取的特征不够准确和全面,分析结果的普适性受到限制的问题,本方案通过收集用户的心理数据和行为数据,提取用户的心理特征和行为特征并进行融合分析,更全面地了解用户的个性和行为习惯。
36、(2)针对一般分析用户关联时存在主观性,难以判断和验证无意义的用户关系,且存在偏差或代表性不足,导致匹配结果的不准确和不公平的问题,本方案通过挖掘关联规则,揭示了用户之间潜在的关联关系和行为模式,针对不同用户群体实现个性化的推荐和匹配。
37、(3)针对一般的用户匹配方法缺乏动态调整,无法根据用户的反馈和行为变化及时调整匹配策略,导致难以满足用户的变化需求和期望的问题,本方案基于迭代更新的关联规则进行匹配,更准确地识别用户之间的匹配程度,将用户后续的成功交往情况反馈到关联规则中,实现了系统不断优化匹配策略和关联规则的生成。
1.一种基于数据融合的用户匹配系统,其特征在于:包括数据采集模块,数据融合模块,关联规则学习模块和用户匹配模块;
2.根据权利要求1所述的一种基于数据融合的用户匹配系统,其特征在于:所述关联规则学习模块,包括集合构建模块、集合转换模块、频繁项集挖掘模块、关联规则生成模块、结果解释模块;
3.根据权利要求2所述的一种基于数据融合的用户匹配系统,其特征在于:所述频繁项集挖掘模块包括:初始化模块、候选项树构建模块、递归挖掘模块、输出模块;
4.根据权利要求3所述的一种基于数据融合的用户匹配系统,其特征在于:所述关联规则生成模块,包括支持度表示模块、置信度计算模块、关联规则筛选模块;
5.根据权利要求4所述的一种基于数据融合的用户匹配系统,其特征在于:所述用户匹配模块,包括关联规则匹配模块、候选用户筛选模块、匹配结果生成模块、结果解释和分析模块;
