本发明涉及数据处理,尤其涉及一种基于多模态大语言模型的数据处理方法及系统。
背景技术:
1、非结构化文档通常包括文本、图片、表格等多种数据类型,处理这些多模态数据并将其转换为大语言模型能够理解的结构化文本是一个重要的模块。
2、目前通常实用ocr方法进行文本识别,ocr(optical character recognition,光学字符识别)是指电子设备检查纸上打印的字符,通过检测暗、亮的模式确定其形状,然后用字符识别方法将形状翻译成计算机文字的过程;即针对印刷体字符,采用光学的方式将纸质文档中的文字转换成为黑白点阵的图像文件,并通过识别软件将图像中的文字转换成文本格式,供文字处理软件进一步编辑加工的技术。
3、然而,传统的ocr方法往往难以高效处理多模态文档,而新兴的基于多模态大语言模型的端对端方法也难以避免模型幻觉等问题。
4、基于此,本发明提出一种基于多模态大语言模型的数据处理方法及系统。
技术实现思路
1、本发明提供了一种基于多模态大语言模型的数据处理方法,包括:
2、获取非结构化文档输入,对非结构化文档中每个页面进行解析,得到页面模态数据集合;
3、使用多模态大语言模型对页面模态数据集合进行元素综合分析;
4、计算每个页面元素分析结果的可信度;
5、若可信度低于阈值,则调整多模态模型参数进行模型纠错,继续对可信度低于阈值的页面进行元素综合分析,直至可信度不低于阈值;
6、分析每个页面中各元素的排布,生成结构化文档。
7、如上所述的一种基于多模态大语言模型的数据处理方法,其中,对非结构化文档中每个页面进行解析,具体为使用页面分析模型对每个非结构化页面进行分析识别,具体包括:
8、对非结构化页面进行预处理;
9、对预处理后的页面进行特征提取,得到页面特征集合;
10、依据各个页面特征集合属性,选择多个分类模型;
11、将各个页面特征集合输入对应的多个分类模型,并计算各分类模型的最优权重集合,利用各分类模型结果及其最优权重集合,确定最终页面模态集合。
12、如上所述的一种基于多模态大语言模型的数据处理方法,其中,对预处理后的页面进行特征提取,具体包括:
13、将页面分割成多个页面子区域,然后从每个页面子区域中提取每个页面子区域的特征;
14、将页面子区域与其相邻页面子区域依据特征分类进行特征合并,重复进行页面子区域特征合并,最终得到多个分割子页面;
15、对每个分割子页面进行特征提取,得到页面特征集合。
16、如上所述的一种基于多模态大语言模型的数据处理方法,其中,进行特征合并,具体包括:
17、定位与当前页面子区域相邻的所有其他页面子区域;
18、获取当前页面子区域的边缘区域特征,以及与其相邻的其他页面子区域的边缘区域特征;
19、用当前页面子区域的一个边缘区域特征与相邻的其他初步页面结构在预定距离内的特征进行相似度准则比较,将满足预定条件的特征归类,重新划分页面子区域;
20、依次进行上述操作,得到最终分割子页面。
21、如上所述的一种基于多模态大语言模型的数据处理方法,其中,使用多模态大语言模型对页面模态数据集合进行元素综合分析,具体包括如下子步骤:
22、获取每个页面中的不同模态数据;
23、将不同模态数据进行融合处理,得到融合数据;
24、将不同模态数据及其融合数据分别输入大语言模型进行处理,识别每个页面中的元素。
25、本发明还提供一种基于多模态大语言模型的数据处理系统,包括:
26、页面解析模块,用于获取非结构化文档输入,对非结构化文档中每个页面进行解析,得到页面模态数据集合;
27、多模态模型分析模块,用于使用多模态大语言模型对页面模态数据集合进行元素综合分析;
28、模型纠错模块,用于计算每个页面元素分析结果的可信度;若可信度低于阈值,则调整多模态模型参数进行模型纠错,继续对可信度低于阈值的页面进行元素综合分析,直至可信度不低于阈值;
29、结构化文档生成模块,用于分析每个页面中各元素的排布,生成结构化文档。
30、如上所述的一种基于多模态大语言模型的数据处理系统,其中,使用页面分析模型对每个非结构化页面进行分析识别,具体包括:对非结构化页面进行预处理;对预处理后的页面进行特征提取,得到页面特征集合;依据各个页面特征集合属性,选择多个分类模型;将各个页面特征集合属性输入对应的多个分类模型,并计算各分类模型的最优权重集合,利用各分类模型结果及其最优权重集合,确定最终页面模态集合。
31、如上所述的一种基于多模态大语言模型的数据处理系统,其中,对预处理后的页面进行特征提取,具体包括:将页面分割成多个页面子区域,然后从每个页面子区域中提取每个页面子区域的特征;将页面子区域与其相邻页面子区域依据特征分类进行特征合并,重复进行页面子区域特征合并,最终得到多个分割子页面;对每个分割子页面进行特征提取,得到页面特征集合。
32、如上所述的一种基于多模态大语言模型的数据处理系统,其中,进行特征合并,具体包括:定位与当前页面子区域相邻的所有其他页面子区域;获取当前页面子区域的边缘区域特征,以及与其相邻的其他页面子区域的边缘区域特征;用当前页面子区域的一个特征与相邻的其他初步页面结构预定距离内的特征进行相似度准则比较,将满足预定条件的特征归类,重新划分页面子区域;依次进行上述操作,得到最终分割子页面。
33、如上所述的一种基于多模态大语言模型的数据处理系统,其中,使用多模态大语言模型对每个页面结构进行元素综合分析,具体包括如下子步骤:获取每个页面结构中的不同模态数据;将不同模态数据进行融合处理,得到融合数据;将不同模态数据及其融合数据分别输入大语言模型进行处理,识别每个页面结构中的元素。
34、本发明实现的有益效果如下:
35、本发明利用多模态语言模型提高了非结构化文档的处理准确性,还通过内置的自我纠错机制,有效地减少了错误的传递和累积,从而提高了数据处理的整体效率和质量。此方法有广泛前景,特别是在需要高精度文档分析和数据转换的领域,如法律、医疗和科研等。
1.一种基于多模态大语言模型的数据处理方法,其特征在于,包括:
2.如权利要求1所述的一种基于多模态大语言模型的数据处理方法,其特征在于,对非结构化文档中每个页面进行解析,具体为使用页面分析模型对每个非结构化页面进行分析识别,具体包括:
3.如权利要求2所述的一种基于多模态大语言模型的数据处理方法,其特征在于,对预处理后的页面进行特征提取,具体包括:
4.如权利要求3所述的一种基于多模态大语言模型的数据处理方法,其特征在于,进行特征合并,具体包括:
5.如权利要求1所述的一种基于多模态大语言模型的数据处理方法,其特征在于,使用多模态大语言模型对页面模态数据集合进行元素综合分析,具体包括如下子步骤:
6.一种基于多模态大语言模型的数据处理系统,其特征在于,包括:
7.如权利要求6所述的一种基于多模态大语言模型的数据处理系统,其特征在于,对非结构化文档中每个页面进行解析,具体为使用页面分析模型对每个非结构化页面进行分析识别,具体包括:对非结构化页面进行预处理;对预处理后的页面进行特征提取,得到页面特征集合;依据各个页面特征集合属性,选择多个分类模型;将各个页面特征集合输入对应的多个分类模型,并计算各分类模型的最优权重集合,利用各分类模型结果及其最优权重集合,确定最终页面模态集合。
8.如权利要求7所述的一种基于多模态大语言模型的数据处理系统,其特征在于,对预处理后的页面进行特征提取,具体包括:将页面分割成多个页面子区域,然后从每个页面子区域中提取每个页面子区域的特征;将页面子区域与其相邻页面子区域依据特征分类进行特征合并,重复进行页面子区域特征合并,最终得到多个分割子页面;对每个分割子页面进行特征提取,得到页面特征集合。
9.如权利要求8所述的一种基于多模态大语言模型的数据处理系统,其特征在于,进行特征合并,具体包括:定位与当前页面子区域相邻的所有其他页面子区域;获取当前页面子区域的边缘区域特征,以及与其相邻的其他页面子区域的边缘区域特征;用当前页面子区域的一个边缘区域特征与相邻的其他初步页面结构在预定距离内的特征进行相似度准则比较,将满足预定条件的特征归类,重新划分页面子区域;依次进行上述操作,得到最终分割子页面。
10.如权利要求6所述的一种基于多模态大语言模型的数据处理系统,其特征在于,使用多模态大语言模型对每个页面结构进行元素综合分析,具体包括如下子步骤:获取每个页面中的不同模态数据;将不同模态数据进行融合处理,得到融合数据;将不同模态数据及其融合数据分别输入大语言模型进行处理,识别每个页面中的元素。
