用于增强组合泛化能力的生成跨语言文本的方法和系统与流程

专利2026-07-26  6


本申请涉及自然语言处理,尤其涉及一种用于增强组合泛化能力的生成跨语言文本的方法和系统。


背景技术:

1、组合泛化(compositional generalization)的目标是让模型能够基于已知的有限的知识,来理解和推断未知组合意义的能力,是分布外泛化的(out-of-distributiongeneralization)的一个子研究问题。比如,模型利用训练数据已经学会red car和smalldog的翻译,而让模型能够分解并推断出small car和red dog的翻译,就是组合泛化的研究范畴。近年来,基于神经网络的序列到序列(sequence-to-sequence)模型,比如transformer,在自然语言处理上取得了巨大的进展,但同时也发现无论是任务特定的还是基于预训练模型的加持,模型在组合泛化能力上仍存在很大的局限性,也就是说,尽管模型可能在训练中见过多种方式的组合,在推理阶段面对训练中未曾见过的语言组合时,也经常会做出错误的预测。

2、面对这样的缺陷,研究者最直接的做法是引入一些新的模块或者新的训练算法,以期提升模型的组合泛化能力。比如dangle-transformer模型在每次解码时动态地重新编码源端语义表示,来达到将表示解耦合的目的。而edge-transformer模型则是将传统标量的注意力机制建模为了向量,从而一定程度上增强了模型的推理和组合泛化能力。另一种方式,例如maml-transformer模型,则是将训练范式由监督学习换成基于梯度的元学习,强化模型的分布外泛化能力。

3、但诸如dangle-transformer或edge-transformer这类通过引入额外的模块或者机制的技术方法会显著地增加训练和测试的开销,例如上述两个模型的计算复杂度都为 o(n3),在处理长序列时模型的效率显著低于原本的transformer模型,因此限制了模型的应用空间。maml-transformer模型虽然没有改变模型框架,但仍需要在训练中构建符合元学习范式的数据采样方式,优化过程更为复杂,涉及到二次微分,并且对最终组合泛化性能的提升也较为有限。因此,现有技术中尚未发现能够在不必改变原有模型框架的前提下,也不过度增加模型训练的开销,同时还能够显著增加模型的组合泛化能力的技术方案。


技术实现思路

1、提供本申请以解决现有技术中存在的上述缺陷。需要一种用于增强组合泛化能力的生成跨语言文本的方法和系统,其能够使学习模型适应更多新颖的组合输入,从而在为源语言文本生成跨语言文本时具有更强的组合泛化能力。

2、根据本申请的第一方案,提供一种用于增强组合泛化能力的生成跨语言文本的方法,包括由处理器接收用户输入的待生成跨语言文本的源语言文本;基于所接收的源语言文本,利用训练好的第一学习模型,生成目标跨语言文本,所述第一学习模型基于包含源语言文本-跨语言文本语句对的训练数据集进行训练,其中,至少部分语句对关联有基于训练数据集生成的上下文;以及,在为训练数据集中的第一语句对生成上下文时:对所述第一语句对的源语言文本中的第一级别的语言单元进行第一随机扰动以生成第一源语言文本集;在所述训练数据集中确定多个第二语句对,并对各个第二语句对的源语言文本中的第一级别的语言单元进行第一随机扰动,以生成对应的第二源语言文本集;基于所述第一源语言文本集和各个第二源语言文本集,计算所述第一语句对与各个第二语句对之间的组合相似度,并基于所述组合相似度确定至少部分第二语句对的集合作为第一语句对关联的上下文。

3、根据本申请的第二方案,提供一种用于增强组合泛化能力的生成跨语言文本的系统,包括接口,其配置为获取用户输入的待生成跨语言文本的源语言文本。所述系统还包括处理器,其配置为执行根据本申请各个实施例所述的用于增强组合泛化能力的生成跨语言文本的方法的各种操作。

4、根据本申请的第三方案,提供一种非暂时性计算机可读存储介质,其上存储有计算机可执行指令,所述计算机可执行指令由处理器执行时,实现根据本申请各个实施例的用于增强组合泛化能力的生成跨语言文本的方法的各种操作。

5、本申请各个实施例提供的用于增强组合泛化能力的生成跨语言文本的方法、系统和介质,其通过基于原有训练数据集为训练语句对生成上下文的方式,使得学习模型能够在训练中见到组合的多种可能性并高效地学习到组合的内在规则,从而实现在不必改变模型的原有架构和训练方式,也不过度增加模型训练的复杂度和开销的情况下,能够显著提升模型的组合泛化能力,使得模型能够在接收到包含新颖组合的源语言文本时,能够为其生成更准确、更合理的目标跨语言文本。

6、上述说明仅是本申请技术方案的概述,为了能够更清楚了解本申请的技术手段,而可依照说明书的内容予以实施,并且为了让本申请的上述和其它目的、特征和优点能够更明显易懂,以下特举本申请的具体实施方式。

7、应当理解,前面的大体描述以及后续的详细描述只是例示性的和说明性的,并非对所要求保护的本发明的限制。



技术特征:

1.一种用于增强组合泛化能力的生成跨语言文本的方法,其特征在于,包括,由处理器:

2.根据权利要求1所述的方法,其特征在于,基于所述第一源语言文本集和各个第二源语言文本集,计算所述第一语句对与各个第二语句对之间的组合相似度,并基于所述组合相似度确定至少部分第二语句对的集合作为第一语句对关联的上下文具体包括:

3.根据权利要求1或2所述的方法,其特征在于,在所述训练数据集中确定多个第二语句对具体包括:

4.根据权利要求1或2所述的方法,其特征在于,所述方法还包括:在所述语句对关联有上下文的情况下,

5.根据权利要求1或2所述的方法,其特征在于,所述第一级别的语言单元为词或词组;

6.根据权利要求5所述的方法,其特征在于,所述方法还包括:

7.根据权利要求6所述的方法,其特征在于,

8.根据权利要求1或2所述的方法,其特征在于,所述方法进一步包括:

9.一种用于增强组合泛化能力的生成跨语言文本的系统,其特征在于,包括:

10.一种非暂时性计算机可读存储介质,其上存储有计算机可执行指令,所述计算机可执行指令由处理器执行时,实现根据权利要求1-8中任何一项所述的用于增强组合泛化能力的生成跨语言文本的方法。


技术总结
本申请涉及一种用于增强组合泛化能力的生成跨语言文本的方法和系统。所述方法包括接收用户输入的待生成跨语言文本的源语言文本;基于所接收的源语言文本,利用训练好的第一学习模型生成目标跨语言文本。第一学习模型基于包含源语言文本‑跨语言文本语句对的训练数据集进行训练,至少部分语句对关联有基于训练数据集生成的上下文;在对训练数据集中的第一语句以及多个第二语句对的相同级别语言单元进行随机扰动基础上,计算第一语句对与各个第二语句对的组合相似度,由此确定第二语句对的集合作为第一语句对关联的上下文。本申请能够使学习模型适应更多新颖的组合输入,从而在为源语言文本生成跨语言文本时具有更强的组合泛化能力。

技术研发人员:尹永竞,颜建昊,张岳,朱宪超
受保护的技术使用者:四川语言桥信息技术有限公司
技术研发日:
技术公布日:2024/7/25
转载请注明原文地址: https://bbs.8miu.com/read-442968.html

最新回复(0)