一种基于分布式计算的数据依赖挖掘方法及系统

    公开(公告)号:CN109325062B

    公开(公告)日:2020-09-25

    申请号:CN201811061441.7

    申请日:2018-09-12

    Inventor: 王宏志 张翔熙

    Abstract: 本发明涉及数据处理技术领域,提供了一种基于分布式计算的数据依赖挖掘方法及系统,其中方法包括:数据重分配步骤、根据原始数据集生成属性相似倒排表;一阶依赖挖掘步骤、根据所述属性相似倒排表挖掘一阶数据依赖关系;高阶依赖挖掘步骤、逐级进行高阶数据依赖关系的挖掘,其中生成高阶数据依赖候选集,并基于挖掘的低阶数据依赖关系对高阶数据依赖候选集进行剪枝,利用属性相似倒排表对剪枝后的高阶数据依赖候选集中的高阶数据依赖关系进行验证。本发明通过生成属性相似倒排表,并采用递推式的数据依赖关系挖掘方式,使得数据依赖挖掘的可靠性和准确性更高。

    一种基于分布式计算的数据依赖挖掘方法及系统

    公开(公告)号:CN109325062A

    公开(公告)日:2019-02-12

    申请号:CN201811061441.7

    申请日:2018-09-12

    Inventor: 王宏志 张翔熙

    Abstract: 本发明涉及数据处理技术领域,提供了一种基于分布式计算的数据依赖挖掘方法及系统,其中方法包括:数据重分配步骤、根据原始数据集生成属性相似倒排表;一阶依赖挖掘步骤、根据所述属性相似倒排表挖掘一阶数据依赖关系;高阶依赖挖掘步骤、逐级进行高阶数据依赖关系的挖掘,其中生成高阶数据依赖候选集,并基于挖掘的低阶数据依赖关系对高阶数据依赖候选集进行剪枝,利用属性相似倒排表对剪枝后的高阶数据依赖候选集中的高阶数据依赖关系进行验证。本发明通过生成属性相似倒排表,并采用递推式的数据依赖关系挖掘方式,使得数据依赖挖掘的可靠性和准确性更高。

Patent Agency Ranking