一种基于流数据和批数据协同调度处理的数据湖系统

    公开(公告)号:CN115599524A

    公开(公告)日:2023-01-13

    申请号:CN202211329376.8

    申请日:2022-10-27

    Abstract: 本发明涉及一种基于流数据和批数据协同调度处理的数据湖系统,属于数据处理技术领域;解决现有技术在构建数据湖或对数据湖中的数据进行处理时无法实现流数据与批数据处理任务的混合编排,效率低的问题;本发明的数据湖系统包括:集中式存储模块、计算引擎模块和数据管理模块;其中,集中式存储模块用于分类存储各个业务数据源的数据;数据管理模块用于进行数据处理任务编排,并基于预设的数据处理任务协同调度方法,对每个节点的数据处理任务进行调度处理;计算引擎模块用于基于数据处理任务需求,通过不同的计算引擎对集中式存储模块中的数据进行处理,并将处理后的数据基于数据处理任务的需求进行推送或存入集中式存储模块中。

    一种分布式流计算引擎
    2.
    发明公开

    公开(公告)号:CN118113424A

    公开(公告)日:2024-05-31

    申请号:CN202311844662.2

    申请日:2023-12-28

    Abstract: 本发明涉及一种分布式流计算引擎,包括:控制节点模块,计算节点模块和Zookeeper集群模块;计算节点模块包括多个物理计算节点,用于监测和执行对应的流计算任务;Zookeeper集群模块部署在多个服务器上,用于存储多个物理计算节点的所有状态信息和任务信息,以供计算节点模块和控制节点模块进行实时监控调用;控制节点模块用于基于流处理任务生成有向无环图;并将待执行的任务按照有向无环图中的对应关系下发到对应的物理计算节点进行处理,并基于每个物理计算节点的资源信息进行任务调度,以实现流数据的低延时处理。本发明解决了现有技术中的流数据处理由于硬件资源受限导致数据处理瓶颈,进而引起数据处理延迟的问题。

    一种基于元数据管理的数据血缘分析系统和方法

    公开(公告)号:CN115757655B

    公开(公告)日:2023-07-07

    申请号:CN202211424823.8

    申请日:2022-11-14

    Abstract: 本发明涉及一种基于元数据管理的数据血缘分析系统和方法,属于大数据技术领域。本发明通过获取多个数据源的原始数据,基于清洗规则进行清洗处理,得到清洗后数据;基于数据规范规则对清洗后数据进行规范化处理,得到规范数据;所述数据规范规则包括标准代码映射库和规范化规则;使用数据集成算法集成所述规范数据得到集成后数据;构建元数据管理体系;基于元数据管理体系进行数据的血缘分析并存储到图数据库。本发明提供的血缘分析系统和方法,对异地、异构数据做到表字段级别的血缘分析,支持快速准确的对数据质量回溯和定位问题,实现了对数据、数据源、API、清洗规则、数据标准、应用和管理全要素血缘关系展示。

    一种基于流数据和批数据协同调度处理的数据湖系统

    公开(公告)号:CN115599524B

    公开(公告)日:2023-06-09

    申请号:CN202211329376.8

    申请日:2022-10-27

    Abstract: 本发明涉及一种基于流数据和批数据协同调度处理的数据湖系统,属于数据处理技术领域;解决现有技术在构建数据湖或对数据湖中的数据进行处理时无法实现流数据与批数据处理任务的混合编排,效率低的问题;本发明的数据湖系统包括:集中式存储模块、计算引擎模块和数据管理模块;其中,集中式存储模块用于分类存储各个业务数据源的数据;数据管理模块用于进行数据处理任务编排,并基于预设的数据处理任务协同调度方法,对每个节点的数据处理任务进行调度处理;计算引擎模块用于基于数据处理任务需求,通过不同的计算引擎对集中式存储模块中的数据进行处理,并将处理后的数据基于数据处理任务的需求进行推送或存入集中式存储模块中。

    一种基于元数据管理的数据血缘分析系统和方法

    公开(公告)号:CN115757655A

    公开(公告)日:2023-03-07

    申请号:CN202211424823.8

    申请日:2022-11-14

    Abstract: 本发明涉及一种基于元数据管理的数据血缘分析系统和方法,属于大数据技术领域。本发明通过获取多个数据源的原始数据,基于清洗规则进行清洗处理,得到清洗后数据;基于数据规范规则对清洗后数据进行规范化处理,得到规范数据;所述数据规范规则包括标准代码映射库和规范化规则;使用数据集成算法集成所述规范数据得到集成后数据;构建元数据管理体系;基于元数据管理体系进行数据的血缘分析并存储到图数据库。本发明提供的血缘分析系统和方法,对异地、异构数据做到表字段级别的血缘分析,支持快速准确的对数据质量回溯和定位问题,实现了对数据、数据源、API、清洗规则、数据标准、应用和管理全要素血缘关系展示。

Patent Agency Ranking