货拉拉大数据元数据管理体系演进和实践
元数据管理平台介绍
背景介绍
1. 货拉拉大数据体系
2. 元数据管理平台
3. 元数据管理平台建设过程
4. 元数据管理平台系统架构
元数据管理平台实践
1. 数据血缘
数据源:血缘数据主要来源于研发平台和指标报表等系统。
执行引擎:数据通过 Hive、Spark 等大数据处理引擎进行执行。
血缘捕获:通过 hook 机制,我们在 SQL 执行过程中捕获并解析输入输出表的信息,随后将这些血缘信息推送到下游系统供其使用。
非 SQL 链路处理:针对 MySQL 到 Hive、Hive 到下游终端等非 SQL 数据链路,我们预先定义了一套标准的格式,要求各业务系统按照此格式将他们的血缘关系推送到离线血缘数据仓库中。
数据存储:采集到的血缘数据通过定时调度进行解析,并存储至 MySQL 数据库中。
血缘更新:我们以产生血缘的调度任务为单位进行血缘的更新。当新版本血缘生成时,旧版本血缘将被替换。
增量更新机制:我们新增了一个实时血缘解析模块,该模块替代了原有的定时更新机制,实现了近实时的增量更新。
调度任务变更上报:由于大多数血缘信息是由调度任务产生的,我们引入了调度任务变更上报机制。当任务发生下线或 SQL 更新时,这些信息能够及时反映到血缘数据中,提高了血缘更新的时效性。
图数据库 Neo4J:为了支撑更大量级的字段级血缘查询,我们将存储从 MySQL 升级为 Neo4J 图数据库。Neo4J 的强大性能支持了 10 层以上的节点查询,这对许多分析类场景至关重要。
2. AI 智能检索
问题增强:在向量化检索前,对复杂问题进行拆分或语义增强,以捕捉更多相关信息。例如,将“订单宽表中,这两个字段,哪个字段表示司机实际收入”这个问题拆分为多个子问题分别检索,从而提高信息覆盖率和回答准确性。
重排序优化:通过引入轻量级模型对检索结果进行重排序,筛选出与用户问题匹配度最高的前 N 条记录(如 TOP10)再送入大模型处理,以减少大模型处理时间,同时避免信息过载。
3. 支撑成本治理场景
资产可视化度量:利用元数据构建资产全景图,实现成本在资产层面的可视化展示,清晰呈现成本分布与流向。
辅助治理能力:针对存储和计算层面的资源浪费,提供一系列技术能力,帮助减少资源使用。
健康度导向的成本运营:建立成本健康度评估体系,定期监测成本水位,确保成本使用合理且高效,同时指导成本优化策略的制定与实施。
4. 数据安全场景
库表安全场景:依赖自研的库表权限系统可进行权限的申请与查询,实现有效期的管理;后台任务方面使用的底层策略是 Rager,鉴权服务方面已经实现劣迹鉴权的应用。
数据下载场景:依托自研的大数据研发平台,可以进行 SQL 查询与数据下载,同时 ETL 的离线任务也在此平台实现。
公开数据(C1):已通过正规渠道正式对外发布的数据,不会对公司造成影响的数据;这部分数据基本无价值,可外部公开
限制数据(C2):不适合对外公开,但是对内部人员访问基本无限制的数据,一旦发生泄露,不会对数据主体造成直接损害;这部分数据有低价值,公司内部可基本无限制访问
商业秘密(C3):公司专有或公司保密的,一旦发生泄露,将显著影响相关业务的开展,对数据主体造成直接或者间接损害;这部分数据有中价值间接利用,公司内部限于相关人员按规使用
核心秘密(C4):具有最高安全属性要求,一旦发生泄露,可能导致公司法律或商业上造成重大影响和损失;这部分数据最重要关乎用户敏感数据,高价值可直接利用,限于公司重要部门特定人员授权使用
增量数据:针对单个库表分级达标,用户可以通过元数据服务进行建表,建表后通过审批,审批后进行元数据更新,这一批更新的元数据会异步发布到 Kafka,通过定级系统进行消费数据,并进行算法打标,打标主要依据字段名称以及字段备注信息进行打标,打标完成后将此批数据返回给 Kafka,然后在元数据服务系统进行 Kafka 服务,以进行元数据更新;
存量数据:设置定时任务每天进行全表扫描,后发送给 Kafka,经定级系统进行消费数据,并进行算法打标,打标后返回 Kafka,并在元数据服务系统进行 Kafka 服务,以更新元数据。
入职多少天内不能申请任何数据;
入职不满多少天,严格限制了申请 C3 及以上等级的数据,只能申请 C1、C2 等级的数据;
外包、实习生、兼职类别人员只能申请 C1、C2 的数据,不能申请 C3 及以上数据权限。
敏感数据:针对 C3、C4 级的敏感数据使用,需要上级+大数据或安全部门人员进行审批;
非敏感数据:非敏感数据单日小于等于多少条是不需审批的;单日大于多少条数据,才采用上级+部门负责人审批的方式。
安全等级打标传染:通过血缘的传染能力给它的下游数据进行打标,提高库表分级的准确率;
数据加密治理:对存量敏感数据漏打标情形进行识别,如个人信息,并进行批量打标、加密,以保障数据安全;
数据灾备:通过元数据打标,实现数据自动灾备。
未来规划
更高效的检索服务:进一步优化和探索 AI 大模型在数据检索领域的应用,更好的识别用户意图并更好的回答。
数据血缘标准化:数据血缘建立标准的 SDK,减少重复造轮子;提高数据血缘质量度量的准确率,以便于数据分析。
自动化成本治理:持续降本,尽可能多的步骤实现自动化处理,减少一些不必要的成本。
点个在看你最好看