暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

论企业数据治理的价值输出-数据资产目录(上)

Datablau 2019-10-10
609

引言:数据治理的价值是什么?由于数据治理是项基础工作,而不是某个具体的业务价值,所以数据治理的价值是一直萦绕在这个领域的一大难题。 


    传统数据治理主要是在元数据管理上,对物理数据库进行元数据采集,之后进行业务元数据补全。数据管理部门采购了元数据管理系统,花了大量人力、物力来实施,最终元数据管理系统上线后常常仅供IT部门内部的少数几个人使用,常常被垢病数据治理的投入“不值”。随着时间流逝,新上线的业务系统数据库及已有业务系统数据库的更新迭代,仍然需要大量维护工作,而这里的元数据最终服务的仍只是IT部门内部少数几个人,导致过去的数据治理项目失败率很高。其中一个原因是没有从源头进行管控,可参阅之前的文章《从数据标准到数据库设计:解决基础数据标准落地的最后一公里难题》(点击查看)。本文重点论述面向价值输出的数据治理-数据资产目录。


    2018-2019年是西方的数据目录元年,在过去三年,Gartner进行了近1000个关于数据目录的调研,每年300%的增长。 以下是关于数据目录的定义:


Data Catalog: Definition

A data catalog creates and maintains an inventory of data assets through the discovery, description and organization of distributed datasets. The data catalog provides context to enable data stewards, data/business analysts, data engineers, data scientists and other line of business (LOB) data consumers to find and understand relevant datasets for the purpose of extracting business value. Modern machine-learning-augmented data catalogs automate various tedious tasks involved in data cataloging, including metadata discovery, ingestion, translation, enrichment and the creation of semantic relationships between metadata. These next-generation data catalogs can therefore propel enterprise metadata management projects by allowing business users to participate in understanding, enriching and using metadata to inform and further their data and analytics initiatives.



数据目录的使用者有哪些角色的人
  • 数据管理者
  • 分析人员/数据科学家
  • 数据工程师
  • 业务线数据消费者        


数据目录的核心能力
  • 查找 - 理解 - 可信(数据资产的语境)
  • 机器学习
  • 数据特征
  • 数据洞察 - 补充完善语义关联关系
  • 业务人员参与反馈


数据目录与政府数据资源目录的区别
  • 国内政府数据资源目录面向跨机构的数据共享交换。
  • DataCatalog数据资产目录,面向企业数据业务价值应用,探索数据价值,业务场景,关联关系,数据使用者反馈,相关知识沉淀。

数据目录与元数据的区别 
  • 业务视角,多业务视角多角色的数据目录。
  • 有“数据消费者”角色。



如何做到以业务为中心的数据服务?我们以餐厅打个比喻:

过去:食客点完菜,需要等厨师去市场里找菜,买菜,摘菜,洗菜,配菜,炒菜。显然食客等不了,餐厅也经营不下去。
这里您也需要思考一下:
  • 企业的数据消费者都是哪些人?
  • 数据处理部门、数据治理部门在企业数据战略当中是如何定位的?
  • 能让客户“自助炒菜”吗?离“自助炒菜”还有多远?

现在:统一采购菜,清洗&质检,食客点完菜需要等厨师找菜,配菜,炒菜。新的流程加速了从点菜到炒菜的周期,餐厅可以运转了。可以做的更好吗?

将来:集中采购,集中清洗与质检,集中配菜;食客点菜,厨师取半成品,炒菜

整个数据为中心的数据服务流程的几个关键点:
  • 摘菜(数据开发):流程运转稳定顺畅,通过大数据平台来保证,IT人员最熟悉的领域。
  • 质量:逐步通过对数据源数据模型管控从源头管控。避免费时费力的数据清洗工作。
  • 配菜(菜的半成品):组织面向业务场景的数据集市,通过数据资产目录输出点的菜的半成品在哪里?新的需求如何反馈?前期存量数据资产盘点,后期通过数据资产目录持续沉淀相关数据资产知识。
  • 炒菜:关键在于企业的组织结构和文化,需要既懂业务又懂数据的人,建议企业设立数据架构,数据管理,数据分析的组织结构,及人人都是数据分析师的企业文化。


下一篇,让我们来具体介绍一下数据资产目录的构建方法和实践经验。


关于Datablau
Datablau创建于2016年,核心创始和研发团队全部来自于原CA erwin,天然具有世界级产品厂商的血缘和水准,是国内数据治理的第一品牌。依托多年的行业积累和技术沉淀,Datablau在产品设计层面充分发挥了后天优势,实现了集数据建模、数据目录、数据质量和数据准备为一体的企业级数据治理平台,全面满足企业对于数据治理的客观需求。
目前Datablau在嘉实基金、中国人寿、国电大渡河和四川航空等大型客户得到实际应用并深受好评,客户范围已经覆盖到银行、保险、制造业和能源行业等核心领域,Datablau已成为企 业数据治理领域的领导厂商。

原创文章作者
王琤Allen  CEO
曾任CA ERwin全球研发负责人,2006年加入CA,十几年经验在数据建模领域,客户多来自世界500强、美国银行(BOA)、SunTrust、AT&T、壳牌等深度参与建设银行新一代系统数据模型设计。多项专利和论文关于统一(关系型与非关系型)数据建模。复旦大学、北京航空航天大学 客座讲师。IEEE member、 OMG member、DAMA member。
延伸阅读
数据管理中的语义智能关键技术
【CIO峰会】精华分享:数据管理的未来
基础数据标准落标白皮书(上)
基础数据标准落标白皮书(下)
数据建模-今天还需要数据建模吗
文章转载自Datablau,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论