
数据网格(Data Mesh)和数据经纬(Data Fabric)到底是当今最伟大的倡议之一,还是拉动销售额的最新流行语?
要准确地判断,很难。但从另一角度想,所有这些新兴的企业级举措都有共同的目标——处理多元异构数据。如果能灵活利用不同数据,且无需复制或移动数据,其将产生的宝贵价值是显而易见的。
我们知道,数据网格和数据经纬采取的方法不同,应对的数据问题也不尽相似。它们都注重元数据和语义层,以及利用多数据源进行分析,主要的区分似乎在于上下文背景:
● 通俗而言,数据网格关乎向分析引擎提供各种数据源的能力。使用这一技术的前提是,您需要确保源数据文件的结构及背景坚实可靠,要明确知道是谁、何时、何地、为何以及如何创建数据,因为数据网格受到数据策略的直接影响。比如,分析您所在公司数据仓库的数据,这是一个原始元数据定义相当明确的用例。
● 数据经纬的重点则在于数据协调/调度、元数据管理,以及新增额外的上下文背景。其中语义层管理是重点,您需要使用语义层来表示关键的企业数据,并围绕数据开发通用语言。因为它可以将复杂数据映射为大家所熟悉的业务术语,比如产品、客户或收入,以提供跨整个组织的、统一、综合的数据视图。生物制药试验是可以使用数据经纬的好例子,所有数据来自机器、报告及其他研究组合,几乎没有准确的元数据可以依赖。这类数据也可能非常“稀疏”,大量的行列可能都是空白的。
可以确定的是,当前还没有打包的数据网格或数据经纬解决方案。截至本文发出时,还没有一个一站式的数据网格及数据经纬商店出现。换言之,它们并非成熟的软件商品,需要您通过多种解决方案并行推进。
不过,您可以用自己的技术,来创建专属于您企业的数据网格或数据经纬。比如:
👈🏻 向左移动解锁更多 👈🏻
数据网格是一种高效访问不同数据的方法,尤其是当数据源都不同的时候,其效果异常显著。以下是适用于数据网格的数据形式:
具备结构性
维度变化不大
没有“稀疏”数据
如果说数据网格存在任何弱点,那就是上下文背景的缺失。如果您的分析需要回应“根据谁”的问题,那么数据经纬可以更有力地解释这一点。
当数据工程师在将所有来源整合在一起时,经常会遇到数据“打架”的情况。例如新系统表示客户的年龄是 32,而传统数据则表示同一个客户的年龄是 30。数据脉络(Data lineage)是数据经纬的附加功能之一,用以帮助确定您应该更信任哪个数据源。
数据经纬解决方案倾向于利用更多工具,来解决不同数据之间的统一性问题。这些工具通常非常“优雅”,但比数据网格更为复杂。它们可能包括更大的转换能力、增强的细粒度安全性、受管理的可视化界面和前后脉络。但它同样存在局限性,那就是您需要花费更多精力来创建并管理语义层。
那些兜售数据经纬的供应商经常宣传知识图谱(knowledge graph)的功能。它用结构化和非结构化数据的语义表示,取代了数据网格的数据整合策略,通常能更好支持多个模式及其变化的维度。
现在的数据,往往被打散遍布于各种数据库、数据仓库和数据湖。而云数据库在访问外部数据方面的表现,天差地别。
某些解决方案要求数据以特定格式存储于数据仓库中,并不提供对数据湖的支持;还有一些支持数据湖,但需要采购多种工具来实现。
如果您能找到一个既能处理常见格式(如 ORC、PARQUET、AVRO、JSON)又能在日常分析中优雅、快速地利用所有数据来源,同时还能整合组织中现有其他数据库的解决方案(通过数据虚拟化实现),那是再好不过了。
遍寻最佳数据分析解决方案而不着?别犹豫了,Vertica 将是您的理想之选。
分享 就是爱 ⎪ 我知道你 在看 哦






