背景介绍
设计目标
实现不同系统数据的互通,消除数据孤岛。 数据仓库的建设,根据业务活动,分层进行数据的建模。 数据的共享,实现为不同部门提供不同数据的共享能力。 数据质量管理,实现数据全生命周期的质量管理工作。 元数据管理,实现数据之间血缘关系的管理。 数据安全管理,实现不同用户不同的应用权限,对于敏感数据进行脱敏处理,防止数据的泄露和个人信息的被恶意利用。
技术架构

数据仓库建设
1. 总线架构绘制

2. 高层模型建设

3. 维度建模
选择业务过程
声明粒度
确认维度
确认事实

4. ETL设计开发
设计阶段:分析源和目标数据集的数据结构,定义合理的数据转换逻辑。
实施阶段:按照设计阶段制定的逻辑规则进行编码,实现数据的E、T、L过程。
维护阶段:对于非一次性数据整合项目,ETL过程需要重复执行,同时也需要不间断的维护和完善。
数据源的相关属性,包括:实体名称—含DSN、所有者等信息;字段名—英文名称;字段简述—中文名称,如为参数信息应该有相关取值解释,如性别字段(1:男;2:女;0:不详);类型—字段类型,含长度和精度信息;非空属性—字段是否可以为空;
目标数据集的相关属性,包括:实体名称—含DSN、所有者等信息;字段名—英文名称,建议根据字段含义来命名,而不是简单用拼音来定义字段(此部分由负责设计数据集的人员控制);字段简述—中文名称,对于保留字段应该给出默认值;类型—字段类型,含长度和精度信息;非空属性—字段是否可以为空;
规则,主要描述ETL各个环节的转换规则,包括:数据源过滤规则—描述从源数据集获取数据过程中过滤掉记录的规则;关联规则—当源数据集为多个时,描述相互之间的关联关系;列转换规则—描述源数据集到目标数据集的字段间的转换规则(业务逻辑相关);目标数据集更新规则—描述目标数据集的更新策略,包括更新机制和更新频度,如每日全量更新、每周增量更新;
作业名称——实现Mapping的作业名称,包括该作业功能描述;
调度顺序——用序号或者是流程图模式描述作业的调度顺序,需要综合考虑业务逻辑、编码逻辑以及系统资源等多方面情况,在保证业务逻辑和编码逻辑的基础上,通过控制调度,最大限度地合理利用系统资源;
参数列表——列举每个作业中所使用的参数,不同作业中的相同参数最好使用相同的名称,便于调度时进行控制;
数据管理
1. 元数据管理
2. 数据质量管理
准确性:数据不正确或描述对象过期 合规性:数据是否以非标准格式存储 完备性:数据不存在 及时性:关键数据是否能够及时传递到目标位置 一致性:数据冲突 重复性:记录了重复数据
3. 数据安全管理
S4:非业务核心表,删除对于其他计算任务无影响。 S3:非业务核心表,但是删除对于其他计算任务有一定的影响。 S2:业务核心表,仅限本部门使用,删除对于其他部门使用无影响。 S1:业务核心表,删除对于其他部分使用有影响。
数据产生过程中对比较敏感的字段打上专门的标签。 数据的存储对于比较私密的人员信息,像身份证、手机号之类的数据要进行加密存储。 数据使用过程中对于不同的人员要赋予不同的数据获取权限,且如果要获取权限外的数据需要进行申请,审核通过后方可进行使用。 数据传输过程中要通过专门的API接口进行,且需要进行加密处理。 数据的销毁,对于敏感的数据销毁,不能够只做逻辑删除,还要进行物理上的删除。
权限只根据需求进行授权,不能授予超过需求的使用字段及等级。 不允许直接查询底层表,只能查询中间表以上的表。 不允许查询全量数据,只能根据条件进行过滤。 S2级以上的数据,不允许下载。 单次只能申请一张表,不能批量进行申请。

更多精彩干货分享
点击下方名片关注
IT那活儿





