| ETL | 抽取-转换-加载(Extract-Transform-Load) | 传统数仓开发流程:从源系统抽数→清洗转换→加载到数仓 |
| ELT | 抽取-加载-转换(Extract-Load-Transform) | 大数据时代主流流程:先将数据加载到数仓(如Hive)→再进行转换,利用大数据引擎算力 |
| CDC | 变更数据捕获(Change Data Capture) | 捕获源系统数据的增量变化(新增、更新、删除),实现增量同步,如基于binlog的CDC |
| 全量同步 | | 将源系统的全部数据一次性同步到数仓,适用于数据量小或初始化场景 |
| 增量同步 | | |
| 拉链表 | | 记录数据历史状态的表,通过生效时间、失效时间字段,保留数据全生命周期变化(如用户状态拉链表) |
| SCD | 缓慢变化维度(Slowly Changing Dimension) | 处理维度表数据变化的策略: - SCD1:直接覆盖旧数据,无历史记录 - SCD2:新增行记录,保留历史(拉链表的核心原理) - SCD3:新增字段记录历史,适用于少量维度变化 |
| 分区表 | | 按照字段(如日期、地域)将表划分为多个分区,查询时只扫描指定分区,提升效率 |
| 分桶表 | | 对分区内的数据进一步哈希分桶,用于高效抽样和关联查询 |
| 物化视图 | | 预计算并存储查询结果的视图,避免重复计算,提升查询速度 |
| 临时表 | | 开发过程中临时存储中间结果的表,任务结束后自动删除 |
| 整合 | | 将多个异构源系统(如业务库、日志、第三方接口)的数据按业务逻辑融合,消除数据孤岛,形成统一数据集,是DWB层核心操作 |
| 数据拉通 | | 打通不同业务、不同系统的数据链路,实现核心维度(如用户ID、商品ID)的统一关联,让分散数据可串联分析 |