暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

数仓行业黑话大全

会飞的一十六 2026-01-15
100

 基础概念类

黑话
全称/含义
应用场景
数仓
数据仓库(Data Warehouse)
面向分析的、集成的、非易失的、随时间变化的数据集合,用于支持决策制定
数据集市
Data Mart
数仓的子集,面向特定业务线(如销售、财务),粒度更细、更贴近业务
事实表
Fact Table
存储业务过程的度量值(如销售额、订单量),通常是数值型,可聚合;按业务场景分为事务事实表、周期快照表、累计快照表等
周期快照表
Periodic Snapshot Table
事实表的细分类型,按固定周期(日、周、月)记录业务实体的状态快照(如每日库存快照、每月用户资产快照),用于分析状态变化趋势
累计快照表
Accumulating Snapshot Table
事实表的细分类型,记录业务过程全生命周期的关键时间点和度量值(如订单创建时间、支付时间、发货时间、确认收货时间),适用于有明确流程阶段的业务(如订单履约、项目管理)
维度表
Dimension Table
存储描述性信息(如时间、地域、用户),用于对事实表进行切片和分析
星型模型
Star Schema
以事实表为中心,多个维度表直接关联事实表的模型,结构简单、查询高效
雪花模型
Snowflake Schema
星型模型的扩展,维度表可进一步拆分出子维度表,层级更复杂,节省存储空间
粒度
Granularity
数据的细化程度,比如订单粒度、用户粒度、日粒度
指标
Metric/KPI
对业务的量化衡量,如日活用户数、转化率、客单价
口径
Caliber
指标的计算规则和统计范围,是数据一致性的核心(如“新用户”的定义)
原子指标
Atomic Metric
最基础、不可拆分的指标,直接反映业务原始度量,无任何维度限定(如“订单金额”“订单数”)
派生指标
Derived Metric
基于原子指标,通过添加维度、统计周期等限定条件得到的指标(如“2025年1月华东地区订单金额”“近7日订单数”)
衍生指标
Derived Indicator
由多个原子指标或派生指标通过计算逻辑组合得到的指标,反映业务关联关系(如“客单价=订单金额/订单数”“转化率=成交用户数/访客数”)

二、 分层架构类

黑话
全称/含义
应用/特点
ODS
操作数据存储(Operational Data Store)
数仓最底层,直接承接源系统数据,结构与源系统一致,保留原始数据
DWD
数据仓库明细层(Data Warehouse Detail)
对ODS层数据进行清洗、去重、标准化,保留明细数据,是数仓的基础明细层
DWB
数据仓库基础层(Data Warehouse Base)
对DWD层数据进行整合、关联、宽表化,构建主题域模型(如用户主题、订单主题),是数仓的核心整合层
DWS
数据仓库汇总层(Data Warehouse Service)
对DWB层数据进行轻度汇总,生成常用的聚合指标(如用户近7日消费额),供上层快速调用
ADS
应用数据服务层(Application Data Service)
数仓最上层,面向具体业务需求,生成最终的报表、仪表盘数据,直接供BI或业务系统调用
主题域
Subject Area
按照业务逻辑划分的数据集,如用户域、商品域、交易域、营销域
宽表
Wide Table
整合多个维度和事实的大表(通常由多表关联生成),减少下游关联查询次数,提升查询效率,常见于DWB层,如用户360°画像宽表
窄表
Narrow Table
字段较少、结构单一的表,通常是明细层的基础表

三、 开发流程类

黑话
全称/含义
应用/特点
ETL
抽取-转换-加载(Extract-Transform-Load)
传统数仓开发流程:从源系统抽数→清洗转换→加载到数仓
ELT
抽取-加载-转换(Extract-Load-Transform)
大数据时代主流流程:先将数据加载到数仓(如Hive)→再进行转换,利用大数据引擎算力
CDC
变更数据捕获(Change Data Capture)
捕获源系统数据的增量变化(新增、更新、删除),实现增量同步,如基于binlog的CDC
全量同步
Full Sync
将源系统的全部数据一次性同步到数仓,适用于数据量小或初始化场景
增量同步
Incremental Sync
只同步源系统新增或变化的数据,减少传输和计算成本
拉链表
Zipper Table
记录数据历史状态的表,通过生效时间、失效时间字段,保留数据全生命周期变化(如用户状态拉链表)
SCD
缓慢变化维度(Slowly Changing Dimension)
处理维度表数据变化的策略:
- SCD1:直接覆盖旧数据,无历史记录
- SCD2:新增行记录,保留历史(拉链表的核心原理)
- SCD3:新增字段记录历史,适用于少量维度变化
分区表
Partition Table
按照字段(如日期、地域)将表划分为多个分区,查询时只扫描指定分区,提升效率
分桶表
Bucket Table
对分区内的数据进一步哈希分桶,用于高效抽样和关联查询
物化视图
Materialized View
预计算并存储查询结果的视图,避免重复计算,提升查询速度
临时表
Temporary Table
开发过程中临时存储中间结果的表,任务结束后自动删除
整合
Data Integration
将多个异构源系统(如业务库、日志、第三方接口)的数据按业务逻辑融合,消除数据孤岛,形成统一数据集,是DWB层核心操作
数据拉通
Data Connection
打通不同业务、不同系统的数据链路,实现核心维度(如用户ID、商品ID)的统一关联,让分散数据可串联分析

四、 数据质量类

黑话
全称/含义
应用/特点
脏数据
Dirty Data
不符合业务规则的数据,如格式错误、值异常、重复数据
数据倾斜
Data Skew
数据分布不均匀,导致计算节点负载不均(如某一个key的数据量占比90%),是大数据计算的常见问题
重复数据
Duplicate Data
同一批数据多次加载或处理导致的重复记录
空值率
Null Rate
字段中空值的占比,是数据完整性的重要指标
一致性
Consistency
同一指标在不同场景下的计算结果一致,核心是口径统一
完整性
Completeness
数据的覆盖程度,如源系统数据是否全部同步到数仓
准确性
Accuracy
数据与真实业务情况的吻合程度,如订单金额与业务系统一致
时效性
Timeliness
数据从产生到可用于分析的时间间隔,如T+1、T+0(实时)
数据校验
Data Validation
验证数据质量的过程,如主键唯一性校验、字段值域校验

五、 运维监控类

黑话
全称/含义
应用/特点
跑批
Batch Running
批量执行数据处理任务,通常是定时任务(如每日凌晨跑批T-1数据)
重跑
Rerun
任务失败或数据错误后,重新执行数据处理任务
挂掉
Task Failure
数据任务因资源不足、依赖缺失、代码错误等原因停止运行
延迟
Delay
任务未在规定时间内完成,导致下游数据无法按时产出
告警
Alert
任务失败、数据质量异常时触发的通知(如邮件、短信、钉钉告警)
血缘分析
Data Lineage
追踪数据的来源、加工过程、去向,用于问题排查、影响范围分析
依赖
Dependency
任务之间的先后关系,如DWS层任务依赖DWB层任务完成
资源抢占
Resource Preemption
多个任务同时争夺集群资源,导致部分任务运行缓慢或失败
扩容
Scale Up/Out
增加集群的计算或存储资源,解决资源不足问题

六、 分析应用类

黑话
全称/含义
应用/特点
OLAP
联机分析处理(Online Analytical Processing)
面向分析的多维度数据查询,支持钻取、切片、切块操作
OLTP
联机事务处理(Online Transaction Processing)
面向业务交易的数据库操作,如订单下单、支付,特点是高频、低延迟
钻取
Drill Down/Up
OLAP分析操作,从汇总数据下钻到明细数据(如从全国销售额钻取到省份销售额)
切片
Slice
固定一个维度的值,查看其他维度的数据(如固定“2025年1月”,查看各省份销售额)
切块
Dice
固定多个维度的值,查看剩余维度的数据(如固定“2025年1月+华东地区”,查看各品类销售额)
仪表盘
Dashboard
可视化展示核心指标的界面,如销售仪表盘、用户增长仪表盘
即席查询
Ad-hoc Query
业务人员根据需求灵活编写的临时查询,要求数仓具备高效的查询能力
数据脱敏
Data Masking
对敏感数据进行加密或替换处理(如手机号显示为138****5678),保护数据安全

总结

往期精彩

面试提问:数仓中DWD层建设最大困难是什么?

数仓之DWB层完整设计方案与实战

数据开发:如何深入理解业务并高于业务视角?

面试提问:什么是基于业务过程的数据建模?

从数仓建模角度标签体系如何落地建设?

标签体系设计与落地指南:从基础认知到实操落地【万字长文详解】

文章转载自会飞的一十六,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论