BI、数据仓库与指标:从入门到串成体系
一、前言:为什么要理清这些概念
刚接触数据相关工作时,最容易被一堆名词绕晕:BI、取数、数据集、指标、数仓、事实表、维度表、OLAP、大宽表、横表、纵表……
这些词不是孤立的,它们共同构成了**“从原始数据到业务决策”**的完整链路。理解每个词在链路中的位置,比单独背定义更重要。
这篇文章就是一张概念地图,帮你把散落的珠子串成项链。
二、一句话速览核心概念
| 概念 | 一句话解释 | 类比 |
|---|---|---|
| BI(商业智能) | 用数据支撑业务决策的方法论、工具和流程的统称 | 一家餐厅,从进货到出菜到点菜系统全包 |
| 取数 | 从数据库、日志、接口等地方把数据搬出来的动作 | 后厨去菜市场买菜、洗菜、切配 |
| 数据集 | 经过清洗、整合后,面向某个场景可用的数据集合 | 切好配好的食材盘 |
| 指标 | 对数据集做计算后得到的业务度量结果 | 端上桌的菜:DAU、GMV、转化率 |
| 数仓 | 集中存储和管理企业海量数据的地方 | 大型中央厨房 |
| 维度 | 看数据的角度 | 辣锅/清汤锅、荤菜/素菜 |
| 度量 | 要统计的数值 | 吃了多少盘、花了多少钱 |
三、BI、取数、数据集、指标是什么关系
它们不是并列关系,而是一条流水线上的不同环节。
3.1 关系说明
| 环节 | 是什么 | 作用 |
|---|---|---|
| 业务问题 | 老板或业务提出的疑问 | “这个月销量为啥跌了?” |
| 取数 | 从数据源搬数据的过程 | 把订单表、用户表、商品表数据弄出来 |
| 数据集 | 取出来的数据经过清洗整合后的结果 | 形成一张面向分析的大宽表或模型 |
| 指标 | 基于数据集计算出来的业务度量 | GMV、DAU、转化率 |
| BI 展示 | 把指标和洞察可视化呈现 | 仪表盘、报表、趋势图 |
3.2 关键认知
指标不是数据集的一对一副本。
- 一个数据集可以产出 N 个指标;
- 一个指标也可能需要 多个数据集 拼接才能算出来。
例如:一张订单表可以算出 GMV、订单量、客单价、退款率等多个指标;而 DAU 可能需要用户日志表 + 用户信息表共同计算。
四、从数仓到 BI 展示:概念全景地图
从数仓到 BI 展示,大致可以分为四个层次:
4.1 数据仓库分层
数据进入仓库后,会按"脏净程度"分层处理。
| 分层 | 英文全称 | 作用 | 类比 |
|---|---|---|---|
| 数据源 | Data Source | 产生原始数据的地方 | 菜地、养殖场 |
| ODS | Operational Data Store | 贴源层,原样复制业务数据 | 临时堆货的仓库 |
| DWD | Data Warehouse Detail | 明细层,清洗、去重、标准化 | 洗干净、分好类的食材 |
| DWS | Data Warehouse Service | 汇总层,按主题/维度轻度汇总 | 切好的半成品菜 |
| ADS | Application Data Store | 应用层,面向具体业务场景加工 | 可以直接下锅的成品菜 |
| 数据集 | Dataset | 供分析或 BI 使用的数据集合 | 一盘配好的菜 |
流程主线:
数据源 → ODS(原样存) → DWD(洗干净) → DWS(轻度汇总) → ADS(面向应用) → 数据集(给 BI 用)
4.2 数据建模概念
数据建模决定"数据怎么组织、怎么关联"。
| 概念 | 是什么 | 例子 |
|---|---|---|
| 事实表 | 记录业务发生事实的表 | 订单表、登录日志表、支付流水表 |
| 维度表 | 描述事实发生时的上下文 | 用户表、商品表、地区表、时间表 |
| 星型模型 | 一张事实表 + 多张维度表,围绕事实表像星星 | 订单事实表 + 用户/商品/地区维度表 |
| 雪花模型 | 维度表再拆分更细,像雪花分叉 | 地区维度表再拆成省表、市表、区县表 |
| 宽表 | 把很多字段拼到一张表里,冗余但查询快 | 订单+用户+商品+门店信息拼成一张大表 |
星型模型 vs 雪花模型:
- 星型模型:查询快、结构简单,BI 场景常用;
- 雪花模型:更省存储、更规范,但查询需要 join 更多表。
4.3 BI 分析概念
这是业务人员真正打交道的一层。
| 概念 | 是什么 | 例子 |
|---|---|---|
| 维度 | 看数据的角度 | 时间、地区、渠道、版本、商品类目 |
| 度量 | 要统计的数值 | 销售额、订单量、用户数、转化率 |
| OLAP | 联机分析处理,支持多角度分析 | 数据立方体,可拖拽分析 |
| 上卷 | 从明细往汇总看 | 城市销售额 → 全国销售额 |
| 下钻 | 从汇总往明细看 | 全国销售额 → 省份 → 城市 → 门店 |
| 切片 | 固定一个维度值,看其他维度 | 只看"2026 年 9 月"的数据 |
| 切块 | 固定多个维度值,看一个子集 | 看"2026 年 9 月 + 北京区 + 手机类目" |
| 仪表盘 | 把多个图表/指标放一起的可视化面板 | 公司经营驾驶舱 |
4.4 表结构概念
这是数据在物理存储和展示时的形态。
横表 vs 纵表
| 类型 | 结构特点 | 适合场景 |
|---|---|---|
| 横表(宽形式) | 每个指标占一列 | 人类阅读、BI 展示、报表输出 |
| 纵表(长形式) | 每个指标占一行,用"指标名-指标值"存储 | 指标动态增减、ETL 处理、统一指标库 |
横表示例:
| 日期 | GMV | 订单量 | 客单价 |
|---|---|---|---|
| 2026-09-01 | 100 万 | 5000 | 200 |
| 2026-09-02 | 120 万 | 6000 | 200 |
纵表示例:
| 日期 | 指标名 | 指标值 |
|---|---|---|
| 2026-09-01 | GMV | 100 万 |
| 2026-09-01 | 订单量 | 5000 |
| 2026-09-01 | 客单价 | 200 |
横表像 Excel,纵表像配置表。两者可以互相转换。
宽表 vs 窄表
| 类型 | 特点 | 优劣 |
|---|---|---|
| 宽表 | 列很多,把多个维度/指标拼在一起 | 查询快、使用方便,但冗余大、维护难 |
| 窄表 | 列很少,每张表只存一类信息 | 结构清晰、易维护,但查询要 join |
五、指标到底是什么(重点)
5.1 指标的本质
指标 = 数据集(原材料) + 计算逻辑 + 维度 + 口径
指标不是数据集的一对一副本,而是业务逻辑的技术化封装。它把"业务关心的问题"翻译成可计算、可复用、口径统一的表达式。
5.2 指标定义的四个要素
| 要素 | 说明 | 例子 |
|---|---|---|
| 指标名称 | 业务上能听懂的名称 | 日活跃用户数(DAU) |
| 计算逻辑 | 用什么公式/聚合方式 | count(distinct user_id) |
| 维度 | 可以按什么角度拆分 | 日期、渠道、版本、城市 |
| 口径 | 边界条件、过滤规则 | 当天至少启动一次 App 的去重用户,排除测试账号 |
5.3 为什么需要指标?
原始数据库查询直接面向的是"表和字段",业务人员关心的是"问题和结果"。指标就是两者之间的翻译官。
| 业务世界 | 技术世界 |
|---|---|
| “昨天 GMV 多少?” | select sum(amount) from order_table where date = '2026-09-02' |
| “这个月新增用户多少?” | select count(distinct user_id) from user_register where ... |
指标带来的好处:
- 统一语言:全公司说"GMV"都指同一个东西;
- 复用计算:一次定义,到处使用;
- 口径一致:老板、运营、财务看到的数值对得上;
- 降低门槛:业务人员不用写 SQL 就能用;
- 可追溯可维护:口径变了,改一处,全局更新。
5.4 真实业务中的常见指标
| 领域 | 常见指标 |
|---|---|
| 电商/零售 | GMV、订单量、客单价、转化率、复购率、退款率 |
| 内容/社区 | DAU、MAU、留存率、播放量、点赞数、完播率 |
| SaaS/B 端 | MRR、ARR、续费率、流失率、NPS、LTV |
| 金融/风控 | 逾期率、坏账率、通过率、AUM、资金成本 |
六、BI 不只是报表工具
6.1 BI 的三层含义
| 层次 | 含义 | 例子 |
|---|---|---|
| 理念/方法论 | 用数据驱动业务决策的思维方式 | “我们要用数据说话” |
| 工具/平台 | 支撑数据分析的一整套软件产品 | Tableau、Power BI、FineBI |
| 流程/实践 | 从取数、建模、分析到决策的完整工作流 | 数据采集 → 清洗 → 建模 → 分析 → 决策 |
6.2 狭义 BI vs 广义 BI
| 类型 | 范围 |
|---|---|
| 狭义 BI | 主要指可视化、报表、仪表盘 |
| 广义 BI | 包含数据接入、数据建模、自助分析、数据挖掘、决策支持 |
6.3 现代 BI 平台的能力
- 自助分析:业务人员拖拽字段,自己探索数据;
- 下钻联动:从全国销售额钻到省份、城市、门店;
- 实时预警:GMV 连续下跌自动发告警;
- 智能归因:系统自动告诉你是哪个渠道拖了后腿;
- 预测分析:基于历史数据预测未来趋势。
报表工具只是 BI 的"面子",BI 还有"里子"(数据整合与建模)和"脑子"(分析与决策支持)。
七、全流程串讲
把从数仓到 BI 展示的完整链路串起来:
用火锅 analogy 再串一遍:
| 概念 | 火锅场景 |
|---|---|
| 数据源 | 菜市场、养殖场 |
| ODS | 刚买回来还没处理的原材料 |
| DWD | 洗好的菜、切好的肉 |
| DWS | 按种类装盘的半成品 |
| ADS/数据集 | 端上桌、配好蘸料的菜盘 |
| 事实表 | 你吃了什么(点菜单) |
| 维度表 | 谁吃的、在哪吃的、什么时候吃的 |
| 宽表 | 把菜、肉、调料全放一个大盘里 |
| 维度 | 辣锅/清汤锅、荤菜/素菜 |
| 度量 | 吃了多少盘、花了多少钱 |
| OLAP | 各种角度分析这顿饭 |
| 仪表盘 | 晒朋友圈的九宫格 |
八、总结与口诀
8.1 核心关系口诀
BI 是舞台,取数是搬砖,数据集是仓库,指标是答案。
8.2 指标定义口诀
指标 = 数据集 + 计算逻辑 + 维度 + 口径
8.3 数仓分层口诀
ODS 原样存,DWD 洗干净,DWS 做汇总,ADS 给应用。
8.4 BI 范围口诀
BI 不止报表,报表只是面子;里子是数据建模,脑子是分析决策。
九、概念速查表
| 概念 | 属于哪一层 | 一句话解释 |
|---|---|---|
| BI | 决策支持体系 | 用数据支撑决策的方法论、工具和流程 |
| 取数 | 数据工程 | 从数据源搬数据的动作 |
| 数据集 | 数据应用 | 面向场景加工好的数据集合 |
| 指标 | 业务度量 | 对数据集计算后的业务结果 |
| 数仓 | 数据存储 | 集中管理企业数据的地方 |
| ODS | 数仓分层 | 贴源层,原样存储 |
| DWD | 数仓分层 | 明细层,清洗标准化 |
| DWS | 数仓分层 | 汇总层,轻度聚合 |
| ADS | 数仓分层 | 应用层,面向业务 |
| 事实表 | 数据建模 | 记录业务事实 |
| 维度表 | 数据建模 | 描述事实上下文 |
| 星型模型 | 数据建模 | 事实表 + 维度表 |
| 雪花模型 | 数据建模 | 维度表再拆分 |
| 宽表 | 表结构 | 列很多、信息拼一起 |
| 窄表 | 表结构 | 列很少、结构规范 |
| 横表 | 表结构 | 每个指标一列 |
| 纵表 | 表结构 | 每个指标一行 |
| 维度 | BI 分析 | 看数据的角度 |
| 度量 | BI 分析 | 要统计的数值 |
| OLAP | BI 分析 | 联机分析处理 |
| 上卷/下钻 | BI 分析 | 汇总/明细切换 |
| 切片/切块 | BI 分析 | 固定维度值筛选 |
| 仪表盘 | BI 展示 | 多图表组合面板 |
更多推荐
所有评论(0)