如何深入浅出的理解数据仓库建模？

vlambda
2020-01-09

如何深入浅出的理解数据仓库建模？

开始正文之前简单再聊几句数仓，现在有很多数仓的文章，细心的读者应该会发现每个作者写的数仓的分层和命名规范什么的都会不同，没有统一标准的方案给大家参考。关于这一点，只能说目前的确没有统一的标准，传统数仓在各个领域里面经过多年的沉淀是有一些比较标准化的设计的，比如银行和电信行业，但是互联网行业的数仓发展还是比较年轻的。现在大家看到是很多数仓的文章，大家标准不同，居士刚开始做的时候，基本都看不到几篇数仓的文章，基本就是摸着石头过河，因此才自己刚开始工作就写了很多文章总结。因此现在看到很多数仓的文章，居士是十分高兴的，没有统一的标准不重要，再过几年，这种形势会慢慢变好的，早晚会出现一些业界比较认可的数据分层的方案和命名方案的。大家可以拭目以待。关于分层这个，也可以看一下之前尝试写的一篇文章（），完全通用，是不可能完全通用了，但是能满足很多场景，也当个参考吧。

废话不再多说了，下面就是正文：

一、数据仓库建模的意义

如果把数据看作图书馆里的书，我们希望看到它们在书架上分门别类地放置；如果把数据看作城市的建筑，我们希望城市规划布局合理；如果把数据看作电脑文件和文件夹，我们希望按照自己的习惯有很好的文件夹组织方式，而不是糟糕混乱的桌面，经常为找一个文件而不知所措。

数据模型就是数据组织和存储方法，它强调从业务、数据存取和使用角度合理存储数据。 Linux的创始人Torvalds有一段关于“什么才是优秀程序员”的话： “烂程序员关心的是代码，好程序员关心的是数据结构和它们之间的关系”，最能够说明数据模型的重要性。

只有数据模型将数据有序的组织和存储起来之后，大数据才能得到高性能、低成本、高效率、高质量的使用。

性能：帮助我们快速查询所需要的数据，减少数据的I/O吞吐，提高使用数据的效率，如宽表。

成本：极大地减少不必要的数据冗余，也能实现计算结果复用，极大地降低存储和计算成本。

效率：在业务或系统发生变化时，可以保持稳定或很容易扩展，提高数据稳定性和连续性。

质量：良好的数据模型能改善数据统计口径的不一致性，减少数据计算错误的可能性。

数据模型能够促进业务与技术进行有效沟通，形成对主要业务定义和术语的统一认识，具有跨部门、中性的特征，可以表达和涵盖所有的业务。

大数据系统需要数据模型方法来帮助更好地组织和存储数据，以便在性能、成本、效率和质量之间取得最佳平衡！

下图是个示例，通过统一数据模型，屏蔽数据源变化对业务的影响，保证业务的稳定，表述了数据仓库模型的一种价值：

二、数据仓库分层的设计

为了实现以上的目的，数据仓库一般要进行分层的设计，其能带来五大好处：

清晰数据结构：每一个数据分层都有它的作用域，这样我们在使用表的时候能更方便地定位和理解。

数据血缘追踪：能够快速准确地定位到问题，并清楚它的危害范围。

减少重复开发：规范数据分层，开发一些通用的中间层数据，能够减少极大的重复计算。

把复杂问题简单化：将复杂的任务分解成多个步骤来完成，每一层只处理单一的步骤，比较简单和容易理解。当数据出现问题之后，不用修复所有的数据，只需要从有问题的步骤开始修复。

屏蔽原始数据的异常：不必改一次业务就需要重新接入数据。

以下是我们的一种分层设计方法，数据缓冲区（ODS）的数据结构与源系统完全一致。基础数据模型(DWD)和融合数据模型（DWI与DWA）是大数据平台重点建设的数据模型。应用层模型由各应用按需自行建设，其中基础数据模型一般采用ER模型，融合数据模型采用维度建模思路。