第2篇 方法篇 · 起始 P.240

第8章 数据资源规划

本章概述

本章系统阐述数据资源规划的理论、方法与实践,涵盖数据与数据资源的定义(数据-信息-知识-智慧递进关系、数据资源特征与发展三阶段)、三种主流规划方法(基于稳定信息过程、基于稳定信息结构、基于指标能力)、数据架构(数据模型、数据流、传统/现代架构、CAP理论、Lambda/Kappa)、数据标准化(标准体系、元数据、数据元、分类编码)以及数据管理(数据治理、数据质量、数据安全)。本章是数据要素时代的核心章节,概念新、体系完整,选择题与论文题均高频。

知识结构

  • 概述 必考
  • 数据定义、数据-信息-知识-智慧关系
  • 数据资源定义与特征(无形可复制、非竞争弱排他、时效、依附、垄断)
  • 发展三阶段:数据资源化→数据资产化→数据资本化
  • 数据资源规划定义与作用
  • 规划方法 必考
  • 基于稳定信息过程的方法(业务固定、数据积累少)
  • 基于稳定信息结构的方法(业务变化、数据积累多)
  • 基于指标能力的方法(决策场景、数据积累少)
  • 数据架构 必考
  • 定义与目标、数据模型(概念/逻辑/物理)、数据流设计
  • 演化驱动因素
  • 传统架构:集中式、分布式(CAP理论、分片分区、一致性容错)
  • 现代架构:数据湖、云原生、实时数据架构(Lambda/Kappa)、数据应用架构(微服务/API)
  • 数据标准化 重点
  • 标准体系:指导标准、通用标准(数据类/服务类/管理建设类)、专用标准
  • 元数据标准化、数据元标准化、数据分类与编码标准化
  • 数据管理 必考
  • 数据治理(定义、目标原则、活动)
  • 数据质量(维度、目标原则、活动)
  • 数据安全(要求来源、目标原则、活动)

核心概念

  • 数据:对客观事物的性质、状态及相互关系进行记载的物理符号或其组合。数据是信息的原材料,数据与信息是原料与结果的关系。
  • 数据-信息-知识-智慧:数据是感性认识产物,信息/知识/智慧是理性认识产物。数据→信息(加工处理建立联系)→知识(系统化的信息,经验智慧总结)→智慧(收集加工应用传播信息知识的能力+前瞻性)。前者是后者的基础与前提,层次越高价值越大。
  • 数据资源:将无序原始数据开发为有序、有使用价值的数据,包括结构化和非结构化数据。2020年4月被列为与土地、劳动力、资本、技术并列的第五生产要素。特征:无形性与可复制性、非竞争性与弱排他性、时效性、依附性、垄断性。
  • 数据资源化:将无序混乱原始数据开发为有序有使用价值的数据资源,包括采集、整理、分析,形成可用可信标准的高质量数据。
  • 数据资产化:基于应用场景及商业目的,将数据资源加工形成可供组织应用或交易的数据产品,拥有场景赋能,预期产生经济利益。
  • 数据资本化:数据资产被进一步赋予金融属性,通过交易等流动方式产生新产品和服务,最终变为资本,本质是实现数据要素的社会化配置。
  • 数据架构:数据管理的基础,对企业数据进行结构化、有序化治理,从数据孤岛走向数据共享。主要构件包括当前状态描述、数据需求定义、数据整合指引、数据资产管理规范。必须包括数据模型和数据流设计。
  • 主题数据库:面向业务主题的数据组织存储,与业务管理主要问题相关联,而非与计算机应用项目关联。否定各应用系统"自建自用",强调"共建共用"的共享数据库。强调数据就地采集、处理、使用和存储。
  • CAP理论:分布式系统三要素:一致性C(所有备份同一时刻值相同,分弱/强/最终一致性)、可用性A(部分节点故障后集群仍能响应读写)、分区容错性P(网络分区时系统仍能工作)。三者不可兼得,分布式系统中P是基本要求,只能在C和A间选择:CP(舍A保C,如Redis/ZooKeeper)、AP(舍C保A,保证最终一致性即BASE理论,高并发场景)、CA(舍P,单站点数据库/集群数据库/LDAP,不满足分布式可伸缩性)。
  • 数据湖:集中存储区,以原生格式存储结构化、半结构化和非结构化数据,无模式或灵活模式,可扩展,支持实时/批处理、海量数据处理、数据多样性。关键组件:存储层(HDFS/S3)、数据管理工具(Spark/Hive/Flink)、数据治理工具(Atlas/Ranger)、查询分析工具(Spark SQL/Athena/BigQuery)、可视化工具、流处理工具、ML/AI工具。缺乏治理会变成"数据沼泽"。
  • 元数据:关于数据的数据(Data about Data),是关于数据的结构化数据,描述数据的内容(What)、地址(Where)、时间(When)、质量、所有者(Who)、提供方式(How)。结构包括内容结构、句法结构、语义结构。作用:描述、定位、寻找发掘、评价、选择。
  • 数据元:由一组属性规定其定义、标识、表示和允许值的数据单元,是数据的基本单元。由对象类、特性、表示三部分组成。命名规则:语义规则(对象类+特性+表示术语各一个,限定术语可选)、句法规则(对象类第一、特性第二、表示最后、限定在被限定成分前)、唯一性规则。
  • 数据治理:在管理数据资产过程中行使权力和管控,包括计划、监控和实施。确保数据被恰当地管理而非直接管理数据,相当于监督和执行职责分离。职能是指导所有其他数据管理领域的活动。
  • 数据质量:数据达到数据消费者期望和需求即为高质量,取决于使用场景和消费者需求。常见维度:一致性、完整性、合理性、唯一性、有效性。原则:重要性、全生命周期管理、预防、根因修正、治理、标准驱动、客观测量和透明度、嵌入业务流程、系统强制执行、与服务水平关联。
  • 数据安全:为数据和信息资产提供正确的身份验证、授权、访问和审计。要求来源:利益相关方、政府法规、特定业务关注点、合法访问需求、合同义务。原则:协同合作、企业统筹、主动管理、明确责任、元数据驱动、减少接触以降低风险。

重点考点

  • 数据-信息-知识-智慧递进关系:数据是对客观事物的记载(感性认识),信息是对数据加工处理建立联系(回答特定问题),知识是系统化的信息(经验智慧总结),智慧是收集加工应用传播信息知识的能力+前瞻性看法。四者是原料与结果的关系,层次越高外延内涵概念化和价值越大。数据是信息的源泉,信息是知识的子集或基石,知识是智慧的基础和条件。 必考 【论文】
  • 数据资源五大特征:无形性与可复制性(不消耗、可无限复制)、非竞争性与弱排他性(一人使用不减少他人使用,难排他)、时效性(价值随时间衰减)、依附性(需依附存储介质和计算环境)、垄断性(掌握数据即形成竞争壁垒)。被誉为"21世纪的石油"。 必考
  • 数据资源发展三阶段:数据资源化(无序→有序,采集整理分析,形成可用可信标准数据)→数据资产化(基于场景和商业目的加工成数据产品,可计量交易,产生交换价值)→数据资本化(赋予金融属性,通过交易流动产生新产品服务,变为资本,实现数据要素社会化配置)。 必考
  • 三种数据资源规划方法对比:①基于稳定信息过程(业务场景固定、前期数据积累少,理论成熟易理解但步骤繁杂数据稳定性差,核心是"两条主线、三种模型、一套标准",步骤:定义职能域→业务分析→数据分析→建立管理基础标准→功能模型→数据模型→关联模型);②基于稳定信息结构(业务经常变化、数据积累多,实施周期短数据稳定性好但全局设计后置,核心是建立"核心数据集",五步骤:确定目标边界→获取初始数据集→建立核心数据集→完善目标数据集→建立信息模型);③基于指标能力(业务涉及决策、数据积累少,直接支撑决策但实现案例少要求高,以"决策-指标-数据模型"反推核心数据集)。 必考 【案例】
  • 基于稳定信息过程方法的核心模型:业务模型(职能域-业务过程-业务活动三层)、功能模型(子系统-功能模块-程序模块三层)、数据模型(各子系统数据模型+全域数据模型,实体是达到第三范式的"基本表")、关联模型(功能模型+数据模型,控制开发顺序和解决共建问题)。 必考
  • 基于稳定信息结构方法的核心数据集审查五步骤:数据项审查(单个数据项概念/精度/采集)→主题审查(数据项组合成完整语义主题集)→功能审查(主题集能否完成特定功能,功能与主题多对多)→任务审查(功能的动态组合,任务审查是动态的)→核心数据集审查(是否达到规定指标支撑组织目标)。 必考
  • CAP理论:C一致性(所有备份同时刻值相同,弱/强/最终一致性)、A可用性(部分节点故障集群仍响应读写)、P分区容错性(网络分区时系统仍工作)。分布式系统P是基本要求,只能选CP或AP。CP模型:舍A保C,如分布式缓存Redis、分布式协调ZooKeeper,网络故障时牺牲用户体验等数据一致。AP模型:舍C保A,保证最终一致性(BASE理论),高并发系统用排队和乐观锁优先保证可用性。CA模型:舍P,如单站点数据库、集群数据库、LDAP、XFS,不满足分布式可伸缩性。 必考 【案例】
  • 数据库分片 vs 分区:分片(Sharding)是将大型数据库分成多个独立数据库实例,每个实例存部分数据,分布在不同服务器,处理数据量更大但需考虑数据一致性和可用性;分区(Partitioning)是将大型表或索引分成多个小块,通常按字段/键值范围分区,存在同一数据库实例中,提高查询效率和管理灵活性,不需数据同步。分区分水平分区(按行拆分)和垂直分区(按列拆分)。 必考
  • 实时数据架构两种模式:Lambda架构(数据通道分实时流+离线两条,实时流保障实时性,离线批处理保障最终一致性,三层:批处理层Batch Layer、速度处理层Speed Layer、服务层Serving Layer,需维护两套代码);Kappa架构(在Lambda基础上优化,实时和流合并,用消息队列替代数据通道,全程用流系统处理全量数据,解决维护两套代码问题)。 必考
  • 实时数据体系五层架构:接入层(收集binlog/埋点/后端服务日志到Kafka,实时+离线原始数据统一)、存储层(Kafka/HDFS/Kudu/ClickHouse/HBase/Redis/MySQL多引擎)、计算层(Flink实时同步/秒级指标、Spark SQL复杂多维准实时、Presto/ClickHouse多维自助分析)、平台层(统一查询服务+元数据指标管理+数据质量血缘)、应用层(实时大屏/实时数据产品/实时OLAP/实时特征)。 必考
  • 数据湖概念与特点:原生格式存储结构化/半结构化/非结构化数据,无模式或灵活模式,可扩展,支持实时+批处理,海量数据处理,数据多样性。关键组件八类:存储层、数据管理工具(ETL)、数据治理工具、查询分析工具、可视化工具、流处理工具、ML/AI工具。治理不善会变成"数据沼泽"(数据质量/一致性/可靠性/可访问性问题,分析错误,安全隐私风险)。 必考
  • 数据标准体系三类:指导标准(标准体系及参考模型、标准化指南、数据共享概念与术语、标准一致性测试)、通用标准(数据类标准:元数据/分类编码/数据内容;服务类标准:数据发现/访问/表示/操作服务;管理与建设类标准:质量管理/发布管理/运行管理/信息安全/共享效益评价/工程验收/数据中心建设/门户网站建设)、专用标准(领域元数据/领域分类编码/领域数据模式/领域交换格式/领域数据元目录/领域图示表达规范)。 必考
  • 数据元三组成:对象类(事物集合,有清楚边界含义)、特性(对象类所有个体共有的性质,区别于其他成员的依据)、表示(值域+数据类型+表示方式,必要时含计量单位/字符集)。命名语义规则:对象类术语有且仅有一个(支配地位)、特性术语有且仅有一个、表示术语有且仅有一个、限定术语可选。句法规则:对象类第一、特性第二、表示最后(与特性重复可省略)、限定术语在被限定成分前。 必考
  • 数据分类五原则:稳定性(选最稳定本质特性)、系统性(按内在规律系统化排列)、可扩充性(留有余地)、综合实用性(从实际需求出发总体最优)、兼容性(国标→行标→国际标准优先)。数据编码四原则:唯一性(一个编码对象仅一个代码,一个代码唯一表示一个对象)、匹配性(代码结构与分类体系匹配)、可扩充性(留后备容量)、简洁性(结构简单长度短)。注意可扩充性与简洁性相互冲突需综合权衡。 必考
  • 数据治理 vs 数据管理:数据治理确保数据被恰当地管理而非直接管理数据,相当于将监督和执行职责分离;数据治理职能是指导所有其他数据管理领域的活动;数据管理的整体驱动力是确保组织从数据中获得价值。数据治理聚焦如何制定有关数据的决策以及人员和流程在数据方面的行为方式。数据治理活动:规划组织数据治理→制定数据治理战略(章程/运营框架和职责/实施路线图/运营计划)→实施数据治理→嵌入数据治理。 必考 【论文】
  • 数据质量五维度:一致性(数据值在数据集内/间表达相符程度,也可表示格式一致)、完整性(引用完整性或数据集内部一致性,不缺失不残缺)、合理性(数据模式符合预期程度,可与基准/历史比较)、唯一性(数据集中任何实体不重复出现,键值与唯一实体相关)、有效性(数据值与定义的值域一致,需考虑数据类型/格式/精度)。 必考
  • 数据质量十原则:重要性(关注最重要数据)、全生命周期管理(创建到处置)、预防(预防错误而非简单纠正)、根因修正(改流程和系统而非表象)、治理(数据治理支持高质量数据开发)、标准驱动(可量化需求以可测量标准定义)、客观测量和透明度(与利益相关方讨论分享测量方法)、嵌入业务流程(业务流程所有者对数据质量负责)、系统强制执行(系统所有者让系统强制执行质量要求)、与服务水平关联(质量报告和问题管理纳入SLA)。
  • 数据安全要求五来源:利益相关方(客户/公民/学生/供应商隐私保密需求)、政府法规(保护利益相关方,限制访问或确保公开透明问责)、特定业务关注点(专有数据保护,竞争优势)、合法访问需求(不同角色合法访问使用维护数据)、合同义务(合同/保密协议中的数据安全要求)。
  • 数据安全六原则:协同合作(IT安全/数据管理/审计/法律多方协同)、企业统筹(组织一致性)、主动管理(主动性动态性,克服职责分离瓶颈)、明确责任(跨组织和角色的"监管链")、元数据驱动(分类分级是数据定义重要组成)、减少接触以降低风险(最大限度减少敏感数据扩散,尤其非生产环境)。
  • 数据架构演化五驱动因素:技术发展进步(大数据/云计算/AI,自动化机器学习降本)、业务量快速增长(内外部数据量迅速增长)、业务需求变化(战略方向变化/市场竞争/分析模式演进从传统决策到智能产品)、法律法规变化(数据隐私保护立法完善)。 了解
  • 数据元定义编写八规范:具有唯一性、准确而不含糊(用数量词明确个数)、阐述概念基本含义(是什么而非不是什么,避免否定式)、用描述性短语或句子阐述(不能用同义词定义)、简练(不加无关信息,缩略语需普遍理解)、能单独成立(不需附加说明引证,避免相互包含)、相关定义使用相同术语和一致逻辑结构。 了解