数据治理是组织用于指导数据管理和使用的一套决策权、问责、政策与监督体系。它明确谁有权就数据作出决策、适用哪些标准,以及如何监督这些决策的落实情况。治理是数据管理的组成部分,而非其同义词:数据管理包括收集、存储、整合、保护和维护数据等操作活动,而治理则为这些活动确立方向和问责机制。(dama.org)
范围与目的
数据治理将组织目标与把数据作为资产进行管理所需的职责和控制措施联系起来。其范围可涵盖业务定义、数据质量、访问、共享、保留及可接受的使用方式。治理框架规定哪些数据属于其管辖范围、由谁负责,以及解决问题或冲突性要求的程序。因此,数据治理是一种组织层面的制度安排,而不只是软件平台或信息技术职能。(ibm.com)
治理与数据隐私和网络安全有所交集,但这些关注领域不能相互替代。隐私风险不仅可能源于未经授权的访问或安全事件,也可能源于经过授权的数据处理。因此,治理既关注防止数据安全受损的保护措施,也关注数据使用的目的和后果。美国国家标准与技术研究院(NIST)的《隐私框架》将组织政策、职责、风险优先级,以及法律和合同要求的管理纳入治理范畴。(nvlpubs.nist.gov)
决策权与组织角色
治理框架分配对数据定义、质量要求、访问及其他重要决策的权限。典型参与者包括:
- 高层发起人或治理委员会:确定优先事项,并解决跨组织部门的问题。
- 数据所有者:对指定的数据资产或数据域承担最终责任。
- 数据管家:维护定义、协调质量工作,并支持政策的执行。
- 技术保管人员:运行系统并实施技术控制措施。
- 数据使用者:在既定规则内使用数据,并报告问题。
不同组织的职位名称和职责划分各不相同;关键在于区分对决策承担最终责任与负责执行具体任务。(ibm.com)
治理可以将集中监督与分散到各业务领域的职责相结合。在联邦式模式中,组织统一的要求与各业务领域的数据管护和决策并存。中央层面的权威负责协调,各业务领域的参与者则提供解释和管理本领域数据所需的知识。这种安排并不要求将所有数据集中存储。(learn.microsoft.com)
治理的主要领域
定义、元数据与数据血缘
元数据提供数据的背景信息,包括其含义、结构、来源和管理要求。对元数据进行治理,有助于数据发现、解读和审计。统一的定义有助于避免不同团队用同一术语指代不同概念,或用不同术语指代同一概念。(dama.org)
数据目录对可用数据资产的相关信息进行组织。数据血缘记录数据在不同系统间的流动和变化,帮助调查人员追溯错误来源,并识别下游依赖关系。这些能力为治理提供支持,但仅有文档并不能确立决策权或确保其得到落实。(ibm.com)
数据质量
质量治理明确数据满足特定用途所需的条件,确定问题的责任归属,并建立可衡量的要求。常见维度包括准确性、完整性、唯一性、一致性、及时性和有效性。这些维度衡量的是不同属性:完整的数据集可能包含错误值,而格式有效的值仍可能不准确。(gov.uk)
质量要求取决于用途。对于紧急的业务决策,及时性可能比完整性更重要;而其他用途则可能要求数据集经过全面核对并保持一致。治理将这些权衡明确化,而不是假定一个通用的质量评分就足够。质量规则将预期转化为检查要求,例如规定必须在数据收集后的特定期限内录入记录。(gov.uk)
访问、保护与生命周期
治理政策涵盖数据收集、存储、处理、共享和保留。它们规定人员和系统可以使用数据的条件,并明确保护数据所需的控制措施。访问控制是落实这些决策的一种手段;其技术操作与决定谁应获得访问权限、出于何种目的获得权限,是不同的事项。(ibm.com)
生命周期治理还涵盖更广泛的数据处理生态系统,包括服务提供商和其他第三方。职责、合同要求、数据保留和删除都需要跨越组织边界加以考虑,而不能仅限于单个数据库。NIST《隐私框架》在这一更广泛的风险管理方法中,纳入了处理活动清单的编制、第三方职责的协调以及数据处置的管理。(nvlpubs.nist.gov)
框架、实施与评估
国际数据管理协会(DAMA International)出版的**《数据管理知识体系》**提供了一套专业框架,涵盖数据治理及其他数据管理领域。它是一套指导性知识体系,不能替代组织自身对权限的分配、政策的制定和操作程序的建立。(dama.org)
治理计划通常首先明确组织目标、相关利益相关方,以及实现这些目标所需的数据。后续工作包括评估现有能力、形成政策文件、分配职责,并将治理融入日常业务流程。与只着眼于编制治理文档的计划相比,聚焦明确问题(如报告口径不一致)的计划具有更清晰的成效评估依据。(ibm.com)
评估可以考察政策的采纳情况、质量表现、尚未解决的问题,以及控制措施的有效性。成熟度模型提供了一种结构化方法,用于比较当前能力与目标状态;持续监测则有助于识别需要修订的政策或流程。由此形成的指标旨在评估实际运行成效,而不只是确认是否设有委员会或数据目录。(ibm.com)
数据治理与人工智能
数据治理通过明确呈现数据的来源、局限、使用许可和预期用途,为人工智能提供支持。对于机器学习,训练数据的来源记录有助于提高透明度并落实问责。不过,数据集的质量和适用性仍须结合系统的预期用途加以评估;仅凭文档无法证明模型可靠。(airc.nist.gov)
数据治理的范围比人工智能治理更窄,后者还涉及模型、系统行为、评估、部署和人工监督。NIST《人工智能风险管理框架》包括记录数据和系统风险、关注第三方组件与知识产权,以及贯穿人工智能全生命周期的评估。因此,经过治理的数据集有助于对基于该数据集构建的系统开展治理,但不能替代系统治理。(airc.nist.gov)
局限与运行中的矛盾
治理必须在数据可访问性与保护之间取得平衡。过度限制可能延误正当使用,而管控不当的访问可能导致敏感信息暴露。分布式系统和未记录的数据流会增加政策执行的难度,因为职责可能分散,数据活动的可见性也可能不完整。自动化可以辅助分类、血缘追踪和监测,但不能消除对组织决策及其问责机制的需求。(ibm.com)
治理也无法消除数据要求之间的所有冲突。质量维度之间可能存在取舍,组织目标可能各不相同,处理风险也可能随时间变化。治理的实际作用,是提供一种可重复运用的机制,用于识别这些冲突、明确有权解决冲突的主体,并审查由此作出的决策。(gov.uk)
参考来源
- What is Data Management? - DAMA International®dama.org
- What is Data Governance? | IBMibm.com
- How to Implement Data Governance | IBMibm.com
- NIST Privacy Framework: A Tool for Improving Privacy through Enterprise Risk Management, Version 1.0nvlpubs.nist.gov
- Learn about data governance with Microsoft Purview | Microsoft Learnlearn.microsoft.com
- The Government Data Quality Frameworkgov.uk
- The Government Data Quality Framework: guidancegov.uk
- DAMA® Data Management Body of Knowledge (DAMA-DMBOK®) - DAMA International®dama.org
- AI Risks and Trustworthiness - AIRCairc.nist.gov
- AI RMF Core - AIRCairc.nist.gov