人工智能时代的数据架构如何设计
人工智能时代的数据架构如何设计
人工智能扩大了企业数据的使用范围。数据除了支持交易处理和经营分析,还要进入模型训练、知识检索、智能体推理和效果评测。数据架构因此需要同时处理结构化与非结构化数据,并把数据对象、流转规则、AI数据供给、治理和安全连接为一套可追溯体系。
一、为什么AI时代需要重新审视数据架构
传统数据架构主要解决数据如何采集、存储、加工、共享和治理。AI应用进一步要求企业能够持续提供训练数据、推理上下文、知识内容和效果反馈。如果仍沿用只面向报表和接口的数据管理方式,就容易出现非结构化数据利用率低、AI训练数据质量不足、数据安全管控薄弱等核心问题。
因此,数据架构不仅要建设数据平台,还要明确数据对象、责任主体、服务方式和安全控制。企业数据的分类、模型、分布和流转规则,是企业数据资源有序管理的基础保障,也是业务、应用和AI能力共享数据的共同依据。
二、明确数据对象与架构边界
数据架构首先要回答企业管理哪些数据、数据由谁负责以及允许哪些主体使用。当前常见问题是,在现有架构中缺乏明确的实体定义和管理规范,同一客户、产品或合同可能在不同系统中拥有不同名称、编码和状态。
梳理工作需要提取数据域、数据主题、概念实体、逻辑实体、物理实体、数据标准,逐层建立业务概念、逻辑结构和实际存储之间的对应关系。进入AI场景后,还要纳入非结构化数据集、向量集合、知识图谱、样本集等实体,明确各类实体的核心属性及其与概念实体、逻辑实体等现有元模型元素之间的关联关系。
三、设计面向AI的数据架构分层
面向AI的数据架构可以划分为存储计算与集成层、治理与安全层、数据服务层、AI数据支撑层和数据消费层。底层负责接入和处理批量、实时及事件数据;中间层统一标准、质量、元数据、权限和血缘;上层向业务应用、分析工具、大模型和智能体提供数据产品。
AI数据支撑层需要覆盖非结构化数据管理、向量数据管理、知识图谱建模等要素,使文档、图像、向量和语义关系能够与传统结构化数据共同管理,而不是分散在单个AI项目中。

图1 面向AI的数据架构分层
四、数据如何采集流转与加工
数据流转应根据来源、规模和时效要求选择方式。经营分析可以采用批量采集和分层加工,实时推荐与风险预警需要流式接入,业务状态变化则可以通过事件数据传递。每条加工链路都应记录数据来源、转换逻辑、质量检查和下游使用方。
在流转过程中,结构化数据需要保持字段和口径一致;非结构化数据需要完成解析、切分、标注和内容更新;向量数据还要记录生成模型、版本和原始内容的映射。只有保持数据血缘完整,模型输出出现问题时才能回溯到具体数据和处理环节。
五、如何构建面向AI的数据供给体系
AI数据供给不能把全部企业数据直接交给模型,而要根据场景形成经过授权、治理和质量检验的数据产品。对于模型训练,应明确AI训练数据集和验证数据集的需求分析方法、数据采集与标注规范、数据集版本管理机制、数据集质量评估标准,保证数据范围、标签定义和版本变化可追踪。
对于知识问答和智能体场景,还要设计知识图谱的构建流程、本体定义方法、知识抽取与融合技术路径、知识存储与查询架构,以及知识图谱的更新与维护机制。知识图谱负责组织实体及关系,向量集合支持语义检索,两者与结构化数据服务共同构成AI可使用的知识上下文。
在数据服务设计阶段增加AI数据服务接口设计活动,使模型和智能体可以按照权限获取数据集、知识检索结果、特征、标签和实时上下文。相应成果应形成非结构化数据资产目录、样本集清单、知识图谱模型文档、向量集合描述表和AI数据质量报告。

图2 从原始数据到AI数据服务
六、数据治理如何适应AI应用
AI时代的数据治理既要覆盖数据标准、主数据、元数据、质量、血缘和生命周期,也要把训练数据集、知识条目、向量集合及模型反馈纳入治理范围。治理责任需要从数据平台团队延伸到业务部门、模型开发团队和数据使用方。
设计方法也要同步调整:在数据需求分析阶段增加AI数据需求识别活动,在数据模型设计阶段增加非结构化数据模型设计和向量数据模型设计活动,在数据服务设计阶段增加AI数据服务接口设计活动。通过把这些活动嵌入现有流程,AI数据才能从临时项目材料转化为持续维护的企业数据资产。
七、数据安全合规与可信控制
AI应用扩大了数据流动范围,也增加了敏感内容进入模型、训练样本被滥用和输出泄露信息的风险。安全设计应覆盖数据采集、存储、加工、模型调用、结果输出和审计全过程,并依据数据敏感程度配置访问控制、脱敏、加密和留存规则。
尤其需要落实训练数据、推理数据和反馈数据的分级分类保护。训练数据要控制来源合法性和使用范围,推理数据要防止敏感信息进入不适当的模型环境,反馈数据则要避免将用户隐私或错误结果未经处理重新用于训练。

图3 AI数据安全与可信控制链路
八、数据架构的实施与持续演进
实施应从明确业务目标和AI场景开始,依次盘点数据源、识别核心实体、设计分层与流转关系、建设数据服务,并通过典型场景验证数据质量和安全控制。企业可以先选择知识问答、智能客服或风险识别等场景,形成小范围可验证的数据供给闭环。
架构成果需要随业务和模型变化持续更新。数据实体、样本集、知识图谱和向量集合发生变化时,应同步维护目录、血缘、质量报告和服务接口;运行中发现的数据缺陷及模型反馈,也应回到采集、标注和治理环节修正,使数据架构成为AI应用持续改进的基础。
九、主要参考来源
[1] 国务院. 新一代人工智能发展规划. 2017. 原文链接
[2] 国家互联网信息办公室等. 生成式人工智能服务管理暂行办法. 2023. 原文链接
[3] 国家市场监督管理总局等. GB/T 36073—2018 数据管理能力成熟度评估模型.
[4] 国家市场监督管理总局等. GB/T 37988—2019 信息安全技术 数据安全能力成熟度模型.
[5] DAMA国际. DAMA数据管理知识体系指南(第2版)[M]. 北京:机械工业出版社,2020.
[6] Microsoft Learn. 检索增强生成解决方案设计与评估指南. 原文链接
[7] 肖仰华等. 知识图谱:概念与技术[M]. 北京:电子工业出版社,2020.