L1 · 领域总览

数据体系

数据工程数据治理训练数据数据链路AI基础设施

数据体系通过标准化链路、高质量训练数据准备和系统化治理,构建 AI 项目的数据基础设施

01 WHAT

是什么

数据体系是支撑 AI 系统从原始数据到可用训练样本的完整工程框架,涵盖采集、处理、治理与准备环节。

02 WHY

为什么

高质量数据是模型性能的基石,掌握数据体系可帮助算法工程师、数据科学家和 AI 架构师构建可靠的数据供应链。

03 HOW

怎么做

建议按数据流向顺序学习:先理解数据链路如何流转,再掌握训练数据构建方法,最后建立数据治理规范。

04 WHEN

什么时候

在开始模型训练或构建数据密集型 AI 应用前必须掌握;若仅做轻量级 Prompt 工程可暂缓深入。

FOCUS

下属主题

点进去继续学

PROBLEM / POSITION / INTERFACE

先弄清它为什么存在,以及谁在使用

不从历史开始,从真实工作关系开始。
  1. 01 解决的问题

    当 AI 项目面临数据质量不稳定、标注成本高或合规风险时

    缺乏体系化数据管理会导致模型效果波动、训练成本飙升及法律风险

    成功标准
    建立可追溯、高质量、合规的数据供应链,支撑模型持续迭代
  2. 02 AI 生态位

    位于 AI 系统底层,为模型训练和推理提供标准化数据输入

    上游
    依赖业务系统、传感器、公开数据集等原始数据源
    下游
    为模型训练、评估、监控及业务应用提供高质量数据
  3. 03 人的生态位

    数据工程师和算法专家通过该体系实现数据资产的结构化管理

    适合使用
    需要构建生产级 AI 系统或管理大规模训练数据时
    不必使用
    仅做概念验证或使用预训练模型微调且数据量极小时
  4. 04 独特价值

    将分散的数据工程实践整合为可复用、可审计的标准化体系

    平衡数据质量、处理效率、合规要求与成本控制的多目标优化

    复杂度判断
    复杂度不是功能数量,而是控制与验证成本。

INTERFACE FLOW

谁在操作,信息怎样流动

  1. WHO OPERATES

    HUMAN定义数据标准、设计治理策略、验收数据质量

    SYSTEM自动化执行数据清洗、转换、标注和质量检测

  2. INPUT

    原始业务数据、日志、文本、图像等多模态数据流

  3. CONTROL

    数据标准、质量规则、权限策略、处理流水线配置

  4. OUTPUT

    结构化训练数据集、数据质量报告、合规审计记录

COMPARE

下属主题怎么区分

维度数据链路训练数据数据治理
核心问题数据如何高效可靠地流动如何构建高质量训练样本如何确保数据合规与质量可控
关注阶段采集到存储的工程实现模型训练前的数据准备全生命周期的规范管理
关键产出稳定运行的数据管道标注完成的数据集治理策略与审计报告