L2 · 主题中枢

训练数据

模型训练数据工程预训练指令微调偏好对齐强化学习

模型能力由数据定义:四类训练数据分别解决知识注入、任务遵循、价值对齐与策略优化问题。

4核心数据类型
2关键控制维度
1统一训练目标
先记住数据质量 > 数据规模

在算力与架构趋同的背景下,高质量、高信噪比、分布匹配的训练数据成为决定模型表现的首要变量。

LIVE
CORE 训练数据
01 WHAT

是什么

训练数据是用于模型参数更新的结构化语料集合,涵盖预训练、指令微调、偏好对齐与强化学习四个阶段。

02 WHY

为什么

高质量训练数据决定模型的知识广度、任务遵循能力与价值对齐水平,是替代纯靠架构升级实现性能跃迁的核心杠杆。

03 HOW

怎么做

按目标选择对应数据类型,构建清洗-标注-验证流水线,使用标准格式输入训练框架并监控损失与评估指标。

04 WHEN

什么时候

需要定制模型能力或对齐人类偏好时使用;若仅需调用现有API或任务可通过Prompt解决,则无需自行准备训练数据。

THIS PAGE INCLUDES
预训练数据指令数据偏好数据强化学习数据

FOCUS

先记住这些

只留最重要的判断,细节见下方实践
01 独特价值

为什么需要它

训练数据是唯一能直接塑造模型内部表征与行为边界的输入;相比Prompt或RAG,它提供持久、低成本、高一致性的能力固化。

02 复杂度

真正难在哪里

数据清洗去重、标注一致性控制、偏好排序的主观性、奖励函数设计偏差,以及训练过程中的分布偏移与过拟合,均需系统化工程与评估体系支撑。

03 使用判断

什么时候用

当任务需长期复用、涉及敏感合规、或要求输出高度可控时启动训练数据工程;若为一次性探索或通用任务,优先使用Prompt或现有API。

ROUTE

学习路径

建议按此顺序逐步深入
01
明确训练目标

确定需提升的能力维度(知识/指令/对齐/策略),选择对应数据类型。

02
构建数据流水线

设计采集、清洗、标注、验证与版本管理流程,确保数据质量可追溯。

03
接入训练框架

按格式要求输入数据,配置采样与损失权重,监控训练指标与验证集表现。

PROBLEM / POSITION / INTERFACE

先弄清它为什么存在,以及谁在使用

不从历史开始,从真实工作关系开始。
  1. 01 解决的问题

    当通用模型在特定领域表现不足、指令遵循不稳定或输出不符合安全与价值观要求时。

    缺乏结构化数据导致训练发散、过拟合或产生有害输出;人工标注成本高且一致性难保障。

    成功标准
    模型在目标分布上稳定收敛,评估指标达标,且输出符合预期行为边界。
  2. 02 AI 生态位

    位于模型训练流水线的数据供给层,上游依赖原始语料与标注工具,下游驱动预训练、SFT、DPO/RLHF等训练阶段。

    上游
    原始文本、代码、多模态素材、人工标注平台、规则引擎与自动化过滤系统。
    下游
    为预训练、指令微调、偏好优化与强化学习阶段提供标准化输入,最终影响模型推理行为。
  3. 03 人的生态位

    负责定义数据标准、审核样本质量、设计奖励信号,并在关键节点进行人工验收与纠偏。

    适合使用
    需长期复用模型、处理敏感领域数据、或要求输出严格符合组织规范时。
    不必使用
    任务可通过Prompt工程、RAG或调用成熟API解决,且无定制训练预算与运维能力时。
  4. 04 独特价值

    通过数据设计直接塑造模型行为,比单纯调整超参或更换架构更具可解释性与可控性。

    数据分布偏移、标注噪声、奖励黑客(reward hacking)与评估指标失真导致训练难以收敛或产生意外行为。

    复杂度判断
    复杂度不是功能数量,而是控制与验证成本。

INTERFACE FLOW

谁在操作,信息怎样流动

  1. WHO OPERATES

    HUMAN定义数据规范、审核样本、设计奖励函数、验收训练结果

    TOOL执行数据清洗、去重、格式转换与自动化标注

    BACKEND管理数据版本、分发训练批次、记录训练日志与指标

  2. INPUT

    按阶段组织的结构化语料:预训练为大规模无监督文本,指令数据为任务-输入-输出三元组,偏好数据为成对排序样本,强化学习数据为状态-动作-奖励序列。

  3. CONTROL

    数据采样比例、批次大小、学习率调度、损失权重、过滤阈值、标注一致性校验规则。

  4. OUTPUT

    训练后的模型权重更新;不直接产生外部动作,但通过模型部署影响下游推理输出。

FLOW

训练数据使用流程

01定义目标与成功标准明确需提升的能力维度,设定可量化的评估指标(如准确率、偏好胜率、安全违规率)。
02构建数据流水线采集原始语料,执行去重、过滤、格式标准化,引入人工或自动化标注,建立版本控制。
03配置训练参数设置数据采样比例、批次大小、学习率、损失权重,确保各阶段数据分布匹配训练目标。
04执行训练与监控输入训练框架,实时跟踪损失曲线、验证集指标与梯度范数,及时干预异常。
05评估与迭代使用独立测试集与人工评审验证输出,根据失败模式回流修正数据或调整训练策略。

COMPARE

训练数据 vs Prompt/RAG

维度训练数据Prompt / RAG
能力持久性固化于模型权重,长期有效依赖运行时输入,每次需重新构造
成本结构前期高投入,后期边际成本低单次调用成本低,长期累积高
控制粒度可精细调整内部表征与行为边界仅能控制输入提示与检索上下文
适用场景高频复用、敏感合规、深度定制快速验证、通用任务、低运维预算

PRACTICE

训练数据最小使用步骤

明确训练目标与评估指标
选择对应数据类型(预训练/指令/偏好/强化学习)
构建清洗与标注流水线,确保数据质量可追溯
配置训练参数并接入训练框架
监控训练指标,设置早停与异常告警
使用独立测试集验证输出,记录失败模式

FAQ

常见问题

选型、用法与失败,不复述定义。
01谁在实际负责训练数据工程?

数据工程师负责流水线构建,标注团队负责质量审核,算法工程师负责训练配置与评估。

明确角色分工可避免责任模糊与质量失控。
02训练数据与Prompt/RAG的核心区别是什么?

训练数据固化能力于模型权重,Prompt/RAG依赖运行时输入;前者适合长期复用,后者适合快速验证。

避免在无需定制训练的场景中投入过高成本。
03最小可用训练数据闭环是什么?

定义目标→构建小规模高质量数据集→接入训练框架→监控指标→验证输出→迭代修正。

帮助团队以最低成本验证训练可行性。
04生产环境最容易在哪里失败?

数据分布偏移、标注不一致、奖励函数设计偏差导致模型输出偏离预期或产生有害内容。

决定监控重点与兜底策略。
05什么时候不需要训练数据?

当任务可通过Prompt工程、RAG或调用成熟API解决,且无定制训练预算与运维能力时。

控制系统成本与复杂度。