L2 · 主题中枢

机器学习

数据驱动模式识别预测建模算法工程

机器学习不是万能黑盒,而是以数据为燃料、以评估为方向盘的自适应建模系统。

4核心范式
1内置专题
可迭代优化
先记住范式决定输入结构,数据决定上限,评估决定方向

监督学习依赖标签,无监督发现结构,强化学习优化长期回报,半监督利用未标注数据降低成本。选错范式比调参错误代价更大。

LIVE
CORE 机器学习
01 WHAT

是什么

通过算法从历史数据中自动提取模式,构建可泛化的映射函数以处理新样本。

02 WHY

为什么

当规则无法人工穷举或环境动态变化时,用数据驱动替代硬编码,实现自适应决策。

03 HOW

怎么做

明确业务目标→收集标注/未标注数据→选择范式与模型→训练调参→验证部署→持续监控。

04 WHEN

什么时候

适用于有足够数据且存在可学习信号的场景;规则明确、数据稀缺或需强可解释性时慎用。

THIS PAGE INCLUDES
半监督学习

FOCUS

下属主题

点进去继续学

FOCUS

先记住这些

只留最重要的判断,细节见下方实践
01 独特价值

为什么需要它

当规则无法穷举或环境持续变化时,机器学习以数据驱动替代硬编码,实现自适应预测与决策,显著降低维护成本并提升泛化能力。

02 复杂度

真正难在哪里

数据分布偏移、标签噪声、过拟合与欠拟合的平衡、评估指标与业务目标错位、超参空间爆炸,均需可观测、可干预的工程机制。

03 使用判断

什么时候用

有代表性数据、可定义优化目标、允许概率误差且具备监控迭代能力时启用;规则明确、数据稀缺或需强可解释性时应优先简单方案。

ROUTE

学习路径

建议按此顺序逐步深入
01
明确问题类型

判断是分类、回归、聚类、排序还是策略优化,决定学习范式与评估指标。

02
准备数据管道

构建可复现的数据采集、清洗、划分与版本管理流程,确保训练与推理一致性。

03
选择基线模型

从简单可解释模型开始建立性能基线,再逐步引入复杂结构或集成方法。

04
闭环验证迭代

通过交叉验证、A/B 测试与线上监控持续评估,根据失败模式调整数据或模型。

PROBLEM / POSITION / INTERFACE

先弄清它为什么存在,以及谁在使用

不从历史开始,从真实工作关系开始。
  1. 01 解决的问题

    业务中存在大量历史样本但无法用固定规则覆盖所有情况,或环境持续变化导致规则失效。

    人工编写规则成本高、维护困难、泛化能力差,难以应对噪声、分布偏移和复杂非线性关系。

    成功标准
    模型在未见数据上稳定输出符合业务指标的预测或决策,且具备可监控、可迭代、可回滚的工程闭环。
  2. 02 AI 生态位

    位于数据管道下游、决策执行上游,将原始信号转化为结构化预测或策略,为下游系统提供可调用接口。

    上游
    依赖数据采集、清洗、特征工程与标注体系,以及计算资源与实验管理平台。
    下游
    为推荐、风控、自动化控制、内容生成等应用提供预测分数、分类标签或策略动作。
  3. 03 人的生态位

    负责定义问题边界、选择学习范式、准备数据、设定评估指标、验收结果并处理异常反馈。

    适合使用
    存在可获取的代表性数据、问题可形式化为优化目标、允许一定概率误差且具备监控迭代能力。
    不必使用
    规则明确且稳定、数据量极小或标注成本过高、需强因果解释或合规审计、实时性要求极高且算力受限。
  4. 04 独特价值

    无需显式编程即可拟合高维非线性关系,随数据积累自动提升性能,适应动态分布。

    数据质量敏感、过拟合与分布偏移难控、超参空间大、评估指标与业务目标常不一致。

    复杂度判断
    复杂度不是功能数量,而是控制与验证成本。

INTERFACE FLOW

谁在操作,信息怎样流动

  1. WHO OPERATES

    HUMAN定义任务目标、选择学习范式、准备与验收数据、设定评估标准、处理模型失效

    AGENT自动化执行特征提取、超参搜索、训练调度与指标上报

    BACKEND提供算力、存储、版本管理与在线推理服务

  2. INPUT

    结构化特征向量、序列数据、图像/文本等原始样本及其可选标签或奖励信号

  3. CONTROL

    学习范式选择、损失函数、优化器配置、正则化强度、早停策略、评估指标阈值、数据采样比例

  4. OUTPUT

    预测值、分类概率、嵌入向量或策略动作,通常以 JSON/Protobuf 返回,不直接触发外部系统动作

FLOW

最小可用流程

01定义问题与指标明确任务类型(分类/回归/聚类等)、成功标准与业务容忍度,确定评估指标如准确率、F1、AUC 或业务转化率。
02构建数据管道采集代表性样本,执行清洗、去重、特征编码与划分(训练/验证/测试),确保数据版本可追溯。
03训练基线模型选择简单模型(如逻辑回归、决策树)建立性能基线,记录训练日志与验证指标,避免直接跳入复杂架构。
04迭代优化与验证根据失败模式调整特征、尝试新范式或集成方法,通过交叉验证与离线测试确认提升,防止过拟合。
05部署与监控将模型封装为服务接口,配置特征一致性检查、性能监控与告警阈值,建立数据漂移检测与重训触发机制。

COMPARE

范式选择对照

维度监督学习无监督学习强化学习
cells
cells
cells
cells
cells

PRACTICE

上线前检查清单

训练/验证/测试集划分是否反映真实分布且无数据泄露
评估指标是否与业务目标对齐且具备统计显著性
特征管道在训练与推理环境是否完全一致
是否已测试极端输入、缺失值与分布偏移场景
是否配置性能监控、告警阈值与降级回滚策略
模型版本、数据版本与超参是否完整记录可复现
CODE / PYTHON最小训练闭环示例
import os
from sklearn.datasets import make_classification
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import classification_report

# 模拟数据
X, y = make_classification(n_samples=1000, n_features=10, random_state=42)
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)

# 训练基线模型
model = RandomForestClassifier(n_estimators=50, max_depth=5, random_state=42)
model.fit(X_train, y_train)

# 评估
y_pred = model.predict(X_test)
print(classification_report(y_test, y_pred))

使用 scikit-learn 构建监督学习基线并输出评估指标

JSON / RESPONSE典型返回结构
{
  "precision": 0.89,
  "recall": 0.87,
  "f1_score": 0.88,
  "accuracy": 0.88,
  "class_distribution": {
    "0": 0.52,
    "1": 0.48
  },
  "sample_predictions": [
    {
      "input_id": "sample_001",
      "true_label": 1,
      "predicted_label": 1,
      "confidence": 0.94
    }
  ]
}

FAQ

常见问题

选型、用法与失败,不复述定义。
01谁在实际使用机器学习?

数据科学家定义问题与评估,算法工程师构建管道,业务方验收指标,运维负责部署监控。

明确角色边界可避免责任模糊与接口错位。
02监督学习与无监督学习怎么选?

有明确预测目标且能获取标签用监督;探索结构或无标签数据用无监督。

选错范式会导致目标函数与业务需求脱节。
03最小可用方式是什么?

用简单模型+干净数据+明确指标跑通训练到评估闭环,再逐步迭代。

避免过早陷入复杂架构而忽略数据与评估基础。
04生产环境最容易在哪里失败?

数据分布偏移、特征不一致、评估指标与业务脱节、缺乏监控与回滚机制。

决定必须建立可观测性与自动化干预流程。
05什么时候不需要机器学习?

规则明确稳定、数据量极小、需强可解释性或实时性要求极高且算力受限时。

控制系统复杂度与维护成本,避免过度工程。