L3 · 专题文章

概率统计

数学基础不确定性量化模型评估

本页只讲 4 条最关键判断,不写百科

4核心点
先记住统计结论的可靠性取决于样本代表性与假设合理性

脱离数据质量谈 p 值或置信区间毫无意义,错误假设会导致系统性偏差。

LIVE
CORE 概率统计
01 WHAT

是什么

概率论研究随机事件发生的可能性,统计学通过样本推断总体特征。

02 WHY

为什么

AI 系统需在噪声数据中做预测与决策,概率统计提供量化不确定性与验证模型效果的数学工具。

03 HOW

怎么做

明确问题类型(分类/回归/分布拟合),选择对应分布与检验方法,用 Python 的 scipy/numpy 快速验证。

04 WHEN

什么时候

数据含噪声、需评估置信度或做假设检验时使用;规则明确且确定性强的场景无需引入。

FOCUS

先记住这些

只留最重要的判断,细节见下方实践
01 分布选择

选错分布会导致推断完全偏离实际

正态分布适用于独立同分布的连续变量,二项/泊松适用于计数数据;用 QQ 图或 KS 检验验证假设。

02 统计推断

用样本估计总体需控制偏差与方差

中心极限定理保证大样本下均值近似正态,但小样本需用 t 分布;Bootstrap 可缓解分布未知问题。

03 假设检验

p 值不是真理,需结合效应量与业务背景

p<0.05 仅表示在零假设下观察到当前结果的概率低,不代表效应大小或实际重要性。

04 不确定性量化

置信区间比点估计更能反映真实风险

95% 置信区间表示重复抽样时 95% 的区间会覆盖真值,用于决策时需结合成本收益分析。

PROBLEM / POSITION / INTERFACE

先弄清它为什么存在,以及谁在使用

不从历史开始,从真实工作关系开始。
  1. 01 解决的问题

    面对含噪声的业务数据或模型输出,无法判断结果是否可靠或差异是否显著。

    凭直觉判断易受小样本波动误导,导致模型过拟合或业务决策失误。

    成功标准
    能用统计指标量化不确定性,通过检验确认差异显著性,并据此调整模型或策略。
  2. 02 AI 生态位

    为机器学习提供损失函数设计、正则化、评估指标与置信区间计算的基础。

    上游
    依赖数据质量、采样方法与业务背景知识。
    下游
    为模型训练、A/B 测试、异常检测与风险评估提供量化依据。
  3. 03 人的生态位

    帮助数据科学家与算法工程师设计实验、解读结果并控制风险。

    适合使用
    需评估预测可靠性、比较方案差异或量化风险时。
    不必使用
    数据量极小且无法补充,或问题本质为确定性逻辑推理时。
  4. 04 独特价值

    提供可验证的量化框架,区分信号与噪声,避免主观偏见。

    分布假设常被违反,小样本下检验效力低,多重比较易产生假阳性。

    复杂度判断
    复杂度不是功能数量,而是控制与验证成本。

INTERFACE FLOW

谁在操作,信息怎样流动

  1. WHO OPERATES

    HUMAN定义问题、选择分布与检验方法、解读结果并做决策

    SYSTEM执行计算、生成统计量与可视化图表

  2. INPUT

    观测数据集、假设条件、显著性水平阈值

  3. CONTROL

    分布假设、检验类型(单/双尾)、置信水平、样本量

  4. OUTPUT

    统计量(均值/方差/p 值等)、置信区间、检验结论,用于模型调优或业务决策

CODE / PYTHON最小 Python 调用
import numpy as np
from scipy import stats

# 生成模拟数据(正态分布)
data = np.random.normal(loc=50, scale=10, size=100)

# 计算均值与 95% 置信区间
mean = np.mean(data)
sem = stats.sem(data)
ci = stats.t.interval(0.95, len(data)-1, loc=mean, scale=sem)

# 单样本 t 检验(检验均值是否等于 55)
t_stat, p_value = stats.ttest_1samp(data, 55)

print(f"均值: {mean:.2f}, 95% CI: ({ci[0]:.2f}, {ci[1]:.2f})")
print(f"t={t_stat:.3f}, p={p_value:.4f}")

最短闭环:生成数据 → 计算置信区间 → 执行 t 检验 → 输出结果。

JSON / RESPONSE典型返回(示意)
{
  "mean": 49.82,
  "confidence_interval": [
    47.85,
    51.79
  ],
  "t_statistic": -2.134,
  "p_value": 0.0352,
  "conclusion": "在 0.05 水平下拒绝零假设,均值显著不等于 55"
}

PRACTICE

统计推断自检清单

数据是否满足所选分布的基本假设(独立性、同分布、正态性)
样本量是否足够支撑检验效力(通常每组 >30 或使用功效分析)
是否报告了效应量与置信区间,而非仅依赖 p 值
多重比较时是否进行了校正(如 Bonferroni 或 FDR)

FAQ

常见问题

选型、用法与失败,不复述定义。
01p 值小于 0.05 就代表结果可靠吗?

不代表。p 值仅反映在零假设下观察到当前结果的概率,需结合效应量、样本量与业务背景综合判断。

避免将统计显著性等同于实际重要性,防止过度解读。
02数据不满足正态分布怎么办?

使用非参数检验(如 Mann-Whitney U、Kruskal-Wallis)或数据变换(对数、Box-Cox),或采用 Bootstrap 方法。

错误假设分布会导致推断失效,非参数方法更稳健。
03置信区间和预测区间有什么区别?

置信区间估计总体参数(如均值)的范围,预测区间估计单个新观测值的范围,后者更宽。

混淆两者会导致对模型预测能力的误判。
04什么时候不需要做假设检验?

当数据为全量总体、差异已明确可见,或决策成本极低时,可直接基于描述统计行动。

避免过度分析,节省计算与时间成本。