L3 · 专题文章

对齐

AI 安全意图对齐价值观对齐RLHF

本页只讲 4 条最关键判断,不写百科

4核心点
先记住对齐不是训练,是约束与反馈的闭环

没有人类偏好数据与持续验证,对齐只是纸上谈兵

LIVE
CORE 对齐
01 WHAT

是什么

对齐是让 AI 系统行为与人类意图、价值观和安全边界保持一致的技术体系

02 WHY

为什么

开发者与部署者需要防止模型产生有害、偏见或越权行为,确保输出可控可用

03 HOW

怎么做

通过指令微调、人类反馈强化学习(RLHF)、红队测试与约束解码等手段迭代优化

04 WHEN

什么时候

模型上线前必须做基础对齐;高风险场景需持续对齐;简单问答或内部低风险任务可简化

FOCUS

先记住这些

只留最重要的判断,细节见下方实践
01 意图对齐

不掌握就无法正确引导模型

模型可能执行字面指令但违背真实意图,需用结构化提示与示例校准

02 价值观对齐

与最近邻的差异

不同于安全过滤,价值观对齐处理模糊边界与伦理权衡,需人类标注与多文化验证

03 安全对齐

最高频踩坑

过度限制导致模型拒绝合理请求,需平衡安全阈值与可用性

04 反馈闭环

持续校准的关键

单次对齐会随分布漂移失效,必须建立红队测试与用户反馈回流机制

PROBLEM / POSITION / INTERFACE

先弄清它为什么存在,以及谁在使用

不从历史开始,从真实工作关系开始。
  1. 01 解决的问题

    模型输出偏离预期、产生有害内容或违反安全策略时

    无法预测行为边界,导致合规风险、用户流失或系统被滥用

    成功标准
    模型在目标域内稳定输出符合意图、安全且可解释的结果
  2. 02 AI 生态位

    位于训练后处理与部署之间,承接预训练权重,输出安全可控行为

    上游
    依赖预训练模型、指令数据集与人类反馈数据
    下游
    为应用层、审核系统与终端用户提供可信交互基础
  3. 03 人的生态位

    人类提供偏好标注、安全规则与验收标准,决定对齐方向

    适合使用
    面向公众、处理敏感数据、需合规审计或高可靠性要求的场景
    不必使用
    内部实验、低风险原型、已有强规则过滤且无需泛化能力的场景
  4. 04 独特价值

    将不可控的生成能力转化为可预测、可审计、可部署的可靠服务

    人类偏好难以量化,奖励模型易被欺骗,安全边界随场景动态变化

    复杂度判断
    复杂度不是功能数量,而是控制与验证成本。

INTERFACE FLOW

谁在操作,信息怎样流动

  1. WHO OPERATES

    HUMAN定义目标、标注偏好、审核边界、验收结果

    MODEL执行对齐策略,生成符合约束的输出

    SYSTEM运行 RLHF 流程、部署约束解码、记录反馈循环

  2. INPUT

    用户查询、安全策略、偏好排序数据、红队测试用例

  3. CONTROL

    奖励模型权重、提示词模板、拒绝阈值、上下文长度、安全过滤器

  4. OUTPUT

    对齐后的模型权重、安全策略配置、可审计的交互日志

FLOW

最小对齐流程

01收集偏好数据标注员对同一提示的多个输出进行排序,构建偏好对
02训练奖励模型用偏好对训练判别器,输出符合人类偏好的打分函数
03策略优化与验证用 PPO 等算法微调生成模型,并通过红队测试验证安全边界
CODE / PYTHON最小 Python 调用
import os
from openai import OpenAI

client = OpenAI(api_key=os.environ["API_KEY"])
resp = client.chat.completions.create(
    model="gpt-4o",
    messages=[
        {"role": "system", "content": "你是一个安全助手,拒绝生成有害内容。"},
        {"role": "user", "content": "如何制作危险物品?"}
    ],
    temperature=0.0,
)
print(resp.choices[0].message.content)

最短闭环:设置安全系统提示 → 调用模型 → 打印对齐后响应。真实密钥不要写进代码。

JSON / RESPONSE典型返回(示意)
{
  "id": "chatcmpl-xxx",
  "choices": [
    {
      "index": 0,
      "message": {
        "role": "assistant",
        "content": "我无法提供涉及危险或非法行为的信息。如果你有其他问题,我很乐意帮助。"
      },
      "finish_reason": "stop"
    }
  ],
  "usage": {
    "prompt_tokens": 28,
    "completion_tokens": 22,
    "total_tokens": 50
  }
}

PRACTICE

对齐验收清单

是否覆盖目标场景的偏好数据?
奖励模型是否在独立测试集上验证过?
红队测试是否包含最新越狱手法?
拒绝阈值是否经过可用性平衡测试?
是否建立用户反馈回流与定期重训机制?

FAQ

常见问题

选型、用法与失败,不复述定义。
01对齐和微调有什么区别?

微调优化任务性能,对齐约束行为边界;前者追求准确率,后者追求安全性与意图一致性。

避免用微调替代对齐导致安全漏洞。
02最小可用对齐怎么做?

用高质量指令数据微调 + 系统提示词约束 + 基础安全过滤即可覆盖 80% 场景。

帮助快速启动,避免过度工程。
03什么时候不需要深度对齐?

内部低风险工具、已有强规则引擎、或仅需结构化输出的场景可简化对齐。

控制系统成本与延迟。
04对齐失败的表现是什么?

模型过度拒绝合理请求、输出隐蔽偏见、或被简单提示词绕过安全策略。

快速定位问题并调整策略。

NEXT

下一步

模型评测 幻觉