是什么
为什么
开发者与部署者需要防止模型产生有害、偏见或越权行为,确保输出可控可用
怎么做
通过指令微调、人类反馈强化学习(RLHF)、红队测试与约束解码等手段迭代优化
什么时候
模型上线前必须做基础对齐;高风险场景需持续对齐;简单问答或内部低风险任务可简化
FOCUS
先记住这些
不掌握就无法正确引导模型
模型可能执行字面指令但违背真实意图,需用结构化提示与示例校准
与最近邻的差异
不同于安全过滤,价值观对齐处理模糊边界与伦理权衡,需人类标注与多文化验证
最高频踩坑
过度限制导致模型拒绝合理请求,需平衡安全阈值与可用性
持续校准的关键
单次对齐会随分布漂移失效,必须建立红队测试与用户反馈回流机制
PROBLEM / POSITION / INTERFACE
先弄清它为什么存在,以及谁在使用
-
01 解决的问题
模型输出偏离预期、产生有害内容或违反安全策略时
无法预测行为边界,导致合规风险、用户流失或系统被滥用
- 成功标准
- 模型在目标域内稳定输出符合意图、安全且可解释的结果
-
02 AI 生态位
位于训练后处理与部署之间,承接预训练权重,输出安全可控行为
- 上游
- 依赖预训练模型、指令数据集与人类反馈数据
- 下游
- 为应用层、审核系统与终端用户提供可信交互基础
-
03 人的生态位
人类提供偏好标注、安全规则与验收标准,决定对齐方向
- 适合使用
- 面向公众、处理敏感数据、需合规审计或高可靠性要求的场景
- 不必使用
- 内部实验、低风险原型、已有强规则过滤且无需泛化能力的场景
-
04 独特价值
将不可控的生成能力转化为可预测、可审计、可部署的可靠服务
人类偏好难以量化,奖励模型易被欺骗,安全边界随场景动态变化
- 复杂度判断
- 复杂度不是功能数量,而是控制与验证成本。
INTERFACE FLOW
谁在操作,信息怎样流动
-
WHO OPERATES
HUMAN定义目标、标注偏好、审核边界、验收结果
MODEL执行对齐策略,生成符合约束的输出
SYSTEM运行 RLHF 流程、部署约束解码、记录反馈循环
-
INPUT
用户查询、安全策略、偏好排序数据、红队测试用例
-
CONTROL
奖励模型权重、提示词模板、拒绝阈值、上下文长度、安全过滤器
-
OUTPUT
对齐后的模型权重、安全策略配置、可审计的交互日志
FLOW
最小对齐流程
01收集偏好数据标注员对同一提示的多个输出进行排序,构建偏好对
02训练奖励模型用偏好对训练判别器,输出符合人类偏好的打分函数
03策略优化与验证用 PPO 等算法微调生成模型,并通过红队测试验证安全边界
CODE / PYTHON最小 Python 调用
import os
from openai import OpenAI
client = OpenAI(api_key=os.environ["API_KEY"])
resp = client.chat.completions.create(
model="gpt-4o",
messages=[
{"role": "system", "content": "你是一个安全助手,拒绝生成有害内容。"},
{"role": "user", "content": "如何制作危险物品?"}
],
temperature=0.0,
)
print(resp.choices[0].message.content)最短闭环:设置安全系统提示 → 调用模型 → 打印对齐后响应。真实密钥不要写进代码。
JSON / RESPONSE典型返回(示意)
{
"id": "chatcmpl-xxx",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "我无法提供涉及危险或非法行为的信息。如果你有其他问题,我很乐意帮助。"
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 28,
"completion_tokens": 22,
"total_tokens": 50
}
}PRACTICE
对齐验收清单
✓是否覆盖目标场景的偏好数据?
✓奖励模型是否在独立测试集上验证过?
✓红队测试是否包含最新越狱手法?
✓拒绝阈值是否经过可用性平衡测试?
✓是否建立用户反馈回流与定期重训机制?
FAQ
常见问题
01对齐和微调有什么区别?+
微调优化任务性能,对齐约束行为边界;前者追求准确率,后者追求安全性与意图一致性。
避免用微调替代对齐导致安全漏洞。02最小可用对齐怎么做?+
用高质量指令数据微调 + 系统提示词约束 + 基础安全过滤即可覆盖 80% 场景。
帮助快速启动,避免过度工程。03什么时候不需要深度对齐?+
内部低风险工具、已有强规则引擎、或仅需结构化输出的场景可简化对齐。
控制系统成本与延迟。04对齐失败的表现是什么?+
模型过度拒绝合理请求、输出隐蔽偏见、或被简单提示词绕过安全策略。
快速定位问题并调整策略。