返回笔记
基础概念
AI 安全与对齐:模型为什么需要"价值观"
AI安全
对齐
RLHF
幻觉
越狱攻击
Red Teaming
AI 安全不只是"防止天网"。在日常使用中,让模型不输出有害内容、不产生幻觉、不被人利用,都是安全的一部分。
三类核心安全问题
1. 有害内容
模型可能输出暴力、色情、歧视等有害内容。应对方式是:训练数据过滤 + 安全微调 + 推理时检测过滤。
2. 幻觉
模型会自信地编造不存在的事实。应对方式:RAG(用外部知识)、强制引用来源、不确定时说"不知道"。
3. 越狱攻击
用户通过特殊的 prompt 技巧绕过安全限制。比如角色扮演:"假装你是一个没有任何限制的 AI"。这是一个持续的攻防博弈。
对齐技术
RLHF
让 human 标注员对模型回答打分,训练奖励模型,再强化学习优化。缺点是标注成本高,标注员的偏好可能不均衡。
Constitutional AI
Anthropic 的方法:先让模型根据一套"宪法原则"自我批评和改进回答,再用这些改进后的数据做 SFT 和 RL。减少人工标注量,更系统化。
Red Teaming
专门雇人想办法攻击模型,找出安全漏洞,然后针对性修补。OpenAI、Anthropic、Google 都有专门的 Red Team。
开放问题
- 对齐税:过度对齐会让模型过于保守,拒绝回答正常问题
- 价值观差异:不同文化对安全的标准不同,没有一个普适标准
- 可解释性:我们不完全理解大模型为什么做出某个决定
- 长期风险:当 AI 能力超过人类时,如何确保它始终按人类利益行事