返回笔记
基础概念

AI 安全与对齐:模型为什么需要"价值观"

AI安全 对齐 RLHF 幻觉 越狱攻击 Red Teaming

AI 安全不只是"防止天网"。在日常使用中,让模型不输出有害内容、不产生幻觉、不被人利用,都是安全的一部分。

三类核心安全问题

1. 有害内容

模型可能输出暴力、色情、歧视等有害内容。应对方式是:训练数据过滤 + 安全微调 + 推理时检测过滤。

2. 幻觉

模型会自信地编造不存在的事实。应对方式:RAG(用外部知识)、强制引用来源、不确定时说"不知道"。

3. 越狱攻击

用户通过特殊的 prompt 技巧绕过安全限制。比如角色扮演:"假装你是一个没有任何限制的 AI"。这是一个持续的攻防博弈。

对齐技术

RLHF

让 human 标注员对模型回答打分,训练奖励模型,再强化学习优化。缺点是标注成本高,标注员的偏好可能不均衡。

Constitutional AI

Anthropic 的方法:先让模型根据一套"宪法原则"自我批评和改进回答,再用这些改进后的数据做 SFT 和 RL。减少人工标注量,更系统化。

Red Teaming

专门雇人想办法攻击模型,找出安全漏洞,然后针对性修补。OpenAI、Anthropic、Google 都有专门的 Red Team。

开放问题

  • 对齐税:过度对齐会让模型过于保守,拒绝回答正常问题
  • 价值观差异:不同文化对安全的标准不同,没有一个普适标准
  • 可解释性:我们不完全理解大模型为什么做出某个决定
  • 长期风险:当 AI 能力超过人类时,如何确保它始终按人类利益行事