返回笔记
深度学习
理解 CLIP:连接文本和图像的桥梁
CLIP
多模态
对比学习
Stable Diffusion
零样本
CLIP 是 OpenAI 在 2021 年发布的里程碑式模型。它让计算机学会了"看图说话",是 Stable Diffusion、DALL·E 等图像生成模型的基础。
CLIP 做了什么
传统图像分类模型只能识别训练时见过的类别。CLIP 不一样,它理解文本和图像在同一个语义空间里的关系。你说"一只戴着墨镜的猫",它不需要训练过猫戴墨镜的图片,直接就能理解。
训练方式:对比学习
CLIP 用 4 亿组图文对做训练。核心思路很简单:
- 把所有图文对分别过文本编码器和图像编码器,得到文本向量和图像向量
- 匹配的图文对,让它们的向量尽可能接近
- 不匹配的图文对,让它们的向量尽可能远离
这叫做对比学习。训练完成后,文本向量和图像向量就在同一个空间里了。
零样本分类
这是 CLIP 最惊艳的能力。比如要分类图片是猫还是狗,不需要训练数据,直接把"一张猫的照片"和"一张狗的照片"转成文本向量,分别和图片向量算相似度,哪个高就是哪个。完全零样本。
CLIP 在图像生成中的角色
Stable Diffusion 用 CLIP 的文本编码器把 prompt 转成向量,指导扩散过程。所以 CLIP 相当于 Stable Diffusion 的"眼睛",决定了模型理解文字的质量。
CLIP 的局限
- 对抽象概念理解差(比如"自由"、"幸福")
- 容易忽略细节(数数不准,比如"三只猫"可能生成更多)
- 有一定的社会和偏见问题
- 对拼写敏感(bag 和 bog 完全不同)