返回笔记
深度学习

理解 CLIP:连接文本和图像的桥梁

CLIP 多模态 对比学习 Stable Diffusion 零样本

CLIP 是 OpenAI 在 2021 年发布的里程碑式模型。它让计算机学会了"看图说话",是 Stable Diffusion、DALL·E 等图像生成模型的基础。

CLIP 做了什么

传统图像分类模型只能识别训练时见过的类别。CLIP 不一样,它理解文本和图像在同一个语义空间里的关系。你说"一只戴着墨镜的猫",它不需要训练过猫戴墨镜的图片,直接就能理解。

训练方式:对比学习

CLIP 用 4 亿组图文对做训练。核心思路很简单:

  1. 把所有图文对分别过文本编码器和图像编码器,得到文本向量和图像向量
  2. 匹配的图文对,让它们的向量尽可能接近
  3. 不匹配的图文对,让它们的向量尽可能远离

这叫做对比学习。训练完成后,文本向量和图像向量就在同一个空间里了。

零样本分类

这是 CLIP 最惊艳的能力。比如要分类图片是猫还是狗,不需要训练数据,直接把"一张猫的照片"和"一张狗的照片"转成文本向量,分别和图片向量算相似度,哪个高就是哪个。完全零样本。

CLIP 在图像生成中的角色

Stable Diffusion 用 CLIP 的文本编码器把 prompt 转成向量,指导扩散过程。所以 CLIP 相当于 Stable Diffusion 的"眼睛",决定了模型理解文字的质量。

CLIP 的局限

  • 对抽象概念理解差(比如"自由"、"幸福")
  • 容易忽略细节(数数不准,比如"三只猫"可能生成更多)
  • 有一定的社会和偏见问题
  • 对拼写敏感(bag 和 bog 完全不同)