返回笔记
深度学习

从零理解 Transformer 架构

Transformer 注意力机制 GPT BERT 深度学习

Transformer 是当前几乎所有大语言模型的基石。理解它,就理解了 GPT、BERT、Claude 这些模型的底层逻辑。

核心思想:自注意力

在 Transformer 出现之前,序列模型(如 RNN、LSTM)需要按顺序处理输入,无法并行。而 Transformer 的核心创新是自注意力机制,它可以让模型在编码每个词时,同时"看到"整个句子中所有其他词。

Q、K、V 是什么

自注意力的计算涉及三个矩阵:

  • Query (Q):当前词想要查询什么
  • Key (K):其他词"标注"了自己是什么
  • Value (V):其他词的实际内容表示

通过 Q 和 K 的点积计算注意力分数,再用 Softmax 归一化,最后加权到 V 上。这个过程的数学表达非常优雅:

Attention(Q, K, V) = softmax(QK^T / sqrt(d_k)) * V

多头注意力

单头注意力可能只关注一种关系(比如语法关系),多头注意力则让模型同时关注多种不同的关系模式,比如长距离依赖、语义相似性等。每个头有独立的 Q、K、V 矩阵,最后拼接起来。

位置编码

因为 Transformer 没有循环结构,完全不知道顺序信息,所以需要在输入中加入位置编码。原始论文用的是正弦/余弦函数编码,可以自然地编码相对位置信息。

编码器与解码器

原始 Transformer 有 Encoder 和 Decoder 两部分。GPT 只用了解码器(单向注意力),BERT 只用了编码器(双向注意力)。这也是两者最大的架构差异。