Skip to content

Transformer 架构演进之路

Transformer 自 2017 年提出以来,经历了从原始架构到各类高效变体的演进。理解其演进脉络有助于把握大模型的技术走向。

Transformer 演进

原始 Transformer

原始 Transformer 由 Encoder-Decoder 架构组成,核心是 Scaled Dot-Product Attention:

python
def scaled_dot_product_attention(Q, K, V):
    d_k = Q.shape[-1]
    scores = torch.matmul(Q, K.transpose(-2, -1)) / math.sqrt(d_k)
    attn = F.softmax(scores, dim=-1)
    return torch.matmul(attn, V)

三大演进方向

  1. 仅编码器(BERT):双向注意力,适合理解任务
  2. 仅解码器(GPT):因果注意力,适合生成任务
  3. 编码器-解码器(T5):序列到序列,适合翻译和摘要

为什么大模型选择仅解码器

仅解码器架构在推理时可以利用 KV Cache 实现增量生成,避免重复计算。这在大规模部署中具有显著的效率优势。

相关资源

最近更新