Transformer 架构演进之路
Transformer 自 2017 年提出以来,经历了从原始架构到各类高效变体的演进。理解其演进脉络有助于把握大模型的技术走向。
原始 Transformer
原始 Transformer 由 Encoder-Decoder 架构组成,核心是 Scaled Dot-Product Attention:
python
def scaled_dot_product_attention(Q, K, V):
d_k = Q.shape[-1]
scores = torch.matmul(Q, K.transpose(-2, -1)) / math.sqrt(d_k)
attn = F.softmax(scores, dim=-1)
return torch.matmul(attn, V)三大演进方向
- 仅编码器(BERT):双向注意力,适合理解任务
- 仅解码器(GPT):因果注意力,适合生成任务
- 编码器-解码器(T5):序列到序列,适合翻译和摘要
为什么大模型选择仅解码器
仅解码器架构在推理时可以利用 KV Cache 实现增量生成,避免重复计算。这在大规模部署中具有显著的效率优势。