DeepSeek-V3 架构与训练创新
DeepSeek-V3 在架构和训练方法上实现了多项创新,以极低的训练成本达到了顶级模型的性能水平。
核心创新
- MLA(Multi-head Latent Attention):压缩 KV Cache
- 无辅助损失负载均衡:偏置项动态调整
- FP8 混合精度训练:降低训练成本
python
# MLA 核心思想
class MultiHeadLatentAttention(nn.Module):
def __init__(self, d_model, n_heads, kv_compression_ratio=0.25):
self.kv_dim = int(d_model * kv_compression_ratio)
self.k_down_proj = nn.Linear(d_model, self.kv_dim)
self.v_down_proj = nn.Linear(d_model, self.kv_dim)
self.k_up_proj = nn.Linear(self.kv_dim, d_model)
self.v_up_proj = nn.Linear(self.kv_dim, d_model)训练成本
DeepSeek-V3 的训练仅消耗 278.8 万 H800 GPU 小时,总成本约 557 万美元,显著低于同级别模型。