Skip to content

DeepSeek-V3 架构与训练创新

DeepSeek-V3 在架构和训练方法上实现了多项创新,以极低的训练成本达到了顶级模型的性能水平。

DeepSeek-V3 架构

核心创新

  1. MLA(Multi-head Latent Attention):压缩 KV Cache
  2. 无辅助损失负载均衡:偏置项动态调整
  3. FP8 混合精度训练:降低训练成本
python
# MLA 核心思想
class MultiHeadLatentAttention(nn.Module):
    def __init__(self, d_model, n_heads, kv_compression_ratio=0.25):
        self.kv_dim = int(d_model * kv_compression_ratio)
        self.k_down_proj = nn.Linear(d_model, self.kv_dim)
        self.v_down_proj = nn.Linear(d_model, self.kv_dim)
        self.k_up_proj = nn.Linear(self.kv_dim, d_model)
        self.v_up_proj = nn.Linear(self.kv_dim, d_model)

训练成本

DeepSeek-V3 的训练仅消耗 278.8 万 H800 GPU 小时,总成本约 557 万美元,显著低于同级别模型。

相关资源

最近更新