DeepSeek-V4 的核心命题
DeepSeek-V4(即 deepseek-v4-flash / deepseek-v4-pro)在多项基准测试中与 GPT-4o、Claude 3.5 Sonnet 持平甚至领先,而其 API 价格仅为 OpenAI 的 1/10 到 1/30。这一"性能/成本"比的来源,根植于其架构设计的根本性创新。
核心架构:MoE(混合专家)
DeepSeek 系列的核心技术是 Mixture of Experts(混合专家模型)。
传统 Dense 模型(如 GPT-3):
每次推理 → 激活全部 1750 亿参数
MoE 模型(如 DeepSeek-V4):
每次推理 → Router 选择 2-4 个 Expert
→ 仅激活 20~30B 有效参数
→ 总参数可达 600B+,但计算量等同于 20B 模型
| 指标 | Dense 模型 | MoE 模型 |
|---|---|---|
| 总参数量 | 与激活量相同 | 远大于激活量 |
| 推理计算量 | 高 | 低(仅激活子集) |
| 训练成本 | 高 | 中等 |
| 能力上限 | 受限于计算 | 可扩展至更大参数 |
Multi-head Latent Attention(MLA)
DeepSeek 独创的 MLA 注意力机制大幅压缩 KV Cache 占用:
标准 Multi-Head Attention:
KV Cache 大小 = num_heads × head_dim × seq_len × 2
MLA(低秩压缩):
将 KV 压缩到低维潜空间,再展开计算
KV Cache 减少约 85%,推理吞吐量提升 3-5×
这使 DeepSeek 在长上下文推理(128K tokens)时,显存占用远低于同规模的 Dense 模型。
训练策略:FP8 混合精度
| 训练阶段 | 精度 | 说明 |
|---|---|---|
| 前向传播 | FP8 | 显存节省约 50% |
| 反向传播 | BF16 | 保持梯度稳定性 |
| 权重存储 | BF16 | 保持精度 |
| 优化器状态 | FP32 | 精确更新 |
FP8 训练将显存需求降低约 50%,同时通过动态缩放因子保持数值稳定,这是其能用 2048 块 H800 GPU 训练 6000 亿 token 的关键。
GRPO 强化学习(用于推理模型)
DeepSeek-R 系列(推理版本)采用 Group Relative Policy Optimization(GRPO),相比 PPO:
PPO:需要单独的 Critic 模型(增加 50% 显存)
GRPO:用同一批问题的多个输出相互比较作为基准
→ 无需 Critic 模型
→ 在数学、代码、逻辑任务上 RL 效率更高
成本对比
GPT-4o API:$5 / 1M input tokens
Claude 3.5 Sonnet:$3 / 1M input tokens
DeepSeek-V4-Pro:约 $0.27 / 1M input tokens(中文缓存后更低)
对于每月消耗 100M tokens 的中型应用,月度 API 成本差距达 $470 vs $27。
小结
DeepSeek-V4 的低成本高性能来自三个协同创新:MoE 架构(稀疏激活降低推理成本)、MLA 注意力(KV Cache 压缩提升吞吐)、FP8 混合精度训练(降低训练显存需求)。理解这套组合拳,有助于评估任何声称"低成本大模型"时背后的技术路径是否可信。