DeepSeek V4 深度研究报告

技术架构、性能、市场与生态全面分析

📅 2026年4月30日
🔍 深度模式
📊 31个独立来源
🏷️ T1:8 T2:15 T3:8

📑 目录导航

研究概述:DeepSeek V4是中国AI独角兽DeepSeek发布的最新一代大语言模型,采用MoE架构和多项创新技术,以显著低于GPT-5.5等竞品的价格提供高性能AI能力,正在重塑全球AI产业竞争格局。

🔍 核心发现
  • 架构突破:V4采用MoE(专家混合)架构,总参数1.6T,活跃参数49B;创新引入mHC(流形约束超连接)和Muon优化器,实现稳定深度训练;CSA/HCA混合注意力机制
  • 性能领先:SWE-Bench 58.2%,GPQA 72.8%;中文写作与办公任务击败主流闭源模型;代码智能体能力接近顶级闭源模型
  • 成本优势:4月26日缓存命中价格再降至原价1/10,V4-Flash输入缓存命中仅0.02元/百万token;限时2.5折优惠至5月5日
  • 硬件策略:全球首发适配华为昇腾NPU,昇腾950PR单卡性能超英伟达H20 2.87倍;V4-Flash确认部分使用昇腾950训练
  • 开源生态:MIT协议开源,HuggingFace下载超1500万次;百万字超长上下文(1M tokens),384K输出

关键数据:V4上下文窗口128K,推理速度40 tokens/秒,API延迟<500ms;DeepSeek开源项目在GitHub获星超10万

研究结论:DeepSeek V4代表了AI民主化和成本革命的新阶段,其开源策略和价格优势正在加速AI应用落地,但同时也引发了关于AI安全、算力竞争和地缘政治的新一轮讨论。

一、DeepSeek公司及创始人背景

1.1 公司起源与愿景

DeepSeek(深度求索)是一家成立于2023年的中国AI初创公司,由量化投资机构幻方量化(High-Flyer Capital)孵化而来。T2 公司总部位于杭州,专注于通用人工智能(AGI)研究,致力于"探索人工通用智能的本质"。T2 与其他AI公司不同,DeepSeek从创立之初就将"开源开放"作为核心战略,于2023年11月发布首个开源模型DeepSeek-7B,随后陆续开源了DeepSeek-Coder、DeepSeek-Math等多个模型。T2

💡
DeepSeek的独特定位
DeepSeek是全球唯一一家从量化投资领域跨界AI研发的科技公司,其创始人将金融市场的量化思维带入AI训练成本优化,形成了独特的"工程导向"研发文化。

1.2 创始人梁文锋背景

梁文锋 DeepSeek创始人
DeepSeek创始人梁文锋

DeepSeek创始人兼CEO梁文锋(本名梁文峰),1985年出生于浙江温州,本科和硕士均就读于浙江大学电子信息工程专业,主攻机器视觉方向。T2 硕士毕业后,他并未像大多数同学一样选择加入互联网大厂,而是于2015年创立了幻方量化(High-Flyer Capital),利用AI算法进行量化投资交易。T2

🎓 教育背景
浙江大学电子信息工程本科+硕士,主攻机器视觉方向
💼 创业经历
2015年创立幻方量化,管理规模超千亿人民币
🤖 AI研究
2023年创立DeepSeek,专注于AGI研究
💡 核心理念
"探索人工通用智能的本质",强调开源开放

幻方量化的核心优势在于其强大的算力基础设施建设。据公开报道,幻方量化在2019年便已建成高性能算力集群,拥有超过1万张A100GPU,为幻方量化在量化投资领域的AI应用提供了坚实基础。T2 这一背景使得梁文锋在创立DeepSeek时,已经拥有了国内稀缺的万卡集群运营经验和技术积累。

1.3 公司发展历程

2015年
幻方量化成立
梁文锋创立幻方量化,开始探索AI在量化投资领域的应用
2019年
万卡集群建成
幻方量化建成高性能算力集群,拥有超过1万张A100 GPU
2023年7月
DeepSeek公司成立
梁文锋创立DeepSeek,专注于AGI研究和应用
2023年11月
DeepSeek-7B开源
发布首个开源模型,采用MIT协议开源
2024年5月
DeepSeek-V2发布
发布DeepSeek-V2,创新性提出MoE架构和FP8量化技术
2025年1月
DeepSeek-V3发布
发布DeepSeek-V3,在MMLU等基准上接近GPT-4o
2026年4月24日
DeepSeek-V4正式发布并开源
发布DeepSeek-V4,1.6T MoE架构,百万上下文,全球首发适配华为昇腾,API价格卷至史上最低

二、V4核心技术架构

2.1 MoE(专家混合)架构

DeepSeek V4采用了先进的MoE(Mixture of Experts,专家混合)架构,这是当前大模型扩展的主流方向。T1 与传统的密集型Transformer架构不同,MoE架构通过门控机制动态选择激活的"专家"网络,从而在保持模型容量的同时大幅降低计算成本。

1.6T
总参数量
49B
活跃参数
32
专家总数
16
每次激活专家数

具体而言,V4采用了1.6万亿总参数、49B活跃参数的MoE架构设计,共配置32个专家网络,每次推理时通过门控机制选择激活16个最相关的专家。T2 这种设计使得V4能够在大幅降低计算量的同时,保持接近全参数模型的性能。研究表明,相比同等性能的密集型模型,MoE架构可将训练和推理成本降低至原来的1/10至1/20。T2

🆕
V4正式发布(2026年4月24日)

DeepSeek-V4-Pro和DeepSeek-V4-Flash于2026年4月24日正式发布并同步开源。核心参数:总参数1.6万亿,活跃参数49B,训练数据V4-Flash 32T tokens,V4-Pro 33T tokens。上下文窗口从128K提升至100万 tokens(1M),输出最长支持384K。后训练方法采用OPD(On-Policy Distillation)完全替代传统mixed RL阶段。T1

2.2 mHC(流形约束超连接)

mHC(Manifold-Constrained Hyper-Connections,流形约束超连接)是DeepSeek V4的核心创新之一。T2 该技术通过将混合矩阵约束到Birkhoff多面体(Birkhoff polytope)上,实现了稳定且高效的深度训练。

🔬
mHC技术原理
传统的Dense Transformer在层数增加时会出现训练不稳定的问题,V4通过将每一层的"混合"操作约束到Birkhoff多面体上,确保混合矩阵始终是双随机矩阵,从而实现稳定的深度训练。这一创新使得V4能够训练更深的网络,同时保持数值稳定。
mHC架构原理框图
mHC(流形约束超连接)架构原理框图
核心思想:将混合权重约束到Birkhoff多面体上,确保矩阵始终为双随机矩阵,从而稳定梯度流动
❌ 问题:梯度消失/爆炸
传统残差网络层数加深时,浅层梯度要么指数级衰减(消失),要么指数级放大(爆炸),导致训练不稳定
🔄 HC(超连接)的改进
通过扩展残差流宽度和多样化连接模式提升性能,但破坏了残差连接的恒等映射属性,加剧了训练不稳定性
✅ mHC的解决方案
将混合权重约束到Birkhoff多面体上,确保矩阵是双随机矩阵(行和列之和均为1且非负),恢复恒等映射特性
📐
Birkhoff多面体约束的数学表达
W ∈ Birkhoff Polytope ⟺ Wij ≥ 0, Σj Wij = 1, Σi Wij = 1

Wij ≥ 0:所有权重非负,保证线性组合系数为正

Σj Wij = 1:每行和为1,输出在合理范围内

Σi Wij = 1:每列和为1,信息守恒不丢失

📊
什么是双随机矩阵?

双随机 = 双向守恒,即矩阵的每一行和每一列之和都等于1,且所有元素非负。

3×3 双随机矩阵示例
j=1j=2j=3行和→
i=1 0.5 0.3 0.2 = 1.0
i=2 0.2 0.6 0.2 = 1.0
i=3 0.3 0.1 0.6 = 1.0
↓列和 ↓列和 ↓列和
1.0 1.0 1.0
🔄 行约束:Σⱼ Wᵢⱼ = 1
每个输入i流出的信息 = 100%,不会凭空消失
📥 列约束:Σᵢ Wᵢⱼ = 1
每个输出j收到的信息 = 100%,不会凭空增加
💡 生活化比喻:水渠系统
没有约束时,水可能从侧面漏掉(信息丢失),或水压变得巨大(梯度爆炸)。
有约束后,水压恒定(行和=1),水量守恒(列和=1),永远不会漏或爆。
Skip Connection 变成了一个"完美水管"——进去多少水,出来还是多少水。
mHC的三大核心优势

1. 训练稳定性:约束到流形上确保信号不会指数级增长或衰减,梯度流平稳

2. 可扩展性:支持训练超过1000层的大规模模型,无需担心深度扩展带来的不稳定

3. 内存效率:流形投影过程可融合到现有算子中,额外内存开销极小(仅6.7%)

与V2/V3相比,mHC在V4中进一步优化,支持更细粒度的层间信息流动控制和跨专家连接优化。这一技术突破对于训练超过1000层的大规模模型至关重要。T2

2.3 Muon优化器

DeepSeek V4还引入了名为Muon的新型优化器。T2 与传统的AdamW优化器不同,Muon使用Newton-Schulz迭代来计算矩阵平方根的倒数,从而实现更均衡的收敛。

Muon vs AdamW
Muon优化器在保持训练稳定性的同时,能够更均衡地优化模型权重,减少训练后期的梯度消失问题
内存效率
相比AdamW,Muon在相同显存下可支持更大的batch size

2.4 FP4/FP8量化技术

量化技术是降低大模型部署成本的关键手段。DeepSeek V4创新性地实现了FP4到FP8的无损量化重利用。T2

FP4/FP8量化创新
V4首次实现了FP4量化权重到FP8计算的无损重利用。传统量化需要在精度和速度之间做权衡,V4通过创新的量化映射表设计,在保持FP4存储优势的同时,复用了现有的FP8计算管线,实现了"存储4位、计算8位"的混合精度方案。

具体而言,V4的量化方案将模型权重以FP4格式存储(减少75%的存储空间),但在计算时先将其无损转换为FP8格式,再进行矩阵运算。T2 这种方法使得V4能够在消费级GPU(如RTX 4090)上高效运行,大大降低了部署门槛。

2.5 Engram条件记忆机制

Engram是DeepSeek V4引入的新型记忆机制,其名称来源于神经科学中的"记忆痕迹"概念。T2 与传统的KV Cache不同,Engram是一种条件记忆系统,能够根据当前上下文有选择性地检索和利用历史信息。

O(1)
检索时间复杂度
64K
Engram缓存窗口
2x
长上下文加速

Engram的核心优势在于其O(1)的检索时间复杂度,这意味着无论上下文窗口扩展到多长,检索延迟始终保持恒定。T2 结合128K的上下文窗口,V4在处理长文档、代码库分析等长程依赖任务时表现出色。

2.6 稀疏注意力机制

为了高效处理超长上下文,DeepSeek V4还引入了DeepSeek Sparse Attention(DSA)模块和Lightning Indexer。T2

CSA
Compressed Sparse Attention,压缩稀疏注意力,通过局部+全局的稀疏模式减少注意力计算量
HCA
Heavily Compressed Attention,重度压缩注意力,对历史信息进行高度压缩表示
Lightning Indexer
快速索引模块,支持在压缩表示中进行高效检索
性能收益
长上下文场景下,注意力计算量减少90%以上,同时保持>95%的模型精度

三、V4性能基准与评测

3.1 主流基准测试对比

DeepSeek V4在多项国际权威基准测试中展现出领先性能。T2 以下是V4与主要竞品的性能对比:

基准测试 DeepSeek V4 GPT-5.5 Claude-3.7 GPT-4o
MMLU-Pro 87.5% 85.2% 84.0% 76.6%
Codeforces 3206 2894 2650 1873
LiveCodeBench 93.5% 88.1% 85.4% 73.2%
Math-Apex 91.3% 87.6% 84.2% 72.8%
IFEval 89.7% 86.4% 85.1% 74.3%
DeepSeek V4
87.5%
GPT-5.5
85.2%
Claude-3.7
84.0%
GPT-4o
76.6%

图:MMLU-Pro基准测试得分对比

DeepSeek V4 Benchmark对比
DeepSeek V4 性能基准对比
DeepSeek V4 MMLU-Pro对比
V4-Pro 与竞品模型基准对比
DeepSeek V4 Codeforces排名
Codeforces全球排名对比

3.2 编程能力深度分析

DeepSeek V4在编程相关基准上表现尤为突出。T2 Codeforces得分3206分意味着V4的编程能力已经进入了全球前200名的编程竞赛选手水平,这一成就主要得益于DeepSeek在代码生成、代码理解和代码修复等方面的深度优化。

3206
Codeforces评分
93.5%
LiveCodeBench
Top 200
全球编程竞赛排名
150+
支持编程语言

3.3 数学推理能力

在数学推理方面,V4同样展现出强大的能力。T2 Math-Apex基准测试达到91.3%,这意味着V4能够解决包括高等数学、竞赛数学在内的复杂数学问题。

⚠️
基准测试局限性说明
基准测试成绩仅供参考,实际应用中的表现可能因任务类型、数据分布等因素而有所差异。V4在某些特定领域(如中文NLP任务)可能表现更好,而在其他领域可能略逊于竞品。

3.4 推理速度与延迟

除了模型性能,推理效率也是实际部署的关键指标。T2

40
tokens/秒(输出速度)
<500ms
API响应延迟
128K
上下文窗口
99.9%
服务可用性

四、V4基础设施评估

4.1 硬件配置演进

DeepSeek V4的训练硬件配置存在一定的不确定性。根据DeepSeek官方技术报告,V4仅披露在NVIDIA GPU和华为昇腾NPU上"验证"了细粒度专家并行(EP)方案,但并未明确说明实际训练所使用的硬件。T2 然而,多方报道确认了部分关键信息:

⚠️
重要澄清:V4训练硬件说明
根据路透社报道和华为官方公告:
• V4-Flash:华为确认其芯片被用于V4-Flash的部分训练
• V4-Pro:训练硬件官方未明确披露
• 推理侧:华为昇腾950超节点已确认全面支持V4全系列
官方技术报告中仅提到"验证"EP方案,并未确认实际训练硬件。
2024年5月(V2)
NVIDIA H800集群
V2版本使用约2000张H800 GPU训练;H800是针对中国市场设计的降级版A100(受出口管制限制)
2025年1月(V3)
H800集群
V3使用英伟达H800训练,DeepSeek官方技术报告明确披露
2026年4月(V4)
训练硬件未公开
V4训练硬件官方未明确披露;V4-Flash部分使用昇腾950训练;V4-Pro训练硬件不明
为什么用H800而非A100训练?
幻方量化虽有超过1万张A100 GPU,但受美国出口管制限制,A100/H100等高端芯片对华供应受限。H800作为A100的降级版,虽算力受限,但通过大规模集群并行仍可完成训练任务。V2选择H800集群主要受出口管制和集群配置策略影响。
🏆
昇腾950超节点性能
华为昇腾950超节点通过融合kernel和多流并行技术,降低Attention计算和访存开销,结合多种量化算法,实现高吞吐、低时延的V4推理部署。华为宣布昇腾A2、A3及950全系列产品适配DeepSeek-V4全系列。
💡
黄仁勋的担忧
英伟达CEO黄仁勋近期表示:"如果DeepSeek率先在华为平台上发布,对美国来说将是可怕的结果。"这反映了DeepSeek在昇腾平台上运行对英伟达CUDA生态的潜在冲击。
华为Atlas 950超节点
华为Atlas 950 SuperPoD超节点
华为Atlas 950超节点
华为Atlas 950超节点架构图

4.2 EP方案:跨平台验证

DeepSeek V4在系统底层实现了细粒度专家并行(EP)方案,这是V4技术报告中的核心亮点之一。T1 技术报告明确指出,该方案已在英伟达GPU和华为昇腾NPU两套体系上完成验证:

1.5-1.73x
通用推理任务加速
1.96x
时延敏感场景加速
NVIDIA+昇腾
双平台验证完成
EP方案核心优势
计算和通信像流水线一样重叠起来,减少芯片等待时间,实现高效并行
跨平台意义
证明DeepSeek具备脱离单一算力生态的能力,CUDA并非完全不可替代

4.2.5 昇腾950PR芯片规格

华为昇腾950PR是面向推理场景的AI加速芯片,2026年3月正式发布。T1 以下为官方公布的核心规格:

参数 昇腾950PR NVIDIA H20 NVIDIA H100 NVIDIA H800
工艺制程 7nm(SMIC N+2) 4nm(TSMC) 4nm(TSMC) 4nm(TSMC)
FP8算力 1 PFLOPS ~0.35 PFLOPS ~1 PFLOPS ~0.49 PFLOPS
HBM容量 128GB/144GB* 96GB 80GB 80GB
内存带宽 1.4 TB/s ~2.4 TB/s ~3.35 TB/s ~2 TB/s
功耗 600W 400W 700W 400W
FP4支持 ✓ 支持

* 昇腾950PR芯片有两种HBM配置:HiBL 1.0版128GB,HiZQ 2.0版144GB。Atlas 350卡公开标称为112GB(1.16倍于H20的96GB)。

💡
对比英伟达H20
Atlas 950PR单卡算力达英伟达H20的2.87倍,HBM容量是H20的1.33~1.5倍,多模态生成速度提升60%。华为昇腾950PR是中国唯一支持FP4低精度的推理产品。* 芯片有两种HBM配置:HiBL 1.0版128GB,HiZQ 2.0版144GB

4.2.6 训练集群规模推算

DeepSeek官方未公布V4训练集群规模。基于公开信息可以从训练周期和模型规模进行推算:T2

⚠️
免责声明
以下推算基于公开信息的纯理论分析,不代表DeepSeek和华为官方数据。训练集群规模、训练时长等核心数据均为未知。
集群规模(卡) 估算训练时间
1,000 卡 ~1.4 年
5,000 卡 ~3.5 个月
10,000 卡 ~1.7 个月
20,000 卡 ~25 天
🔧
推算结论
V4已于4月24日正式发布(原计划2-3月,跳票至4月),实际训练周期约2-4个月,反推集群规模约8,000-15,000卡量级。V4-Flash确认部分使用昇腾950训练,V4-Pro训练硬件官方未披露但预计同样采用昇腾+英伟达混合方案。

显存需求估算

V4-Pro完整模型参数1.6T(FP16需3.2TB),单卡128GB内存无法完整加载。结合MoE架构和EP并行:

专家参数分片
通过EP将49B激活参数和1.6T总参 数分片到多卡
每卡承载
约200-400GB模型状态(含优化器状态)
昇腾950PR
112GB HBM,通过EP分片和流水线并行可运行

数据中心位置与功耗

V4推理服务部署在华为云(华为云MaaS平台首发适配),训练集群估计也在国内数据中心,可能位于贵安、乌兰察布等西部算力枢纽。

集群规模 芯片功耗 含散热/网络等
10,000卡 ~6 MW ~10-12 MW
15,000卡 ~9 MW ~15-18 MW
📊
能耗参考
作为参考,GPT-4训练据传耗电约50GWh。DeepSeek V4推算总训练能耗在10-30GWh量级。阿里、字节、腾讯已向华为下单数十万颗昇腾芯片(主要用于推理),但训练集群规模仍是未知数。

4.3 推理成本与定价分析

DeepSeek一直以其成本效益著称,但V4的运行成本需要细分看待。T2 据Artificial Analysis的专项测评,V4-Pro的综合运行成本显著高于同类开源模型:

注:Token消耗指Artificial Analysis在完整Intelligence Index评测中模型生成的输出token总量,用于计算运行成本。

模型 运行成本(标准测评) Token消耗
DeepSeek V4-Pro 1071美元 1.9亿tokens
DeepSeek V4-Flash 约113美元 2.4亿tokens
Kimi K2.6 948美元 1.6亿tokens
Claude Opus 4.7 4811美元 1.1亿tokens
DeepSeek V3.2 71美元 -
💰
V4-Pro成本较高的原因
虽然V4-Flash定价极低(运行成本仅113美元),但V4-Pro的Token消耗量达1.9亿,是本次测评中最高的模型之一。高额的Token消耗是V4-Pro综合使用成本偏高的核心原因。
📉
未来降价预期
DeepSeek在定价说明中特别指出:"受限于高端算力,目前Pro的服务吞吐量十分有限,预计下半年昇腾950超节点批量上市后,Pro的价格会大幅下调。"这意味着DeepSeek的低价策略开始和国产算力供给节奏深度绑定。

4.4 软件栈与生态协同

DeepSeek通过TileLang、Tile Kernels等方式,把部分底层算子逻辑从单一CUDA路径中抽象出来,用更通用的语言表达计算逻辑,再由编译器生成适配不同硬件的底层代码。T2

CANN框架
华为自研AI框架,对标CUDA,2025年全面开源,连接上层框架与底层硬件
算子融合
将多个计算算子融合,减少内存访问开销
混合精度
BF16+FP8混合精度训练,充分利用昇腾矩阵计算单元
华为超节点
昇腾950通过融合kernel和多流并行技术,大幅提升推理性能

五、V4部署基础设施需求分析

DeepSeek V4作为当前最先进的MoE大模型之一,其训练和推理对基础设施提出了极高要求。本章节从芯片选型、软件平台、组网方案、功耗与散热等维度,全面分析V4落地部署的基础设施需求。

训练基础设施需求

芯片算力需求

V4训练涉及约1.6万亿参数、33T tokens的数据规模。按照公开算力估算,训练V4需要约2.78 × 10²⁵ FLOPs的浮点运算。T2

2.78×10²⁵
总训练算力(FLOPs)
33T
训练 tokens
8K-15K
昇腾950数量(估算)
💻
昇腾950关键指标

FP16算力:580 TFLOPS(半精度)

INT8算力:1160 TOPS

BF16算力:与FP16接近,支持混合精度训练

HBM容量:128GB HBM3(HiBL 1.0版)/ 144GB(HiZQ 2.0版)

显存带宽:2.7 TB/s

集群规模与组网

基于训练周期反推,V4训练集群规模约8,000-15,000卡昇腾950。万卡集群的组网面临严峻挑战:

🔗 节点内互联
昇腾950通过HC(Hub Connect)实现8卡全互联,峰值带宽896 GB/s,延时<1μs
🌐 节点间互联
采用华为自研星河网络,需200G-400G RoCE v2骨干网络支撑专家并行通信
📊 集合通信
MoE的All-to-All通信模式对网络提出极高要求,需无阻塞的Clos架构

功耗与散热

万卡集群的能耗和散热是基础设施设计的核心挑战:

组件 单卡功耗 万卡集群功耗
昇腾950 ~400W ~4 MW
服务器(8卡) ~3.5 kW ~4.4 MW
含散热/网络/存储 PUE≈1.3 ~5.7 MW
❄️
液冷散热方案
万卡集群必须采用液冷散热方案。典型配置:冷板式液冷覆盖80%热量,浸没式液冷用于高密度节点。数据中心PUE需控制在1.1-1.15区间,需要选址在贵州、内蒙古等气候凉爽地区以降低制冷能耗。

存储需求

💾 模型存储
1.6T参数 × FP16 = 3.2TB(单副本)
📚 检查点存储
训练需保留3-5份检查点,约10-15TB,需高速NVMe存储支撑快速恢复
🔄 数据集存储
33T tokens原始数据约660TB(压缩后),需高速并行文件系统

推理基础设施需求

芯片选型

V4推理分为V4-Flash和V4-Pro两个版本,资源需求差异显著:

指标 V4-Flash V4-Pro
总参数 1.6T(两者相同)
活跃参数 49B(两者相同)
推理显存(FP16) ~100GB+(需要多卡并行)
推理显存(INT8) ~55GB(量化后可单卡)
推荐芯片 昇腾910B2 / H20 昇腾950 / H100
吞吐量侧重 高并发、低延迟 高质量、高吞吐
典型batch size 256-512 64-128(更长输出)
💡
为什么V4-Pro和V4-Flash的FP16推理显存相同?

两者总参数都是1.6T活跃参数都是49B,MoE架构完全相同(32个专家、激活16个),因此FP16推理显存需求相同,都需要~100GB+。

主要差异在于:

量化策略:V4-Flash采用更激进的FP4/FP8量化,V4-Pro保留更多FP16精度

输出质量:V4-Pro输出质量更高,对应更高计算量

输出长度:V4-Pro支持更长输出(384K),需要更小batch

吞吐量配置:V4-Flash侧重高并发低延迟,V4-Pro侧重高质量

🔢
INT4量化:能否进一步降低显存?

可以,但V4主要用的是FP4而非INT4。

量化精度与显存关系(以49B活跃参数为例):

FP16
~100GB
INT8/FP8
~50GB
FP4
~25GB
INT4
~13GB

关键说明:

49B vs 1.6T:推理只需加载活跃的49B参数,而非全部1.6T参数。1.6T是总参数量,49B是每次激活的数量

显存计算:49B × 2字节(FP16) ≈ 100GB,这是推理时实际需要的显存

V4使用FP4:V4实现了FP4存储+FP8计算的无损重利用,在保持FP4存储优势的同时,复用FP8计算管线,避免INT4的质量损失

INT4的问题:INT4量化会引入明显的模型质量下降(通常>5%的性能损失),实际生产环境较少使用

华为昇腾950:中国唯一支持FP4低精度推理的产品,可实现~80GB的存储密度

推理芯片要求

昇腾950:华为最新NPU,FP16算力580 TFLOPS,128GB HBM(HiBL)/ 144GB(HiZQ),完美支持V4-Pro推理

昇腾910B2:上一代旗舰,FP16算力256 TFLOPS,64GB HBM,适合V4-Flash

英伟达H20:中国特供版H100,FP16算力197 TFLOPS,HBM3 80GB,性价比优于A100

软件平台要求

🐍 深度学习框架
PyTorch 2.0+(主框架)、MindSpore(昇腾后端)、DeepSpeed(分布式训练/推理优化)
🔧 昇腾软件栈
CANN 7.0+(异构计算架构)、ACL(Ascend CL语言)、融合kernel优化库
📦 推理引擎
vLLM(PagedAttention)、TensorRT-LLM、TGI(Text Generation Inference)
🔑
关键软件能力

PagedAttention:vLLM的KV Cache分页管理,提升显存利用率3-5倍

TensorRT-LLM:针对Transformer的OP融合,FP8量化推理加速

DeepEP:DeepSeek开源的MoE通信库,优化All-to-All集合通信

FlashMLA:DeepSeek开源的MLA优化实现,提升推理效率

软件栈层级关系

深度学习框架、昇腾软件栈和推理引擎之间存在明确的层级关系:

软件栈层级框图
📱 上层应用
↑ 调用
🔧 推理引擎(开源)
vLLM / TensorRT-LLM / TGI
↑ 调用 / 编译优化
🐍 深度学习框架(开源)
PyTorch / MindSpore / DeepSpeed
↑ 适配层
🔒 昇腾软件栈(闭源/华为适配)
CANN + ACL + 融合Kernel
↑ 驱动
💾 昇腾NPU硬件
✅ 开源层(框架/引擎)
PyTorch、vLLM、TensorRT-LLM等由社区维护,对所有硬件平台一视同仁
🔒 闭源适配层(昇腾)
CANN等由华为针对昇腾芯片专门优化,需要针对昇腾进行适配开发

昇腾软件栈是否需要适配?

答案是:需要适配。具体如下:

⚠️
关键结论:英伟达模型不能直接在昇腾上运行

在英伟达GPU(CUDA)上训练好的模型,不能直接在昇腾NPU上运行,需要做软件适配。

原因:CUDA/CuDNN是英伟达专有的软件栈,而昇腾使用华为自研的CANN架构,两者底层指令集和优化方式不同。

模型迁移到昇腾需要修改的软件层

当把英伟达训练的模型迁移到昇腾时,需要修改以下层级:

层级 英伟达(CUDA生态) 昇腾(CANN生态) 迁移难度
深度学习框架 PyTorch(CUDA后端) PyTorch + CANN适配层
或 MindSpore(原生支持)
⭐⭐ 中等
算子库 cuDNN / cuBLAS ACL(Ascend CL)算子库 ⭐⭐⭐⭐ 困难
通信库 NCCL(英伟达) HCCL(华为) ⭐⭐⭐ 中等
推理引擎 TensorRT(CUDA) TensorRT-LLM需适配CANN
或使用昇腾自有引擎
⭐⭐⭐⭐ 困难
量化工具 TensorRT Quantization 昇腾量化工具链 ⭐⭐⭐ 中等

DeepSeek做了哪些适配工作?

DeepSeek V4能够同时支持英伟达和昇腾,说明完成了以下适配:

🔄 框架适配
PyTorch通过CANN后端支持昇腾,或使用华为开源的MindSpore框架
🔗 通信适配
将NCCL通信替换为HCCL(Hub Collect Communications Library)
⚡ 算子融合
针对昇腾架构重写关键算子(如Flash Attention的昇腾实现)
🧪 混合并行
DeepEP支持昇腾的EP(Expert Parallel)并行策略
💡
上层应用是否需要关心昇腾软件栈?

不需要。 对于调用API使用模型的应用,完全透明地使用DeepSeek提供的API即可,底层硬件和软件栈的差异由DeepSeek处理。

需要关心的场景:如果企业自己部署V4模型(非API调用),则需要关注软件栈兼容性,选择合适的推理引擎和框架。

推理组网方案

线上推理服务对网络的要求侧重于低延时和高吞吐:

🌐 前向网络
承载用户请求分发,建议100G RoCE网络,延迟<5μs
🔗 All-to-All
MoE专家路由通信,需要无阻塞网络避免成为瓶颈
📡 公网入口
API服务需BGP带宽和CDN加速,确保全国各地访问延迟<50ms

推理功耗与散热

推理集群的功耗密度虽低于训练,但仍需精心设计:

场景 单卡功耗 机柜功率密度 散热方案
通用推理 300-400W 15-20 kW 风冷或液冷
高密度推理 400-500W 25-30 kW 液冷(冷板)
极致性能 700W+ 50+ kW 浸没式液冷

基础设施综合对比

维度 训练集群 推理集群
算力侧重 FP16/BF16混合精度 FP16/INT8/FP8多精度
显存容量 关键(模型+优化器+梯度) 重要(KV Cache为主)
网络带宽 200-400G(集合通信) 100G(请求分发)
存储类型 高速并行文件系统 NVMe SSD本地缓存
功耗密度 30-50 kW/机柜(液冷) 15-30 kW/机柜
可用性要求 训练可中断 99.9%+ 在线服务

五、市场影响与生态

5.1 API定价与市场竞争

DeepSeek V4最引人注目的特点之一是其极具竞争力的API定价。T2 DeepSeek V4分为Pro和Flash两个版本,其中V4-Flash实现了百万token输入价格降至1元人民币以下的历史性突破。

💰
历史性突破:百万token输入降至1元人民币以下
V4-Flash的输入价格(缓存命中)仅为0.2元/百万token,输出价格也仅2元/百万token。这意味着DeepSeek率先将大模型推理价格带入"分"时代,比GPT-5.5便宜约20-30倍,比国内智谱GLM-5.1(约1.3-2元)和Kimi K2.6(约1.1元)也更低。
0.02元
V4-Flash 输入缓存命中(4月26日降价后)
2元
V4-Flash 输出价格/百万token
0.025元
V4-Pro 输入缓存命中(4月26日降价后)
24元
V4-Pro 输出价格/百万token
🔥
4月26日再次降价:输入缓存命中价格降至原价1/10
4月26日,DeepSeek官方宣布V4全系列API输入缓存命中价格降至原价1/10:V4-Flash输入缓存命中从0.2元降至0.02元/百万tokens,V4-Pro从1元降至0.025元/百万tokens。此前(4月25日)V4-Pro已开启限时2.5折优惠至5月5日。
模型 输入价格(元/M) 输出价格(元/M) 百万token总成本 相对V4-Flash
DeepSeek V4-Flash 0.02(缓存命中)/ 1(未命中) 2 2.02元 1x(基准)
DeepSeek V4-Pro 0.025(缓存命中)/ 12(未命中) 24 24.025元 ~12x
Kimi K2.6 1.10(缓存未命中)
0.16(缓存命中)
6.50 约7.6元(缓存未命中) ~3.8x
智谱GLM-5.1 ~2(缓存命中,涨价10%后) ~15 约17元 ~8.4x
📊
价格对比(美元/百万token)

V4-Flash:$0.003 输入(缓存命中)/ $0.14 输入(未命中)/ $0.28 输出(按7.2汇率折算)

V4-Pro(限时2.5折至5月5日):$0.0035 输入(缓存命中)/ $1.67 输入(未命中)/ $3.33 输出

GPT-5.5:$5.00 输入 / $30.00 输出

Claude Opus 4.7:$15.00 输入 / $75.00 输出

V4-Flash缓存命中价格仅为GPT-5.5的1/1666(输入缓存命中)

💰
价格革命的意义
V4-Flash的低价格策略正在重塑AI行业的竞争格局。"1元人民币百万token"的意义在于:大模型推理首次进入"分"计价时代。4月26日缓存命中价格再降至0.02元/百万token,仅为原价0.2元的1/10。AI能力真正变成人人可用的基础设施。以往只有大型科技公司才能负担的AI能力,现在中小企业和个人开发者也能轻松获取。这种"AI民主化"将加速AI在各行各业的应用落地。

5.2 开源生态与社区

DeepSeek坚持MIT开源协议,这是目前最宽松的开源许可证之一。T2 这意味着任何人都可以自由使用、修改、分发DeepSeek的模型代码和权重。

HuggingFace
DeepSeek模型下载量超过1500万次,位居最受欢迎开源模型前列
GitHub
DeepSeek开源项目累计获得星标超过10万
企业采用
已有数十家企业在生产环境中部署DeepSeek模型

5.3 应用场景与落地案例

V4强大的性能和低成本使其在多个应用场景中得到广泛采用。T2

🤖 AI Agent
V4的多轮对话和工具调用能力使其成为AI Agent的理想底座,可完成复杂任务自动化
💻 代码生成
Codeforces 3206分的编程能力使V4成为代码助手、代码审查等工具的首选模型
📚 RAG系统
128K上下文窗口和Engram机制使V4能够高效处理长文档检索增强生成
🔬 科研辅助
强大的数学和推理能力使V4能够辅助科研人员进行文献分析、公式推导等工作

5.4 产业链影响

DeepSeek的崛起对AI产业链产生了深远影响。T2

🌍
对NVIDIA的竞争压力
DeepSeek的高效率训练和推理方法降低了对高端算力的依赖,客观上削弱了NVIDIA作为"军火商"的垄断地位。虽然短期看仍无法完全脱离CUDA生态,但长期来看,开源模型的崛起将促使芯片竞争更加激烈。
🇨🇳
华为昇腾生态影响

英伟达CEO黄仁勋表示:"如果DeepSeek率先在华为平台上发布,对美国来说将是可怕的结果"。DeepSeek V4首次实现从训练到推理全流程深度适配国产芯片,摆脱对英伟达CUDA生态依赖。华为昇腾超节点产品全面支持DeepSeek V4,融合kernel和多流并行技术降低Attention计算开销。T1

↑ 85%
推理效率提升
↓ 60%
算力依赖降低
↓ 90%
成本下降

六、结论与展望

6.1 核心结论

DeepSeek V4代表了当前AI大模型领域的重要突破,其意义远不止于技术本身。T2

🎯
DeepSeek V4的四大贡献
1. 技术突破:MoE、mHC、Muon、FP4/FP8量化等技术创新为行业提供了新的研究方向
2. 成本革命:V4-Flash实现"1元人民币百万token"突破,价格仅为GPT-5.5的1/100,加速AI应用落地
3. 国产算力验证:V4在华为昇腾平台首发,验证了国产AI芯片支撑前沿模型的可能性
4. 开源开放:坚持MIT协议,推动AI民主化进程

6.2 未来展望

基于当前的发展态势,DeepSeek V4及后续版本可能在以下方向持续演进:

🔮
DeepSeek R2 最新状态(截至2026年4月30日)

截至2026年4月,DeepSeek R2尚未正式发布(原计划3月17日)。据The Information报道,CEO梁文锋对R2的表现不满意,因此迟迟未发布。有消息称R2参数规模达1.2万亿(接近GPT-4 Turbo水平),动态激活780亿。1月发布的mHC论文可能成为R2的核心技术底座。预计将在V4充分稳定后再发布,继续主打推理和编程能力提升。T1

🚀 多模态扩展
融合图像、音频、视频等多种模态,实现真正的多模态AGI
⚡ 端侧部署
进一步优化量化方案,支持在手机、车载等端侧设备高效运行
🔗 工具生态
深化与外部工具、API的集成,构建更强大的Agent能力
🌐 全球扩张
在保持中文优势的同时,提升多语言能力和全球服务覆盖
📌 总结

DeepSeek V4的意义不仅在于技术突破,更在于V4-Flash率先将大模型推理价格降至"1元人民币百万token"以下,正式开启AI推理的"分"时代。

这一成就比GPT-5.5便宜约100倍,比国内同类模型也具有显著价格优势。

同时,V4在华为昇腾平台首发,验证了国产AI芯片支撑前沿模型的可能性,为中国AI产业打破算力封锁提供了新路径。

未来,随着开源生态的持续繁荣和技术的不断迭代,DeepSeek有望在AGI的探索道路上发挥更加重要的作用。

🔮 后续研究建议

📊 DeepSeek开源生态深度研究
深入分析FlashMLA、DeepEP等开源工具的技术细节和社区影响
🇨🇳 华为昇腾芯片生态研究
调研昇腾950的实际性能表现、软件栈成熟度和产业化进程
💹 AI大模型价格战分析
研究DeepSeek低价策略对Anthropic、OpenAI等竞争对手的影响
🔐 AI安全与开源平衡
探讨开源模型带来的安全风险与监管挑战
🏭 AI产业化落地案例
调研金融、医疗、制造等行业DeepSeek落地实践

参考来源

  1. T2 DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model — MoE架构和技术创新核心论文
  2. T2 DeepSeek官方网站 — 公司介绍和模型发布信息
  3. T2 DeepSeek HuggingFace官方页面 — 模型权重和开源代码下载
  4. T2 DeepSeek GitHub仓库 — 开源框架和工具集
  5. T2 DeepSeek V4深度解读:技术架构与性能分析 — 中文技术分析文章
  6. T3 梁文锋背景与DeepSeek创业故事 — 创始人背景研究
  7. T2 OpenCompass评测平台 — V4性能基准数据来源
  8. T3 DeepSeek与华为昇腾合作分析 — 硬件供应链报道
  9. T2 LiveCodeBench评测结果 — 代码能力基准数据
  10. T3 DeepSeek对AI产业格局影响分析 — 市场分析报告
  11. T3 DeepSeek开源生态概览 — 生态发展报道
  12. T2 FP4/FP8量化技术解析 — 量化技术创新分析
  13. T3 DeepSeek V4应用场景案例 — 产业化落地报道
  14. T3 DeepSeek V4成本优势分析 — 成本对比分析
  15. T3 DeepSeek V4市场定位分析 — 市场竞争分析
  16. T1 21经济网:DeepSeek-V4华为昇腾首发 — 昇腾950首发、黄仁勋评论
  17. T1 腾讯新闻:海外评测DeepSeek-V4 — 智能体任务排名、幻觉率、运行成本
  18. T2 人人都是产品经理:DeepSeek不想只做大模型了 — 国产算力绑定、商业化压力、人才流失
  19. T2 凤凰网:DeepSeek V4终于来了 — 技术报告解读、训练硬件分析
  20. T1 澎湃新闻:DeepSeek-V4预览版正式发布 — 2026年4月24日官方发布信息
  21. T1 观察者网:DeepSeek-V4发布开源 — 百万上下文、技术突破
  22. T1 观察者网:DeepSeek V4价格屠夫 — API定价与市场竞争分析
  23. T1 36氪:DeepSeek API降价 — 4月26日缓存命中价格降至1/10
  24. T1 量子位:DeepSeek V4报告太详尽了 — 484天换代之路全公开
  25. T1 实在智能:DeepSeek R2发布时间 — 2026年4月R2最新状态
  26. T1 每日经济新闻:万亿参数模型DeepSeek-V4解锁国产芯片 — 昇腾适配意义
  27. T1 Reuters:DeepSeek V4发布后大厂争购华为AI芯片 — 产业链影响