DeepSeek 进化之路

从 V1 到 V4 — 一家中国 AI 公司如何用两年改写全球格局 · 解说稿
配音 Xiaoxiao · 7分31秒
2024.01
DeepSeek-MoE — 细粒度专家的选择
把大专家切碎,让每个小专家学不同的东西
2024.05
DeepSeek-V2 / MLA — KV 缓存的压缩革命
4K 照片压缩成 JPEG,文件小了 90%,内容还在
2024.12
DeepSeek-V3 — 550 万美元的训练奇迹
FP8 训练 + MTP,成本不到 GPT-4 的 5%
2025.01
DeepSeek-R1 — 那个 Aha Moment
模型自己学会了思考和反思,数学超 o1
2026.04
DeepSeek-V4 — 百万上下文 + 三轨注意力
1.6T 参数,1M 上下文,KV 只用 2%
2026.07
V4 满血版 + 峰谷计价 — 像交电费一样用 AI
国内首个大模型分时计费,算电协同,AI 从科技产品变成基础设施
第一章
那个不够聪明的抉择 DeepSeekMoE
2024.01arXiv:2401.06066

2024 年初,做大模型只有两条路。

第一条路:做一个密集模型。就像让一个天才什么都会,所有知识都装在一个大脑里。OpenAI 的 GPT-4 走这条路。效果最好,但也最贵。

第二条路:做一个混合专家模型,MoE。就像开一家医院,每个科室只看自己的病。病人来了,先分诊,然后送到对应的科室。每个专家只处理自己擅长的部分。

类比
MoE 就像一个大公司,有 100 个部门,但每次只派 8 个人去干活。总员工数很多,但每次花的人力很少。听起来很聪明,对吧?

但 DeepSeek 选了一条更笨的路。当时所有做 MoE 的人,都把专家做得很大——每个专家是一个巨大的神经网络。DeepSeek 反其道而行:把专家切碎。

[ 视觉:一个大方块 切成 8 个小方块,用线连接起来 ]

他们发现,专家太大了,学的东西就会重复。如果把一个大专家拆成 8 个,总参数不变,但每个小专家可以学不一样的东西——一个学语法,一个学数学,一个学代码。这就是细粒度专家混合。再加上一个共享专家来兜底,确保常见问题总有人能处理。

V1 的贡献不是性能最好,而是方向对了。 后来所有国产模型的架构,都沿着这条路走。
第二章
一个公式,省了 90% 的内存 MLA
2024.05DeepSeek-V2arXiv:2405.04434

V1 证明了方向,但有个致命问题——太慢了。

问题出在注意力机制上。每个 token 在处理时,都要回过头去看前面所有的 token。看过的结果要存起来——这叫 KV 缓存。

类比
KV 缓存就像你看书时做的笔记。你看完第 100 页,要记得第 1 页的内容。如果每次都要翻回去重读,那就太慢了。所以你把重点记在便签上。但问题是——你的便签越来越多,100 页的书要 100 张便签,100 万页的书……你的桌子放不下。

DeepSeek 的团队问了一个问题:这些便签能不能写得精简一点?

他们发明了 MLA——多头潜在注意力。核心思想很简单:不要直接存 KV 缓存,而是先把它压缩到一个更小的空间里。就像你把一张 4K 照片压缩成 JPEG——虽然损失了一些细节,但你认得出照片里的人,而且文件小了 90%。

效果:KV 缓存降为原来的 1/16。 同样的显存,可以服务 16 倍的请求。这是 DeepSeek 第一次做出全球原创的技术贡献。后来 Kimi、Qwen 都用上了这个思路。
第三章
550 万美元的训练奇迹 DeepSeek-V3
2024.12671B MoEFP8

V2 有架构,但还差一样东西——规模。

2024 年底,DeepSeek 放了一个大招:DeepSeek-V3。671B 总参数,37B 激活。但这个模型最惊人的不是它有多大,而是它训练有多便宜。

数据
GPT-4 的训练成本是传闻中的 1 亿美元。V3 只用了 550 万美元。不是 550 亿,是 550 万。不到 GPT-4 的 5%。

怎么做到的?两个关键创新。

第一,FP8 训练——用 8 位精度代替 16 位。就像你用 MP3 代替 CD,音质差一点,但文件小了 50%,速度翻倍。

第二,MTP——多 token 预测——传统模型一次预测下一个词,V3 一次预测未来 2 个词。训练时效率更高,推理时还能用来做自我猜测加速。

但这还不是最精彩的部分。V3 真正让世界震惊的,是它之后发生的事情。
第四章
当模型学会自己思考 DeepSeek-R1
2025.01GRPOarXiv:2501.12948

2025 年 1 月,DeepSeek 发了一篇论文,让整个 AI 圈炸了。

标题很平淡:用强化学习激发大模型的推理能力。但内容很炸裂。他们做了一个实验:给 V3 的基础模型一堆数学题,然后说——你做吧,做对给分,做错扣分。但我不教你怎么想。

类比
想象一下,你让一个小孩做微积分。他不确定该怎么做。但每次做完,你只说对或错。几百次后,这个小孩自己学会了先求导数,再解方程——而且有些解法你都没教过他。

这就是 R1-Zero——纯强化学习,没有任何人类数据。训练过程中,发生了一件神奇的事:模型开始对自己说 wait。

[ 视觉:屏幕上出现模型的思考过程 ]
"5 x 7 = 35, step 2 check... wait, 35/5 = 7, 7 x 7 = 49... that can't be right"
—— 模型学会了自我验证,写到一半发现自己不对,然后回去重来

这就是那个著名的 Aha Moment。机器人学会反思了。

R1 的结果:AIME 数学竞赛 79.8%,超越 OpenAI o1。 每个问题的思考成本 0.002 美元——o1 的 20 分之一。然后 DeepSeek 把 R1 的推理能力蒸馏到小模型里。一个 1.5B 的模型(手机都能跑),数学能力超过了 GPT-4o。
R1 之后,所有人都在问同一个问题:DeepSeek 的下一步是什么?
第五章
1 万本书,同时读 DeepSeek-V4
2026.041.6T params1M context

2026 年 4 月,DeepSeek 发布了 V4。这一次,他们解决的是 LLM 最顽固的问题——上下文窗口。

大多数模型读到 5000 字以后,就开始忘记前面说了什么。这不是模型不聪明,是注意力机制的二次复杂度——你给模型读 10 倍的文字,它要多花 100 倍的计算。

类比
就像你让人同时读 10 本书,每本书要看前面所有的书。大脑会炸。

V4 的思路不是把注意力做得更强,而是放弃一个注意力搞定所有的想法。他们用了三套不同的注意力机制,各司其职。

滑动窗口
只看身边 128 个字
精细局部
稀疏注意力
每 4 个字压缩成 1 个再精读
中等粒度
重度压缩注意力
每 128 个字浓缩成 1 个
全局语义
类比特
这就像你读一本书:你不会一个字一个字地读全部,也不会只看标题。你会精读关键段落,扫读普通段落,偶尔翻翻目录保持全局感。V4 的混合注意力,就是做的这件事。

另外还有一个结构性的改进——mHC,就是我们之前说的那个路由器故事。不让信号随意放大,确保每一层的信息传递是稳定的。效果:信号只放大 1.6 倍(不是 3000 倍),模型训练再也不崩了。

V4 的成绩单:1.6T 参数,49B 激活。1M 上下文。KV 缓存只用标准方案的 2%。长上下文测试 92.9%,超越 Claude Opus 4.6。SWE-bench 80.8%。形式化数学 Putnam 满分 120/120。
第六章
像交电费一样用 AI V4 满血版
2026.07峰谷计价算电协同

2026 年 7 月 15 日,DeepSeek 发布了 V4 正式版——他们管它叫满血版。

同一天,他们宣布了一个全行业都没见过的新模式:峰谷计价。

数据
每天上午 9 点到 12 点,下午 2 点到 6 点——这 7 个小时,API 价格翻倍。剩下的 17 个小时,加上周末,维持原价。就像你家的峰谷电价一样。

你可能觉得,这不就是涨价吗?但 DeepSeek 的逻辑不是涨价,而是算电协同

GPU 集群跑起来,最大的成本不是显卡,是电。白天大家上班都在用,算力堵车,GPU 满负荷转,电费最贵。到了半夜,大多数人不调 API 了,集群空闲,电也便宜了。DeepSeek 的逻辑很简单:谁在高峰期占算力,谁多付钱。谁在低谷期用,谁享受优惠。

价格对比: V4 Pro 输出:平时每百万 token 6 元,高峰 12 元。V4 Flash 输出:平时 2 元,高峰 4 元。即使高峰翻倍,仍然是 OpenAI 同类价格的大约十六分之一。

这意味着什么?DeepSeek 正在从一个"科技公司的 AI 模型",变成一个像水、电、网络一样的基础设施。你不需要想"今天该不该用 AI",而是想"现在是峰时还是谷时"——就像你想洗衣服之前会看一眼电价时段一样。

与此同时,DeepSeek 还补上了最后一块拼图——多模态视觉能力。V4 现在能看懂图片了:识别物体、读取图表、分析截图、提取文档文字。他们用了一个叫 Visual Primitives 的技术,模型在思考时会直接标出物体的坐标,就像用手指指着说"看这里",而不是费力地用文字描述。

视觉效率:一张 800x800 的图片,只需约 90 个 KV 缓存条目。处理一张图片的成本,只有 Claude Opus 的大约一百七十分之一。Pixmo 计数测试 89.2%,超越 GPT-5.4。迷宫导航 66.9%。

而且还在继续进化。V4.1 已经在灰度测试,新增了音频输入和 MCP 协议支持。DeepSeek 正在从纯文本模型,变成一个能看、能听、能调工具的完整平台。Web 和 App 上这些视觉功能全部免费,不需要任何订阅。

这是国产大模型商业化进程中最标志性的一刻。不是因为技术有多领先,而是因为它第一次像电力公司一样思考自己的服务。
尾声
故事的启示

两年时间,从 V1 到 V4。DeepSeek 没有哪一项技术是天降神兵。MoE 不是他们发明的,注意力不是他们发明的,强化学习不是他们发明的。

但他们在每个关键节点上,都做对了选择:

V1 选了更细的专家粒度
V2 选了压缩 KV 缓存
V3 选了 FP8 和更低的训练成本
R1 选了让模型自己学会推理
V4 选了三条注意力道路同时走
V4 满血版选择了像电力公司一样定价

每一个选择,在当时看起来都像铤而走险。但放在一起,它们拼出了一条完整的路。

类比
就像盖房子,没有什么魔法砖头。但地基、框架、管道、电路,每一样都选对了,房子才能 100 年不倒。

这就叫系统级的创新——不是靠一个天才想法,而是靠一系列正确的工程决策累加起来。

这,就是 DeepSeek 的故事。


引用论文

[1] DeepSeek-MoE — Dai et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models. arXiv:2401.06066.

[2] DeepSeek-V2 / MLA — DeepSeek-AI (2024). DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model. arXiv:2405.04434.

[3] DeepSeek-V3 — DeepSeek-AI (2024). DeepSeek-V3 Technical Report. arXiv:2412.19437.

[4] DeepSeek-R1 — DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.

[5] DeepSeek-V3.2 / DSA — DeepSeek-AI (2025). DeepSeek-V3.2 Technical Report.

[6] mHC — Xie et al. (2025). mHC: Manifold-Constrained Hyper-Connections. arXiv:2512.24880.

[7] DeepSeek-V4 — DeepSeek-AI (2026). DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.

[8] GVR Sparse Attention — Cheng et al. (2026). Guess-Verify-Refine: Data-Aware Top-K for Sparse-Attention Decoding on Blackwell. arXiv:2604.22312.

[9] DeepSeek V4 Vision — DeepSeek-AI (2026). Visual Primitives: Teaching Models to Think by Pointing.


风格笔记:每个概念必有类比,每段先抛为什么再讲是什么,避免并列介绍改成因果链,关键数字用红色强调,有起伏有情感高点,用简单疑问句推进,收尾有沉淀。